Gemini 4 Argon dẫn đầu 13 trên 19 dòng trong bảng ra mắt của Google, hòa 1 dòng (CWE-bench v1 với GPT-6 Astra) và thua ở 5 dòng: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 và OSWorld-2.0. Điểm cần lưu ý là quyền truy cập: Argon hiện chỉ dành cho các đối tác thuộc Chương trình Fairwind, nên bên ngoài danh sách đối tác của Google và một số tổ chức đánh giá hiệu năng vẫn chưa thể tự chạy lại các con số này.
Bài viết này tổng hợp bảng điểm đầy đủ, nguồn đo lường của từng dòng, các điểm Argon thua, kết quả an ninh mạng, bảng điểm bên thứ ba và quy trình chuẩn bị benchmark riêng trong Apidog trước khi quyền truy cập được mở. Để xem tổng quan mô hình, hãy bắt đầu với Gemini 4 Argon là gì. Nếu cần so sánh để ra quyết định sử dụng, xem Argon so với GPT-6 Astra so với Claude Opus 5.5.
Bảng điểm đầy đủ và nguồn đo lường
Đây là các kết quả Google báo cáo trong bài đăng ra mắt và tài liệu phương pháp đánh giá, với tiêu đề “kết quả tính đến tháng 10 năm 2026”.
Google tự tính 10 trên 19 điểm số của Argon. Chín điểm còn lại đến từ bảng xếp hạng công khai. Điểm của đối thủ được lấy từ bảng xếp hạng, lần chạy của Google, thẻ hệ thống hoặc bài đăng của nhà cung cấp. In đậm là điểm dẫn đầu mỗi dòng.
| Tiêu chuẩn | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Ai đã đo lường |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | Bảng xếp hạng Zapier, bộ dữ liệu riêng tư |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon tự tính; bảng xếp hạng Astra; thẻ hệ thống Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | Bảng xếp hạng Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon tự tính; bảng xếp hạng đối thủ |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | Google tự tính cho tất cả mô hình |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon tự tính; bảng xếp hạng đối thủ |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | Google tự tính cho tất cả mô hình |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | Bảng xếp hạng Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | Google tự tính cho tất cả mô hình |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | Google tự tính cho tất cả mô hình |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon tự tính; bảng xếp hạng đối thủ |
| OSWorld-2.0, offline | 69.2% | 72.6% | n/r | n/r | Argon tự tính; Astra từ bài đăng OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | Bảng xếp hạng Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | Google tự tính cho tất cả mô hình |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | Bảng xếp hạng công khai |
n/r = không báo cáo.
Grok 4.7 không xuất hiện trong bảng của Google, nhưng cũng đạt 68% trên bảng xếp hạng CWE-bench. Vì vậy, CWE-bench v1 là trận hòa ba bên giữa Argon, Astra và Grok 4.7.
Nếu nhóm theo nguồn:
-
9 dòng đến từ bảng xếp hạng công khai cho mọi mô hình: Vals AI, Zapier, Proximal, Surge và CWE-bench.
- Argon dẫn đầu 7 dòng và hòa 1 dòng.
-
5 dòng do Google tự chạy cho cả bốn mô hình.
- Argon dẫn đầu 4 dòng.
-
5 dòng còn lại ghép điểm Argon do Google chạy với điểm đối thủ lấy từ nguồn khác.
- Argon thua 3 trong 5 dòng thuộc nhóm này.
Điểm này quan trọng khi đọc bảng: nếu việc tự chạy benchmark tạo ưu thế rõ rệt cho Argon, bạn sẽ kỳ vọng Argon thắng nhiều hơn ở nhóm do Google tự tính. Dữ liệu công bố không cho thấy mô hình đó.
5 điểm Argon thua và tác động tới lập trình tác nhân
Các benchmark tổng quát không thay thế được benchmark cho workload thực tế. Nếu bạn xây dựng coding agent, đặc biệt agent dùng terminal hoặc làm việc trên repository lớn, hãy ưu tiên các dòng sau.
- FrontierSWE v2: Argon đạt 55.0%, thấp hơn GPT-6 Astra ở 65.5%. Argon đứng cuối trong bốn mô hình, sau Fable 5.1 (56.3%) và Opus 5.5 (62.3%), trên bảng xếp hạng chấm điểm tất cả mô hình.
- Terminal-bench 4.0: Argon đạt 57.4%, thấp hơn Claude Opus 5.5 ở 66.4%. Argon tiếp tục đứng cuối; Astra và Fable 5.1 chỉ chênh nhau khoảng một điểm.
- PostTrainBench: Argon đạt 45.3%, thấp hơn Opus 5.5 ở 49.3%. Đây là dòng Google tự chạy cho tất cả mô hình.
- Terminal-Bench Science 0.1: Argon đạt 57.6%, thấp hơn Astra ở 68.1%. Google chạy Argon với thời gian chờ xác minh dài gấp 6 lần.
- OSWorld-2.0, tập hợp offline: Argon đạt 69.2%, thấp hơn Astra ở 72.6%. Anthropic chỉ báo cáo điểm tổng hợp online và offline nên không có điểm Claude riêng trên dòng này.
Với lập trình tác nhân, kết quả đang chia đều:
- Argon thắng trên DeepSWE v1.1 và Vibe Code Bench.
- Argon thua trên FrontierSWE v2 và Terminal-bench 4.0.
Cần đọc kỹ cách đo DeepSWE v1.1: Argon dùng công cụ đánh giá tác nhân mini-swe; Astra lấy điểm từ bảng xếp hạng công khai; Claude lấy điểm từ thẻ hệ thống. Vibe Code Bench dễ đối chiếu hơn vì Vals AI chấm cả bốn mô hình, nhưng chênh lệch Argon so với Astra chỉ là 1.6 điểm.
Nếu workload của bạn là tác vụ terminal dài, sửa lỗi repository hoặc chuỗi thao tác phụ thuộc trạng thái, hãy đánh trọng số cao hơn cho FrontierSWE v2 và Terminal-bench 4.0 thay vì chỉ dựa vào tổng số chiến thắng. Astra vẫn dẫn đầu FrontierSWE; xem trải nghiệm thực tế GPT-6 Astra để biết cách mô hình này hoạt động trong sử dụng hiện nay. Về Anthropic, phân tích benchmark Claude Fable 5.1 có các số liệu ra mắt của Fable.
Bloomberg đưa tin một số nhân viên Google ẩn danh có quyền truy cập cho rằng Argon chưa gây ấn tượng ở một số tác vụ lập trình và thiết kế giao diện người dùng so với điểm benchmark. Google gọi mô tả này là không chính xác.
Cảnh báo phương pháp luận cần kiểm tra trước khi so sánh
Khi áp dụng benchmark vào lựa chọn model cho sản phẩm, không chỉ so sánh phần trăm. Hãy kiểm tra cấu hình chạy, budget token, thời gian timeout và dữ liệu đầu vào.
- Cả hai phía đều chạy nỗ lực tối đa. Argon chạy bằng Gemini API với cài đặt suy nghĩ cao nhất. Với Astra, Fable 5.1 và Opus 5.5, Google dùng cài đặt suy nghĩ/lý luận tối đa hiện có. Đây là so sánh giới hạn trên, không phản ánh chi phí, độ trễ hoặc hành vi cấu hình mặc định.
- LVBench dùng số lượng frame khác nhau. Google tự chạy LVBench cho cả bốn model. Gemini lấy mẫu video ở 1 FPS; Astra nhận 800 frame, Fable 5.1 nhận 300 frame và Opus 5.5 nhận 600 frame do giới hạn API. Các model không nhận đầu vào giống hệt nhau.
- OSWorld lấy kết quả tốt nhất trong ba lần chạy. Điểm Argon được “tối đa hóa qua 3 lần chạy với một lần thử cho mỗi lần chạy”. Đây là lần chạy tốt nhất, không phải điểm trung bình.
- Agent’s Last Exam có cửa sổ chạy dài. Argon chạy bằng evaluator ALE-Claw với cửa sổ 5 giờ.
- Bộ lọc an toàn được bật. Agent’s Last Exam và OSWorld chạy với safety filter bật; các phản hồi bị gắn cờ được trả về dưới dạng chuỗi rỗng. Nếu có ảnh hưởng, điều này làm giảm điểm Argon.
Kết quả an ninh mạng từ DeepMind
Trang an ninh mạng của DeepMind công bố thêm bốn chỉ số ngoài bảng ra mắt.
| Đánh giá an ninh mạng | Gemini 4 Argon | So sánh |
|---|---|---|
| Phát hiện lỗ hổng thực tế | 85.8% | Gemini 3.8 Flash Cyber: 71.0% |
| Benchmark kiểm tra thâm nhập Wiz | 70.9% | Gemini 3.8 Flash Cyber: 58.2% |
| Tỷ lệ thành công tấn công Gray Swan IPI, k=15, thấp hơn là tốt hơn | 0.7% | Thấp nhất trên biểu đồ; Kimi K3 cao nhất ở 52.7% |
| CWE-bench v1 | 68% | Hòa với Grok 4.7 và GPT-6 Astra; Opus 5.5 đạt 67% |
Đánh giá phát hiện lỗ hổng dùng evaluator Antigravity nội bộ, được mô tả là “không chuyên về an ninh mạng”, với quyền truy cập mã nguồn. Bài kiểm tra Wiz chỉ cho model truy cập website đang chạy và hành vi công khai, không có mã nguồn ứng dụng.
Hai so sánh chính đều đặt Argon cạnh mô hình an ninh mạng trước đây của Google, không phải đối thủ trực tiếp. Xem giải thích về khả năng phòng thủ an ninh mạng của Argon để đánh giá ý nghĩa của các kết quả này với API bạn vận hành.
Bảng điểm từ bên thứ ba
Một số tổ chức đã công bố điểm trong vài phút sau khi ra mắt, cho thấy họ có quyền truy cập trước khi phát hành công khai.
- Artificial Analysis liệt kê Gemini 4 Argon ở cấu hình Cao với Intelligence Index là 53, xếp #8 trong 223. Bảng này tính từng cấu hình reasoning riêng biệt. Nếu so từng model, Argon hòa Fable 5.1 và GPT-6 Astra, đứng sau Opus 5.5 (tối đa 58) và Sonnet 5.5 (tối đa 56). Artificial Analysis báo cáo tỷ lệ ảo giác 15% trên AA-Omniscience, trong khi Astra tối đa đạt 51%; độ chính xác là 50% so với 63%. Chạy benchmark này tốn 1.99 USD mỗi tác vụ; Argon dùng khoảng 62K output token mỗi tác vụ, so với khoảng 27K của Astra tối đa. Artificial Analysis chưa hiển thị dữ liệu tốc độ hoặc độ trễ.
- Vals AI xếp Argon ở 68.90% trên Vals Index, #1 trong 41 model và là model Gemini đầu tiên dẫn đầu; chi phí là 15.68 USD mỗi thử nghiệm. Vals AI liệt kê output tối đa 262K cho cấu hình đã thử nghiệm, thấp hơn mức 1M mà Google nêu.
- Arena xếp Argon #1 về Văn bản với 1525 Elo, được đánh dấu sơ bộ dựa trên 4,942 phiếu bầu, và #8 về WebDev.
Vì sao có nguồn nói 12, 13 hoặc 14 chiến thắng?
Các con số khác nhau thường đến từ cách chọn đối thủ để so sánh. Thống kê lại toàn bộ 19 dòng của Google cho kết quả sau:
| Cách đếm | Argon thắng | Hòa | Argon thua | Không báo cáo |
|---|---|---|---|---|
| Tốt nhất trong ba đối thủ | 13 | 1 | 5 | 0 |
| Chỉ so với GPT-6 Astra | 14 | 1 | 4 | 0 |
| Chỉ so với Claude Opus 5.5 | 14 | 0 | 4 | 1 |
| Chỉ so với Claude Fable 5.1 | 15 | 0 | 2 | 2 |
Do đó:
- 13 chiến thắng là đúng nếu Argon phải vượt qua toàn bộ đối thủ có điểm trên từng dòng.
- 14 chiến thắng là đúng trong đối đầu trực tiếp với Astra hoặc Opus 5.5.
- 12 chiến thắng không khớp với các cách đếm trên toàn bộ 19 dòng; hãy kiểm tra nguồn đó đã loại hoặc gộp benchmark nào.
Ngoài số trận thắng, biên độ cũng rất khác nhau. Harvey Legal Agent chênh 19.6% so với 6.7%, trong khi Chartography chỉ chênh 0.6 điểm.
Cách chuẩn bị benchmark riêng trước ngày Argon mở quyền truy cập
Benchmark công khai mô tả evaluator của Google. Benchmark của bạn phải mô tả workload và tiêu chí thành công của sản phẩm.
Hãy xây dựng bộ test trên một model đang gọi được ngay bây giờ, sau đó chuyển sang Argon bằng một thay đổi biến môi trường khi model ID được công bố.
1. Chọn prompt từ workload thật
Ưu tiên các tác vụ tương ứng với rủi ro kỹ thuật của bạn:
- Sửa lỗi trong repository.
- Thực thi tác vụ terminal nhiều bước.
- Truy vấn tài liệu dài.
- Tạo hoặc sửa API client.
- Phân tích log lỗi.
- Sinh payload API theo schema.
- Viết migration hoặc test case.
Không bắt đầu bằng prompt demo quá ngắn. Mỗi test nên có đầu vào, tiêu chí thành công và giới hạn chi phí rõ ràng.
2. Tạo environment trong Apidog
Trong Apidog, tạo environment với các biến:
GEMINI_API_KEY=your_api_key
GEMINI_MODEL=gemini-3.8-flash
Google chưa công bố model ID của Argon. Vì vậy, GEMINI_MODEL nên là biến duy nhất bạn cần thay đổi khi quyền truy cập mở.
3. Lưu request dùng biến model
Ví dụ request theo kiểu Gemini API:
POST https://generativelanguage.googleapis.com/v1beta/models/{{GEMINI_MODEL}}:generateContent?key={{GEMINI_API_KEY}}
Content-Type: application/json
{
"contents": [
{
"role": "user",
"parts": [
{
"text": "Phân tích lỗi trong đoạn log sau, nêu nguyên nhân gốc và đề xuất các bước khắc phục có thể thực hiện được: {{LOG_INPUT}}"
}
]
}
]
}
Nhóm các request theo kịch bản, chẳng hạn:
coding-agent/
01-understand-repository
02-fix-failing-test
03-run-terminal-task
04-review-patch
4. Thêm assertion cho đầu ra và usage metadata
Không chỉ kiểm tra HTTP 200. Hãy xác nhận các trường có ý nghĩa với sản phẩm:
- Có nội dung phản hồi.
- Có định dạng JSON hợp lệ nếu bạn yêu cầu structured output.
- Có các trường bắt buộc.
- Có từ khóa hoặc hành động kỳ vọng.
- Không vượt quá ngân sách token.
- Không vượt quá giới hạn chi phí của một tác vụ.
Ví dụ assertion logic:
pm.test("Phản hồi thành công", function () {
pm.response.to.have.status(200);
});
const body = pm.response.json();
pm.test("Có nội dung sinh", function () {
const text = body.candidates?.[0]?.content?.parts?.[0]?.text;
pm.expect(text).to.be.a("string").and.not.empty;
});
pm.test("Không vượt ngân sách reasoning token", function () {
const thoughtTokens = body.usageMetadata?.thoughtsTokenCount || 0;
pm.expect(thoughtTokens).to.be.below(50000);
});
Ngưỡng thoughtsTokenCount cần được đặt theo budget thực tế của bạn, không theo mức tối đa mà benchmark của nhà cung cấp sử dụng.
5. Chạy baseline trên Gemini 3.8 Flash
Chạy toàn bộ kịch bản trên gemini-3.8-flash ngay bây giờ và lưu lại:
- Tỷ lệ thành công.
- Thời gian phản hồi.
- Số token đầu vào và đầu ra.
- Token suy nghĩ, nếu API trả về.
- Chi phí mỗi tác vụ.
- Các lỗi lặp lại.
- Chất lượng đầu ra theo tiêu chí review của nhóm.
Lưu báo cáo baseline. Đây là dữ liệu để bạn biết Argon cải thiện hay làm giảm chất lượng ở workload của chính bạn.
6. Đổi model ID khi Argon được phát hành
Khi Google công bố model ID, chỉ cần cập nhật:
GEMINI_MODEL=gemini-4-argon
Sau đó chạy lại cùng kịch bản, cùng input và cùng assertion. Google nói rằng “tất cả các model mới” sẽ ra mắt trên API Interactions, vì vậy nên lưu thêm một phiên bản Interactions của mỗi request.
Để chuẩn bị baseline phù hợp, xem so sánh Argon với Gemini 3.8 Flash, bao gồm kỳ vọng về giá và giới hạn.
Câu hỏi thường gặp
Các benchmark Gemini 4 Argon có được xác minh độc lập không?
Một phần. Chín trong 19 dòng đến từ bảng xếp hạng công khai chấm mọi model. Artificial Analysis, Vals AI và Arena cũng đã công bố kết quả riêng. Các dòng còn lại do Google thực hiện cho Argon.
Điểm DeepSWE của Gemini 4 Argon là bao nhiêu?
Argon đạt 77.9% trên DeepSWE v1.1, cao hơn Opus 5.5 ở 74.2% và Astra ở 74.1%. Tuy nhiên, lần chạy Argon dùng evaluator tác nhân mini-swe, còn điểm đối thủ đến từ bảng xếp hạng và thẻ hệ thống.
Argon có đánh bại GPT-6 Astra trên benchmark không?
Trong đối đầu trực tiếp theo bảng Google, Argon thắng 14 dòng, hòa 1 và thua 4. Trên Artificial Analysis, hai model hòa ở mức Intelligence Index 53.
Tôi có thể tự chạy lại các benchmark này không?
Chưa. Argon hiện bị giới hạn cho đối tác Fairwind và Google chưa công bố ngày phát hành công khai. Công cụ theo dõi ngày phát hành Argon theo dõi quá trình triển khai.
Bước tiếp theo
Đừng chờ benchmark công khai để quyết định model cho sản phẩm. Hãy xây dựng kịch bản từ workload thật, chạy baseline trên Gemini 3.8 Flash và lưu báo cáo.
Khi Argon ra mắt, bạn chỉ cần thay đổi GEMINI_MODEL, chạy lại cùng bộ test và so sánh trực tiếp về chất lượng, token, chi phí và độ trễ.
Tải xuống Apidog để bắt đầu thiết lập kịch bản kiểm thử.
Top comments (0)