DEV Community

Cover image for Gemini 4 Argon: Đánh giá 19 hạng mục, cách Google chạy và 5 điểm thua kém
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Gemini 4 Argon: Đánh giá 19 hạng mục, cách Google chạy và 5 điểm thua kém

Gemini 4 Argon dẫn đầu 13 trên 19 dòng trong bảng ra mắt của Google, hòa 1 dòng (CWE-bench v1 với GPT-6 Astra) và thua ở 5 dòng: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 và OSWorld-2.0. Điểm cần lưu ý là quyền truy cập: Argon hiện chỉ dành cho các đối tác thuộc Chương trình Fairwind, nên bên ngoài danh sách đối tác của Google và một số tổ chức đánh giá hiệu năng vẫn chưa thể tự chạy lại các con số này.

Dùng thử Apidog ngay hôm nay

Bài viết này tổng hợp bảng điểm đầy đủ, nguồn đo lường của từng dòng, các điểm Argon thua, kết quả an ninh mạng, bảng điểm bên thứ ba và quy trình chuẩn bị benchmark riêng trong Apidog trước khi quyền truy cập được mở. Để xem tổng quan mô hình, hãy bắt đầu với Gemini 4 Argon là gì. Nếu cần so sánh để ra quyết định sử dụng, xem Argon so với GPT-6 Astra so với Claude Opus 5.5.

Bảng điểm đầy đủ và nguồn đo lường

Đây là các kết quả Google báo cáo trong bài đăng ra mắt và tài liệu phương pháp đánh giá, với tiêu đề “kết quả tính đến tháng 10 năm 2026”.

Google tự tính 10 trên 19 điểm số của Argon. Chín điểm còn lại đến từ bảng xếp hạng công khai. Điểm của đối thủ được lấy từ bảng xếp hạng, lần chạy của Google, thẻ hệ thống hoặc bài đăng của nhà cung cấp. In đậm là điểm dẫn đầu mỗi dòng.

Tiêu chuẩn Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Ai đã đo lường
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% Bảng xếp hạng Zapier, bộ dữ liệu riêng tư
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon tự tính; bảng xếp hạng Astra; thẻ hệ thống Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% Bảng xếp hạng Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon tự tính; bảng xếp hạng đối thủ
PostTrainBench 45.3% 44.3% 40.2% 49.3% Google tự tính cho tất cả mô hình
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon tự tính; bảng xếp hạng đối thủ
LABBench 2 88.8% 85.4% 68.6% 73.1% Google tự tính cho tất cả mô hình
RiemannBench 76.0% 72.0% 65.6% 69.6% Bảng xếp hạng Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% Google tự tính cho tất cả mô hình
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% Google tự tính cho tất cả mô hình
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon tự tính; bảng xếp hạng đối thủ
OSWorld-2.0, offline 69.2% 72.6% n/r n/r Argon tự tính; Astra từ bài đăng OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% Bảng xếp hạng Surge
LVBench 91.7% 87.5% 79.7% 83.7% Google tự tính cho tất cả mô hình
CWE-bench v1 68.0% 68.0% 58.0% 67.0% Bảng xếp hạng công khai

n/r = không báo cáo.

Grok 4.7 không xuất hiện trong bảng của Google, nhưng cũng đạt 68% trên bảng xếp hạng CWE-bench. Vì vậy, CWE-bench v1 là trận hòa ba bên giữa Argon, Astra và Grok 4.7.

Nếu nhóm theo nguồn:

  • 9 dòng đến từ bảng xếp hạng công khai cho mọi mô hình: Vals AI, Zapier, Proximal, Surge và CWE-bench.
    • Argon dẫn đầu 7 dòng và hòa 1 dòng.
  • 5 dòng do Google tự chạy cho cả bốn mô hình.
    • Argon dẫn đầu 4 dòng.
  • 5 dòng còn lại ghép điểm Argon do Google chạy với điểm đối thủ lấy từ nguồn khác.
    • Argon thua 3 trong 5 dòng thuộc nhóm này.

Điểm này quan trọng khi đọc bảng: nếu việc tự chạy benchmark tạo ưu thế rõ rệt cho Argon, bạn sẽ kỳ vọng Argon thắng nhiều hơn ở nhóm do Google tự tính. Dữ liệu công bố không cho thấy mô hình đó.

5 điểm Argon thua và tác động tới lập trình tác nhân

Các benchmark tổng quát không thay thế được benchmark cho workload thực tế. Nếu bạn xây dựng coding agent, đặc biệt agent dùng terminal hoặc làm việc trên repository lớn, hãy ưu tiên các dòng sau.

  • FrontierSWE v2: Argon đạt 55.0%, thấp hơn GPT-6 Astra ở 65.5%. Argon đứng cuối trong bốn mô hình, sau Fable 5.1 (56.3%) và Opus 5.5 (62.3%), trên bảng xếp hạng chấm điểm tất cả mô hình.
  • Terminal-bench 4.0: Argon đạt 57.4%, thấp hơn Claude Opus 5.5 ở 66.4%. Argon tiếp tục đứng cuối; Astra và Fable 5.1 chỉ chênh nhau khoảng một điểm.
  • PostTrainBench: Argon đạt 45.3%, thấp hơn Opus 5.5 ở 49.3%. Đây là dòng Google tự chạy cho tất cả mô hình.
  • Terminal-Bench Science 0.1: Argon đạt 57.6%, thấp hơn Astra ở 68.1%. Google chạy Argon với thời gian chờ xác minh dài gấp 6 lần.
  • OSWorld-2.0, tập hợp offline: Argon đạt 69.2%, thấp hơn Astra ở 72.6%. Anthropic chỉ báo cáo điểm tổng hợp online và offline nên không có điểm Claude riêng trên dòng này.

Với lập trình tác nhân, kết quả đang chia đều:

  • Argon thắng trên DeepSWE v1.1 và Vibe Code Bench.
  • Argon thua trên FrontierSWE v2 và Terminal-bench 4.0.

Cần đọc kỹ cách đo DeepSWE v1.1: Argon dùng công cụ đánh giá tác nhân mini-swe; Astra lấy điểm từ bảng xếp hạng công khai; Claude lấy điểm từ thẻ hệ thống. Vibe Code Bench dễ đối chiếu hơn vì Vals AI chấm cả bốn mô hình, nhưng chênh lệch Argon so với Astra chỉ là 1.6 điểm.

Nếu workload của bạn là tác vụ terminal dài, sửa lỗi repository hoặc chuỗi thao tác phụ thuộc trạng thái, hãy đánh trọng số cao hơn cho FrontierSWE v2 và Terminal-bench 4.0 thay vì chỉ dựa vào tổng số chiến thắng. Astra vẫn dẫn đầu FrontierSWE; xem trải nghiệm thực tế GPT-6 Astra để biết cách mô hình này hoạt động trong sử dụng hiện nay. Về Anthropic, phân tích benchmark Claude Fable 5.1 có các số liệu ra mắt của Fable.

Bloomberg đưa tin một số nhân viên Google ẩn danh có quyền truy cập cho rằng Argon chưa gây ấn tượng ở một số tác vụ lập trình và thiết kế giao diện người dùng so với điểm benchmark. Google gọi mô tả này là không chính xác.

Cảnh báo phương pháp luận cần kiểm tra trước khi so sánh

Khi áp dụng benchmark vào lựa chọn model cho sản phẩm, không chỉ so sánh phần trăm. Hãy kiểm tra cấu hình chạy, budget token, thời gian timeout và dữ liệu đầu vào.

  • Cả hai phía đều chạy nỗ lực tối đa. Argon chạy bằng Gemini API với cài đặt suy nghĩ cao nhất. Với Astra, Fable 5.1 và Opus 5.5, Google dùng cài đặt suy nghĩ/lý luận tối đa hiện có. Đây là so sánh giới hạn trên, không phản ánh chi phí, độ trễ hoặc hành vi cấu hình mặc định.
  • LVBench dùng số lượng frame khác nhau. Google tự chạy LVBench cho cả bốn model. Gemini lấy mẫu video ở 1 FPS; Astra nhận 800 frame, Fable 5.1 nhận 300 frame và Opus 5.5 nhận 600 frame do giới hạn API. Các model không nhận đầu vào giống hệt nhau.
  • OSWorld lấy kết quả tốt nhất trong ba lần chạy. Điểm Argon được “tối đa hóa qua 3 lần chạy với một lần thử cho mỗi lần chạy”. Đây là lần chạy tốt nhất, không phải điểm trung bình.
  • Agent’s Last Exam có cửa sổ chạy dài. Argon chạy bằng evaluator ALE-Claw với cửa sổ 5 giờ.
  • Bộ lọc an toàn được bật. Agent’s Last Exam và OSWorld chạy với safety filter bật; các phản hồi bị gắn cờ được trả về dưới dạng chuỗi rỗng. Nếu có ảnh hưởng, điều này làm giảm điểm Argon.

Kết quả an ninh mạng từ DeepMind

Trang an ninh mạng của DeepMind công bố thêm bốn chỉ số ngoài bảng ra mắt.

Đánh giá an ninh mạng Gemini 4 Argon So sánh
Phát hiện lỗ hổng thực tế 85.8% Gemini 3.8 Flash Cyber: 71.0%
Benchmark kiểm tra thâm nhập Wiz 70.9% Gemini 3.8 Flash Cyber: 58.2%
Tỷ lệ thành công tấn công Gray Swan IPI, k=15, thấp hơn là tốt hơn 0.7% Thấp nhất trên biểu đồ; Kimi K3 cao nhất ở 52.7%
CWE-bench v1 68% Hòa với Grok 4.7 và GPT-6 Astra; Opus 5.5 đạt 67%

Đánh giá phát hiện lỗ hổng dùng evaluator Antigravity nội bộ, được mô tả là “không chuyên về an ninh mạng”, với quyền truy cập mã nguồn. Bài kiểm tra Wiz chỉ cho model truy cập website đang chạy và hành vi công khai, không có mã nguồn ứng dụng.

Hai so sánh chính đều đặt Argon cạnh mô hình an ninh mạng trước đây của Google, không phải đối thủ trực tiếp. Xem giải thích về khả năng phòng thủ an ninh mạng của Argon để đánh giá ý nghĩa của các kết quả này với API bạn vận hành.

Bảng điểm từ bên thứ ba

Một số tổ chức đã công bố điểm trong vài phút sau khi ra mắt, cho thấy họ có quyền truy cập trước khi phát hành công khai.

  • Artificial Analysis liệt kê Gemini 4 Argon ở cấu hình Cao với Intelligence Index là 53, xếp #8 trong 223. Bảng này tính từng cấu hình reasoning riêng biệt. Nếu so từng model, Argon hòa Fable 5.1 và GPT-6 Astra, đứng sau Opus 5.5 (tối đa 58) và Sonnet 5.5 (tối đa 56). Artificial Analysis báo cáo tỷ lệ ảo giác 15% trên AA-Omniscience, trong khi Astra tối đa đạt 51%; độ chính xác là 50% so với 63%. Chạy benchmark này tốn 1.99 USD mỗi tác vụ; Argon dùng khoảng 62K output token mỗi tác vụ, so với khoảng 27K của Astra tối đa. Artificial Analysis chưa hiển thị dữ liệu tốc độ hoặc độ trễ.
  • Vals AI xếp Argon ở 68.90% trên Vals Index, #1 trong 41 model và là model Gemini đầu tiên dẫn đầu; chi phí là 15.68 USD mỗi thử nghiệm. Vals AI liệt kê output tối đa 262K cho cấu hình đã thử nghiệm, thấp hơn mức 1M mà Google nêu.
  • Arena xếp Argon #1 về Văn bản với 1525 Elo, được đánh dấu sơ bộ dựa trên 4,942 phiếu bầu, và #8 về WebDev.

Vì sao có nguồn nói 12, 13 hoặc 14 chiến thắng?

Các con số khác nhau thường đến từ cách chọn đối thủ để so sánh. Thống kê lại toàn bộ 19 dòng của Google cho kết quả sau:

Cách đếm Argon thắng Hòa Argon thua Không báo cáo
Tốt nhất trong ba đối thủ 13 1 5 0
Chỉ so với GPT-6 Astra 14 1 4 0
Chỉ so với Claude Opus 5.5 14 0 4 1
Chỉ so với Claude Fable 5.1 15 0 2 2

Do đó:

  • 13 chiến thắng là đúng nếu Argon phải vượt qua toàn bộ đối thủ có điểm trên từng dòng.
  • 14 chiến thắng là đúng trong đối đầu trực tiếp với Astra hoặc Opus 5.5.
  • 12 chiến thắng không khớp với các cách đếm trên toàn bộ 19 dòng; hãy kiểm tra nguồn đó đã loại hoặc gộp benchmark nào.

Ngoài số trận thắng, biên độ cũng rất khác nhau. Harvey Legal Agent chênh 19.6% so với 6.7%, trong khi Chartography chỉ chênh 0.6 điểm.

Cách chuẩn bị benchmark riêng trước ngày Argon mở quyền truy cập

Benchmark công khai mô tả evaluator của Google. Benchmark của bạn phải mô tả workload và tiêu chí thành công của sản phẩm.

Hãy xây dựng bộ test trên một model đang gọi được ngay bây giờ, sau đó chuyển sang Argon bằng một thay đổi biến môi trường khi model ID được công bố.

1. Chọn prompt từ workload thật

Ưu tiên các tác vụ tương ứng với rủi ro kỹ thuật của bạn:

  • Sửa lỗi trong repository.
  • Thực thi tác vụ terminal nhiều bước.
  • Truy vấn tài liệu dài.
  • Tạo hoặc sửa API client.
  • Phân tích log lỗi.
  • Sinh payload API theo schema.
  • Viết migration hoặc test case.

Không bắt đầu bằng prompt demo quá ngắn. Mỗi test nên có đầu vào, tiêu chí thành công và giới hạn chi phí rõ ràng.

2. Tạo environment trong Apidog

Trong Apidog, tạo environment với các biến:

GEMINI_API_KEY=your_api_key
GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Google chưa công bố model ID của Argon. Vì vậy, GEMINI_MODEL nên là biến duy nhất bạn cần thay đổi khi quyền truy cập mở.

3. Lưu request dùng biến model

Ví dụ request theo kiểu Gemini API:

POST https://generativelanguage.googleapis.com/v1beta/models/{{GEMINI_MODEL}}:generateContent?key={{GEMINI_API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode
{
  "contents": [
    {
      "role": "user",
      "parts": [
        {
          "text": "Phân tích lỗi trong đoạn log sau, nêu nguyên nhân gốc và đề xuất các bước khắc phục có thể thực hiện được: {{LOG_INPUT}}"
        }
      ]
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Nhóm các request theo kịch bản, chẳng hạn:

coding-agent/
  01-understand-repository
  02-fix-failing-test
  03-run-terminal-task
  04-review-patch
Enter fullscreen mode Exit fullscreen mode

4. Thêm assertion cho đầu ra và usage metadata

Không chỉ kiểm tra HTTP 200. Hãy xác nhận các trường có ý nghĩa với sản phẩm:

  • Có nội dung phản hồi.
  • Có định dạng JSON hợp lệ nếu bạn yêu cầu structured output.
  • Có các trường bắt buộc.
  • Có từ khóa hoặc hành động kỳ vọng.
  • Không vượt quá ngân sách token.
  • Không vượt quá giới hạn chi phí của một tác vụ.

Ví dụ assertion logic:

pm.test("Phản hồi thành công", function () {
  pm.response.to.have.status(200);
});

const body = pm.response.json();

pm.test("Có nội dung sinh", function () {
  const text = body.candidates?.[0]?.content?.parts?.[0]?.text;
  pm.expect(text).to.be.a("string").and.not.empty;
});

pm.test("Không vượt ngân sách reasoning token", function () {
  const thoughtTokens = body.usageMetadata?.thoughtsTokenCount || 0;
  pm.expect(thoughtTokens).to.be.below(50000);
});
Enter fullscreen mode Exit fullscreen mode

Ngưỡng thoughtsTokenCount cần được đặt theo budget thực tế của bạn, không theo mức tối đa mà benchmark của nhà cung cấp sử dụng.

5. Chạy baseline trên Gemini 3.8 Flash

Chạy toàn bộ kịch bản trên gemini-3.8-flash ngay bây giờ và lưu lại:

  • Tỷ lệ thành công.
  • Thời gian phản hồi.
  • Số token đầu vào và đầu ra.
  • Token suy nghĩ, nếu API trả về.
  • Chi phí mỗi tác vụ.
  • Các lỗi lặp lại.
  • Chất lượng đầu ra theo tiêu chí review của nhóm.

Lưu báo cáo baseline. Đây là dữ liệu để bạn biết Argon cải thiện hay làm giảm chất lượng ở workload của chính bạn.

6. Đổi model ID khi Argon được phát hành

Khi Google công bố model ID, chỉ cần cập nhật:

GEMINI_MODEL=gemini-4-argon
Enter fullscreen mode Exit fullscreen mode

Sau đó chạy lại cùng kịch bản, cùng input và cùng assertion. Google nói rằng “tất cả các model mới” sẽ ra mắt trên API Interactions, vì vậy nên lưu thêm một phiên bản Interactions của mỗi request.

Để chuẩn bị baseline phù hợp, xem so sánh Argon với Gemini 3.8 Flash, bao gồm kỳ vọng về giá và giới hạn.

Câu hỏi thường gặp

Các benchmark Gemini 4 Argon có được xác minh độc lập không?

Một phần. Chín trong 19 dòng đến từ bảng xếp hạng công khai chấm mọi model. Artificial Analysis, Vals AI và Arena cũng đã công bố kết quả riêng. Các dòng còn lại do Google thực hiện cho Argon.

Điểm DeepSWE của Gemini 4 Argon là bao nhiêu?

Argon đạt 77.9% trên DeepSWE v1.1, cao hơn Opus 5.5 ở 74.2% và Astra ở 74.1%. Tuy nhiên, lần chạy Argon dùng evaluator tác nhân mini-swe, còn điểm đối thủ đến từ bảng xếp hạng và thẻ hệ thống.

Argon có đánh bại GPT-6 Astra trên benchmark không?

Trong đối đầu trực tiếp theo bảng Google, Argon thắng 14 dòng, hòa 1 và thua 4. Trên Artificial Analysis, hai model hòa ở mức Intelligence Index 53.

Tôi có thể tự chạy lại các benchmark này không?

Chưa. Argon hiện bị giới hạn cho đối tác Fairwind và Google chưa công bố ngày phát hành công khai. Công cụ theo dõi ngày phát hành Argon theo dõi quá trình triển khai.

Bước tiếp theo

Đừng chờ benchmark công khai để quyết định model cho sản phẩm. Hãy xây dựng kịch bản từ workload thật, chạy baseline trên Gemini 3.8 Flash và lưu báo cáo.

Khi Argon ra mắt, bạn chỉ cần thay đổi GEMINI_MODEL, chạy lại cùng bộ test và so sánh trực tiếp về chất lượng, token, chi phí và độ trễ.

Tải xuống Apidog để bắt đầu thiết lập kịch bản kiểm thử.

Top comments (0)