DEV Community

Cover image for So sánh Gemini 4 Argon với GPT-6 Astra và Claude Opus 5.5
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

So sánh Gemini 4 Argon với GPT-6 Astra và Claude Opus 5.5

Gemini 4 Argon dẫn đầu 13 trong 19 hàng điểm chuẩn của Google khi so với GPT-6 Astra, Claude Opus 5.5 và Claude Fable 5.1. Tuy nhiên, yếu tố thực tế hơn điểm số là khả năng truy cập: bạn có thể mua Astra và Opus 5.5 ngay hôm nay, còn Argon hiện chỉ dành cho đối tác của Chương trình Fairwind. Giá giới thiệu của Argon là 2 USD đầu vào và 10 USD đầu ra cho mỗi triệu token; sau đó là 4 USD/20 USD — đúng bằng Claude Opus 5.5.

Dùng thử Apidog ngay hôm nay

Bài viết này so sánh giá, giới hạn và điểm chuẩn của bốn mô hình; đồng thời hướng dẫn cách chọn mô hình theo tác vụ và kiểm thử Astra, Opus 5.5 cùng Gemini trên prompt thực tế bằng Apidog. Nếu chưa quen với Argon, hãy đọc Gemini 4 Argon là gì và hướng dẫn ngày phát hành Argon.

Giá và giới hạn đặt cạnh nhau

Bảng của Google cũng bao gồm Claude Fable 5.1. Giá dưới đây tính trên 1 triệu token, theo bài đăng ra mắt của Google, trang mô hình GPT-6 Astra của OpenAI và trang giá của Anthropic.

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
Bạn có thể gọi ngay hôm nay? Không, chỉ Fairwind Có Có Có
ID mô hình API Chưa công bố gpt-6-astra claude-opus-5-5 claude-fable-5-1
Đầu vào 2 USD giới thiệu, sau đó 4 USD 10 USD 4 USD 10 USD
Đầu vào đã lưu vào bộ nhớ đệm 0,10 USD giới thiệu, sau đó 0,20 USD 1 USD 0,20 USD 0,25 USD
Đầu ra 10 USD giới thiệu, sau đó 20 USD 50 USD 20 USD 50 USD
Đầu ra tối đa 1 triệu, theo công bố Google 128 nghìn 128 nghìn; 300 nghìn trên Batch, beta 128 nghìn
Cửa sổ ngữ cảnh Chưa công bố 1.050.000; đầu vào tối đa 922 nghìn 1 triệu 1 triệu
Phụ phí prompt dài Chưa nêu Trên 272 nghìn token đầu vào: 2x đầu vào/bộ nhớ đệm, 1,5x đầu ra trên toàn bộ yêu cầu Không Không

Ba điểm cần lưu ý:

  1. Giá tiêu chuẩn của Argon bằng Opus 5.5. Mức 4 USD đầu vào và 20 USD đầu ra chỉ rẻ hơn Anthropic trong giai đoạn giới thiệu. Google chưa công bố ngày kết thúc giai đoạn này.
  2. Astra và Fable 5.1 đắt hơn đáng kể. Giá đầu vào và đầu ra tiêu chuẩn của hai mô hình này cao gấp 2,5 lần Argon; so với giá giới thiệu Argon, chênh lệch là 5 lần.
  3. Giới hạn đầu ra Argon cần được kiểm chứng thực tế. Google công bố mức 1 triệu token, nhưng Vals AI liệt kê 262 nghìn token cho cấu hình Argon mà họ đã thử nghiệm.

Để ước tính chi phí mỗi request, xem giá Gemini 4 Argon.

Mỗi mô hình dẫn đầu ở đâu trong bảng của Google

Trước khi dùng bảng này để ra quyết định, cần nhớ: đây là bảng do Google công bố. Điểm của Argon do Google báo cáo, một số do Google tự chạy và một số lấy từ leaderboard. Điểm của đối thủ chủ yếu đến từ nhà cung cấp hoặc bảng xếp hạng công khai, thường ở cấu hình lý luận tối đa.

Ai dẫn đầu Điểm chuẩn Argon Astra Fable 5.1 Opus 5.5
Argon: công việc tri thức Vals Index 68,9% 63,1% 65,8% 67,0%
Argon: công việc tri thức AutomationBench 51,3% 41,4% 31,4% 42,5%
Argon: công việc tri thức Harvey’s Legal Agent Benchmark 19,6% 5,4% 6,7% 3,8%
Argon: lập trình DeepSWE v1.1 77,9% 74,1% 67,4% 74,2%
Argon: ngữ cảnh dài GraphWalks 256K đến 1M, F1 84,2% 71,8% 65,0% 66,8%
Argon: đa phương thức LVBench 91,7% 87,5% 79,7% 83,7%
Argon: đa phương thức Chartography 71,6% 71,0% 46,2% 66,3%
Astra FrontierSWE v2 55,0% 65,5% 56,3% 62,3%
Astra Terminal-Bench Science 0.1 57,6% 68,1% 52,6% 63,3%
Astra OSWorld-2.0, ngoại tuyến, một phần 69,2% 72,6% Không báo cáo Không báo cáo
Opus 5.5 Terminal-bench 4.0 57,4% 58,2% 57,9% 66,4%
Opus 5.5 PostTrainBench 45,3% 44,3% 40,2% 49,3%
Hòa CWE-bench v1 68,0% 68,0% 58,0% 67,0%

Argon còn dẫn đầu ở Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks đến 128 nghìn token và Agent’s Last Exam. Fable 5.1 không đứng đầu ở hàng nào.

Trên CWE-bench v1, bảng xếp hạng an ninh mạng của DeepMind cho thấy Argon, Astra và Grok 4.7 cùng đạt 68%; Opus 5.5 đạt 67%.

So với Fable 5.1, Argon có điểm cao hơn ở 15 trong 17 hàng mà cả hai cùng báo cáo. Fable chỉ vượt Argon ở:

  • FrontierSWE v2: 56,3% so với 55,0%.
  • Terminal-bench 4.0: 57,9% so với 57,4%.

Xem thêm điểm chuẩn Claude Fable 5.1 và điểm chuẩn Gemini 4 Argon.

Ba lưu ý trước khi tin vào chênh lệch điểm số

1. Điểm của đối thủ không phải lúc nào cũng do Google chạy

Phương pháp luận của Google nêu rõ kết quả của các mô hình không phải Gemini chủ yếu được lấy từ số liệu tự báo cáo của nhà cung cấp, trừ khi có ghi chú khác. Một số hàng lấy từ leaderboard công khai của Vals AI, Proximal và Surge.

2. Thiết lập thử nghiệm khác nhau

Ví dụ, ở DeepSWE v1.1:

  • Google tự tính điểm 77,9% của Argon bằng hệ thống mini-swe-agent.
  • Điểm Astra lấy từ leaderboard công khai.
  • Điểm Anthropic lấy từ system card.

Ở LVBench, Gemini lấy mẫu video ở tốc độ 1 khung hình/giây; Astra sử dụng 800 khung hình, Opus 5.5 sử dụng 600 và Fable 5.1 sử dụng 300, do giới hạn API.

3. Một mô hình có thể có nhiều điểm khác nhau

Điểm Terminal-bench 4.0 của Opus 5.5 thay đổi theo harness thử nghiệm và mức nỗ lực. Anthropic báo cáo mức 66,4% ở cấu hình xhigh.

Quy tắc thực hành: không trộn điểm từ các nguồn, harness hoặc cấu hình khác nhau vào cùng một kết luận.

Đánh giá của bên thứ ba nói gì

Các leaderboard độc lập cho thấy khoảng cách giữa các mô hình hẹp hơn.

Artificial Analysis xếp Argon thứ 8 trong 223 cấu hình, trong đó mỗi cấu hình lý luận được tính riêng. Nếu gộp theo mô hình:

  • Argon: 53
  • GPT-6 Astra: 53
  • Claude Fable 5.1: 53
  • Claude Sonnet 5.5: 56
  • Claude Opus 5.5: 58 ở cấu hình tối đa

Artificial Analysis cũng đo tỷ lệ ảo giác của Argon trên AA-Omniscience là 15%, so với 51% của Astra ở cấu hình tối đa.

Trên Arena, Argon đứng đầu hạng mục Text với 1525 điểm, được đánh dấu là sơ bộ trên 4.942 phiếu bầu; Opus 5.5 đứng thứ tư. Vals AI xếp Argon đầu bảng trong 41 mô hình trên Vals Index.

Tuy nhiên, kết quả benchmark không thay thế hoàn toàn đánh giá sản phẩm. Bloomberg đưa tin một số nhân viên có quyền truy cập cho rằng Argon chưa ấn tượng ở một số tác vụ lập trình và thiết kế giao diện so với benchmark; Google gọi mô tả đó là không chính xác.

Định tuyến đến mô hình nào

Không có một mô hình tiên phong phù hợp cho mọi workload. Hãy chọn theo tác vụ, chi phí và giới hạn đầu ra.

Tác vụ Định tuyến hôm nay Khi Argon ra mắt
Đặc vụ pháp lý, tài chính, tự động hóa văn phòng Opus 5.5, 67,0% Vals Index Kiểm tra Argon vì mô hình này dẫn đầu bốn hàng công việc tri thức
Đặc vụ lập trình dùng terminal nhiều Opus 5.5, 66,4% Terminal-bench 4.0 Opus 5.5 vẫn dẫn đầu
Kỹ thuật phần mềm tác tử Astra, 65,5% FrontierSWE v2, hoặc Opus 5.5 Argon dẫn đầu DeepSWE nhưng thua FrontierSWE; hãy chạy cả hai
Đặc vụ dùng máy tính và GUI Astra, 72,6% OSWorld-2.0 Astra dẫn đầu OSWorld; Argon dẫn đầu Agent’s Last Exam
Lý luận trên prompt hơn 256 nghìn token Opus 5.5 vì không phụ phí, hoặc Astra nếu chấp nhận phụ phí Argon đạt 84,2% trên GraphWalks 256K đến 1M
Hiểu video và biểu đồ Astra, 87,5% LVBench Argon, 91,7%, nhưng cần lưu ý khác biệt số khung hình
Kỹ thuật khoa học và ML Astra cho Terminal-Bench Science; Opus 5.5 cho PostTrainBench Thử Argon vì mô hình này dẫn đầu LABBench 2 và RiemannBench
Một phản hồi dài hơn 128 nghìn token Opus 5.5 Batch, 300K, beta Argon, tối đa 1 triệu token theo công bố Google
Khối lượng lớn, nhạy cảm chi phí Opus 5.5, 4 USD/20 USD Argon, 2 USD/10 USD trong thời gian giới thiệu

Nếu chi phí quan trọng hơn benchmark cao nhất, hãy xem GPT-6 Sol so với Claude Opus 5.5, bài viết so sánh dòng Sol rẻ hơn của OpenAI với Opus.

So sánh các mô hình trên prompt của riêng bạn

Benchmark của nhà cung cấp không thể thay thế dữ liệu từ workload thực tế. Bạn có thể thiết lập một evaluation nhỏ trong Apidog để so sánh Astra, Opus 5.5 và Gemini.

Bước 1: Tạo ba request

Tạo một project với ba request:

  1. GPT-6 Astra.
  2. Claude Opus 5.5.
  3. Gemini, với trường model là {{GEMINI_MODEL}}.

Trong khi chờ Google công bố ID Argon, đặt:

GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Tham khảo hướng dẫn API GPT-6 Astra và Claude Opus 5.5 là gì để xem định dạng request của từng nhà cung cấp.

Bước 2: Dùng biến môi trường cho khóa và prompt

Lưu khóa API theo từng nhà cung cấp:

OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...
Enter fullscreen mode Exit fullscreen mode

Đặt prompt trong một biến chung để đảm bảo ba request nhận cùng đầu vào:

PROMPT=Phân tích repository này và đề xuất bản vá tối thiểu...
Enter fullscreen mode Exit fullscreen mode

Bước 3: Thêm assertions

Mỗi request nên kiểm tra tối thiểu:

  • HTTP status là 200.
  • Nội dung phản hồi không rỗng.
  • Số token đầu ra không vượt giới hạn.
  • Chi phí ước tính không vượt ngân sách.

Ví dụ logic kiểm tra:

assert(response.status === 200);
assert(response.body.output_text?.length > 0);
assert(response.body.usage.output_tokens < 8000);
Enter fullscreen mode Exit fullscreen mode

Bước 4: Chạy dưới dạng test scenario

Chạy cả ba request trong cùng một kịch bản kiểm thử, sau đó so sánh:

  • Chất lượng câu trả lời.
  • Tỷ lệ hoàn thành tác vụ.
  • Số token đầu vào và đầu ra.
  • Độ trễ.
  • Chi phí thực tế theo request.

Cách ước tính chi phí request

Với một request gồm 20.000 token đầu vào và 4.000 token đầu ra:

GPT-6 Astra

20.000 × 10 USD / 1.000.000 = 0,20 USD
4.000 × 50 USD / 1.000.000 = 0,20 USD
Tổng = 0,40 USD
Enter fullscreen mode Exit fullscreen mode

Claude Opus 5.5

20.000 × 4 USD / 1.000.000 = 0,08 USD
4.000 × 20 USD / 1.000.000 = 0,08 USD
Tổng = 0,16 USD
Enter fullscreen mode Exit fullscreen mode

Gemini 4 Argon

Giá giới thiệu: 0,08 USD
Giá tiêu chuẩn: 0,16 USD
Enter fullscreen mode Exit fullscreen mode

Giá token không đồng nghĩa chi phí mỗi tác vụ. Artificial Analysis đo Argon dùng khoảng 62 nghìn token đầu ra cho mỗi tác vụ, trong khi Astra ở mức nỗ lực tối đa dùng khoảng 27 nghìn. Vì vậy, hãy đo token và tỷ lệ hoàn thành trên prompt của chính bạn.

Khi Argon được mở API, chỉ cần thay đổi biến:

GEMINI_MODEL=<ID Argon do Google công bố>
Enter fullscreen mode Exit fullscreen mode

Sau đó chạy lại cùng test scenario để có so sánh công bằng với Astra và Opus 5.5.

Câu hỏi thường gặp

Gemini 4 Argon có tốt hơn GPT-6 Astra không?

Hai mô hình hòa ở mức 53 trên Artificial Analysis. Trong bảng của Google, Argon cao hơn ở phần lớn hàng; Astra thắng FrontierSWE v2, Terminal-Bench Science 0.1 và OSWorld-2.0. Astra cũng là mô hình bạn có thể gọi ngay hôm nay.

Gemini 4 Argon so với Claude Opus 5.5: mô hình nào tốt hơn?

Bảng của Google ưu ái Argon ở hầu hết hàng. Opus 5.5 thắng Terminal-bench 4.0 và PostTrainBench, đồng thời dẫn đầu Artificial Analysis với 58 so với 53. Ở giá tiêu chuẩn, hai mô hình có cùng mức giá.

Gemini 4 Argon có rẻ hơn Claude Opus 5.5 không?

Trong thời gian giới thiệu, Argon rẻ bằng một nửa: 2 USD/10 USD so với 4 USD/20 USD. Sau giai đoạn đó, giá niêm yết giống nhau; Google chưa công bố thời điểm kết thúc giá giới thiệu.

Mô hình nào có giới hạn đầu ra lớn nhất?

Argon, với mức công bố 1 triệu token đầu ra. Tuy nhiên, Vals AI liệt kê 262 nghìn token cho cấu hình họ thử nghiệm. Các mô hình còn lại có giới hạn đầu ra đồng bộ là 128 nghìn token. Xem hướng dẫn 1 triệu token đầu ra để biết tác động đến client.

Tôi có thể sử dụng Gemini 4 Argon ngay hôm nay không?

Chỉ thông qua Chương trình Fairwind của Google, dành cho một nhóm đối tác phòng thủ an ninh mạng đã được kiểm duyệt. Khách hàng API trả phí và người dùng Google AI Ultra sẽ có quyền truy cập sau, nhưng chưa có ngày cụ thể.

Chọn theo workload, sau đó kiểm tra

Argon có vẻ mạnh ở công việc tri thức, ngữ cảnh dài và đa phương thức. Astra dẫn đầu FrontierSWE, Terminal-Bench Science và OSWorld. Opus 5.5 nổi bật ở tác vụ terminal và kỹ thuật ML, với mức giá tương đương Argon sau giai đoạn giới thiệu.

Cách triển khai thực tế:

  1. Xây dựng trên Astra và Opus 5.5 vì chúng đã sẵn sàng qua API.
  2. Giữ model Gemini trong biến môi trường.
  3. Dùng cùng prompt, assertions và tiêu chí chấm điểm cho mọi model.
  4. Chạy lại suite khi Argon được mở truy cập.

Để thiết lập so sánh ba request trong một project, hãy tải Apidog.

Top comments (0)