DEV Community

Cover image for Gemini 4 Argon เทียบกับ GPT-6 Astra และ Claude Opus 5.5
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

Gemini 4 Argon เทียบกับ GPT-6 Astra และ Claude Opus 5.5

Gemini 4 Argon นำตารางเปรียบเทียบของ Google ใน 13 จาก 19 แถว เมื่อเทียบกับ GPT-6 Astra, Claude Opus 5.5 และ Claude Fable 5.1 แต่ประเด็นสำคัญกว่าคะแนนคือ: วันนี้คุณซื้อและเรียกใช้ Astra กับ Opus 5.5 ได้แล้ว ขณะที่ Argon ยังเปิดให้เฉพาะผู้เข้าร่วม Fairwind Program ของ Google เท่านั้น Argon มีราคาแนะนำ $2/$10 ต่อล้านโทเค็น และจะเป็น $4/$20 หลังจากนั้น ซึ่งเท่ากับราคา Claude Opus 5.5

ลองใช้ Apidog วันนี้

บทความนี้สรุปราคา ข้อจำกัด และผล benchmark ของทั้งสี่โมเดล พร้อมแนวทางเลือกโมเดลตามประเภทงาน และขั้นตอนทดสอบ GPT-6 Astra, Claude Opus 5.5 และ Gemini ด้วยพรอมต์จริงของคุณใน Apidog หากเพิ่งเริ่มศึกษา Argon ให้ดู Gemini 4 Argon คืออะไร และดูสถานะการเปิดตัวจากคู่มือกำหนดวันวางจำหน่าย Argon

ราคาและข้อจำกัดเคียงข้างกัน

Google เปรียบเทียบ Argon กับ Claude Fable 5.1 ด้วย ตารางด้านล่างใช้ราคาต่อ 1 ล้านโทเค็นจากโพสต์เปิดตัวของ Google, หน้าโมเดล GPT-6 Astra ของ OpenAI และหน้าราคาของ Anthropic

Gemini 4 Argon GPT-6 Astra Claude Opus 5.5 Claude Fable 5.1
วันนี้เรียกใช้ได้หรือไม่ ไม่, เฉพาะ Fairwind ใช่ ใช่ ใช่
รหัสโมเดล API ยังไม่เผยแพร่ gpt-6-astra claude-opus-5-5 claude-fable-5-1
อินพุต $2 ช่วงแนะนำ, จากนั้น $4 $10 $4 $10
แคชอินพุต $0.10 ช่วงแนะนำ, จากนั้น $0.20 $1 $0.20 $0.25
เอาต์พุต $10 ช่วงแนะนำ, จากนั้น $20 $50 $20 $50
เอาต์พุตสูงสุด 1 ล้าน (ตามที่ Google ระบุ) 128K 128K; 300K สำหรับ Batch รุ่นเบต้า 128K
หน้าต่างบริบท ยังไม่เผยแพร่ 1,050,000; อินพุตสูงสุด 922K 1 ล้าน 1 ล้าน
ค่าธรรมเนียมสำหรับพรอมต์ยาว ไม่ได้ระบุ อินพุตเกิน 272K: อินพุตและแคช 2 เท่า, เอาต์พุต 1.5 เท่า สำหรับคำขอทั้งหมด ไม่มี ไม่มี

ข้อสังเกตสำหรับการวางแผนต้นทุน:

  • ราคา Argon หลังช่วงแนะนำเท่ากับ Opus 5.5 ทั้งอินพุต แคช และเอาต์พุต
  • Astra และ Fable 5.1 มีราคาอินพุต/เอาต์พุต 2.5 เท่าของ Argon ในอัตราปกติ และ 5 เท่าของอัตราแนะนำ
  • Google ยังไม่ประกาศวันสิ้นสุดราคาแนะนำของ Argon
  • ตัวเลขเอาต์พุต 1 ล้านเป็นตัวเลขที่ Google ระบุ ขณะที่ Vals AI รายงานเอาต์พุตสูงสุด 262K สำหรับการตั้งค่า Argon ที่ทดสอบ

สำหรับตัวอย่างคำนวณต้นทุนต่อคำขอ ดูราคา Gemini 4 Argon

โมเดลใดนำในตารางของ Google

ก่อนใช้ผลลัพธ์ตัดสินใจ ต้องอ่านตัวเลขเป็น “สัญญาณ” ไม่ใช่ข้อสรุปเด็ดขาด: คะแนน Argon รายงานโดย Google ส่วนคะแนนคู่แข่งส่วนใหญ่มาจากผู้ให้บริการหรือ leaderboard สาธารณะ และชุดการทดสอบไม่เหมือนกัน

ผู้นำ เกณฑ์มาตรฐาน Argon Astra Fable 5.1 Opus 5.5
Argon: งานความรู้ Vals Index 68.9% 63.1% 65.8% 67.0%
Argon: งานความรู้ AutomationBench 51.3% 41.4% 31.4% 42.5%
Argon: งานความรู้ เกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey 19.6% 5.4% 6.7% 3.8%
Argon: การเขียนโค้ด DeepSWE v1.1 77.9% 74.1% 67.4% 74.2%
Argon: บริบทยาว GraphWalks 256K ถึง 1M (F1) 84.2% 71.8% 65.0% 66.8%
Argon: มัลติโมเดล LVBench 91.7% 87.5% 79.7% 83.7%
Argon: มัลติโมเดล Chartography 71.6% 71.0% 46.2% 66.3%
Astra FrontierSWE v2 55.0% 65.5% 56.3% 62.3%
Astra Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3%
Astra OSWorld-2.0 (ออฟไลน์, บางส่วน) 69.2% 72.6% ไม่ได้รายงาน ไม่ได้รายงาน
Opus 5.5 Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4%
Opus 5.5 PostTrainBench 45.3% 44.3% 40.2% 49.3%
เสมอ CWE-bench v1 68.0% 68.0% 58.0% 67.0%

Argon ยังนำใน Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks สูงสุด 128K และ Agent’s Last Exam

Claude Fable 5.1 ไม่ได้นำในแถวใดของตารางนี้ สำหรับ CWE-bench v1 Cyber leaderboard ของ DeepMind แสดงผลเสมอสามทางที่ 68% ระหว่าง Argon, Astra และ Grok 4.7 โดย Opus 5.5 อยู่ที่ 67%

เมื่อเทียบ Argon กับ Fable 5.1 โดยตรง Argon ทำคะแนนสูงกว่า 15 จาก 17 แถวที่ทั้งสองรุ่นมีตัวเลขรายงาน ส่วน Fable ชนะเล็กน้อยใน FrontierSWE v2 (56.3% เทียบกับ 55.0%) และ Terminal-bench 4.0 (57.9% เทียบกับ 57.4%) ดูตัวเลขของ Anthropic เพิ่มเติมได้ที่เกณฑ์มาตรฐาน Claude Fable 5.1 และดูตาราง 19 แถวฉบับเต็มได้ที่เกณฑ์มาตรฐาน Gemini 4 Argon

สามข้อควรระวังก่อนเชื่อความแตกต่างของคะแนน

1. คะแนนคู่แข่งไม่ใช่ผลทดสอบที่ Google รันทั้งหมด

เอกสารวิธีการของ Google ระบุว่าผลลัพธ์ของโมเดลที่ไม่ใช่ Gemini “มาจากตัวเลขที่ผู้ให้บริการรายงานเอง เว้นแต่จะระบุไว้เป็นอย่างอื่น” หลายแถวมาจาก leaderboard สาธารณะของ Vals AI, Proximal และ Surge

2. ชุดทดสอบและการตั้งค่าไม่เหมือนกัน

ตัวอย่างเช่น DeepSWE v1.1:

  • Google คำนวณ Argon ที่ 77.9% ด้วยชุดทดสอบ mini-swe-agent
  • คะแนน Astra มาจาก leaderboard สาธารณะ
  • คะแนน Anthropic มาจาก system cards

สำหรับ LVBench, Gemini สุ่มวิดีโอที่ 1 เฟรมต่อวินาที ขณะที่ Astra ใช้ 800 เฟรม, Opus 5.5 ใช้ 600 เฟรม และ Fable 5.1 ใช้ 300 เฟรม เนื่องจากข้อจำกัดของ API

3. โมเดลเดียวกันอาจมีหลายคะแนน

Terminal-bench 4.0 ของ Opus 5.5 เปลี่ยนไปตามชุดทดสอบและระดับความพยายาม Anthropic รายงาน 66.4% ที่ระดับความพยายาม xhigh ดังนั้นอย่านำคะแนนจากคนละแหล่ง คนละเวอร์ชัน หรือคนละ configuration มารวมเป็นตารางเดียวโดยไม่ระบุเงื่อนไข

สิ่งที่ผู้ประเมินภายนอกกล่าวถึง

Leaderboard อิสระให้ภาพที่ต่างออกไป:

  • Artificial Analysis จัด Argon อันดับ 8 จาก 223 รายการ แต่รายการแยกการตั้งค่า reasoning ออกเป็นคนละรายการ
  • เมื่อนับเฉพาะโมเดลที่แตกต่างกัน Argon ได้ 53 เท่ากับ GPT-6 Astra และ Claude Fable 5.1 ตามหลัง Opus 5.5 ที่ 58 และ Sonnet 5.5 ที่ 56
  • Artificial Analysis รายงานอัตราหลอนของ Argon บน AA-Omniscience ที่ 15% เทียบกับ Astra 51% ที่การตั้งค่าสูงสุด
  • บน Arena Argon อยู่อันดับหนึ่งด้าน Text ที่ 1525 คะแนน แต่มีสถานะ Preliminary จาก 4,942 คะแนนโหวต ขณะที่ Opus 5.5 อยู่อันดับสี่
  • Vals AI จัด Argon อันดับหนึ่งจาก 41 โมเดลใน Vals Index ซึ่งเป็น Gemini รุ่นแรกที่ขึ้นนำ

อย่างไรก็ตาม ผลใช้งานจริงอาจต่างจาก benchmark: Bloomberg รายงาน ว่าพนักงาน Google บางคนที่เข้าถึงโมเดลกล่าวว่า Argon ทำงานด้านการเขียนโค้ดและออกแบบ frontend บางงานได้ไม่น่าประทับใจเมื่อเทียบกับ benchmark ซึ่ง Google ระบุว่าคำอธิบายดังกล่าวไม่ถูกต้อง

ควรเลือกใช้โมเดลใด

อย่าเลือกจากคะแนนรวมเพียงตัวเดียว ให้ route ตามประเภทงาน ต้นทุน ความยาว context และข้อจำกัด output

งาน เส้นทางวันนี้ เมื่อ Argon พร้อมใช้งาน
ตัวแทนด้านกฎหมาย การเงิน และระบบอัตโนมัติในสำนักงาน Opus 5.5: Vals Index 67.0% ทดสอบ Argon เพราะนำในสี่แถวงานความรู้
ตัวแทนเขียนโค้ดที่เน้นเทอร์มินัล Opus 5.5: Terminal-bench 4.0 66.4% Opus 5.5 ยังนำ
วิศวกรรมซอฟต์แวร์แบบตัวแทน Astra: FrontierSWE v2 65.5% หรือ Opus 5.5 Argon นำ DeepSWE แต่ตาม FrontierSWE; ทดสอบทั้งคู่
ตัวแทนใช้งานคอมพิวเตอร์และ GUI Astra: OSWorld-2.0 72.6% Astra นำ OSWorld; Argon นำ Agent’s Last Exam
Reasoning กับพรอมต์เกิน 256K โทเค็น Opus 5.5 ไม่มีค่าธรรมเนียมเพิ่ม หรือ Astra ที่มีค่าธรรมเนียมเกิน 272K Argon: GraphWalks 256K ถึง 1M 84.2%
ความเข้าใจวิดีโอและแผนภูมิ Astra: LVBench 87.5% Argon 91.7% แต่ต้องควบคุมจำนวนเฟรมให้เท่ากัน
วิทยาศาสตร์และวิศวกรรม ML Astra สำหรับ Terminal-Bench Science; Opus 5.5 สำหรับ PostTrainBench Argon นำ LABBench 2 และ RiemannBench; ทดสอบจริง
การตอบกลับเดี่ยวเกิน 128K โทเค็น Opus 5.5 บน Batch: 300K รุ่นเบต้า Argon: สูงสุด 1 ล้านตามที่ Google ระบุ
งานปริมาณมากที่ไวต่อต้นทุน Opus 5.5: $4/$20 Argon: $2/$10 ตราบใดที่ราคาแนะนำยังอยู่

หากต้นทุนสำคัญกว่าคะแนนสูงสุด ดูการเปรียบเทียบ GPT-6 Sol เทียบกับ Claude Opus 5.5 สำหรับตัวเลือก OpenAI ที่ราคาต่ำกว่า

เปรียบเทียบทั้งสามด้วยพรอมต์ของคุณเอง

Benchmark ของผู้ขายตอบไม่ได้ว่าโมเดลใดเหมาะกับ schema, tool call, codebase หรือข้อกำหนด latency ของระบบคุณ วิธีที่ใช้งานได้จริงคือสร้าง evaluation ขนาดเล็กด้วยApidog

1. สร้างคำขอแยกตามผู้ให้บริการ

สร้างโปรเจกต์เดียวที่มีคำขอ 3 รายการ:

  1. GPT-6 Astra
  2. Claude Opus 5.5
  3. Gemini โดยใช้ตัวแปร {{GEMINI_MODEL}}

ตั้งค่า GEMINI_MODEL เป็น gemini-3.8-flash ชั่วคราว จนกว่า Google จะเปิดเผย model ID ของ Argon

ดูรูปแบบ API ของแต่ละผู้ให้บริการจากคู่มือ API ของ GPT-6 Astra และClaude Opus 5.5 คืออะไร

2. ใช้ environment variables สำหรับคีย์และพรอมต์

เก็บ API key ของแต่ละผู้ให้บริการเป็น environment variable และใช้ prompt variable เดียวกันในทุกคำขอ

OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...

GEMINI_MODEL=gemini-3.8-flash
PROMPT=สรุปข้อกำหนด API นี้เป็น JSON ตาม schema ที่ระบุ
Enter fullscreen mode Exit fullscreen mode

แนวทางนี้ช่วยให้ทั้งสามโมเดลรับอินพุตเดียวกัน และลดความผิดพลาดจากการแก้พรอมต์ไม่พร้อมกัน

3. เพิ่ม assertions ที่วัดผลได้

อย่างน้อยควรตรวจสอบ:

  • HTTP status เป็น 200
  • ฟิลด์คำตอบไม่ว่าง
  • JSON parse ได้ หากระบบต้องการ JSON
  • จำนวน output token ไม่เกินเพดาน
  • ค่าใช้จ่ายต่อคำขออยู่ภายใต้งบ
  • การเรียก tool หรือ function ตรงตาม schema ที่กำหนด

ตัวอย่าง pseudocode สำหรับตรวจงบประมาณ:

const inputTokens = 20000;
const outputTokens = 4000;

const inputPricePerMillion = 10;
const outputPricePerMillion = 50;

const estimatedCost =
  (inputTokens / 1_000_000) * inputPricePerMillion +
  (outputTokens / 1_000_000) * outputPricePerMillion;

if (estimatedCost > 0.5) {
  throw new Error(`เกินงบประมาณ: $${estimatedCost}`);
}
Enter fullscreen mode Exit fullscreen mode

4. รันเป็น test scenario เดียว

รันคำขอทั้งสามในสถานการณ์เดียวกัน แล้วเปรียบเทียบ:

  • คุณภาพคำตอบ
  • ความถูกต้องตาม schema
  • เวลา response
  • input/output tokens
  • ต้นทุนโดยประมาณ
  • ความเสถียรเมื่อรันซ้ำหลายครั้ง

อย่าทดสอบแค่พรอมต์เดียว ควรใช้ชุดพรอมต์ที่แทน workload จริง เช่น งานสรุปเอกสาร งานสร้างโค้ด งานแก้บั๊ก งาน tool use และงาน long-context

ตัวอย่างคำนวณต้นทุนต่อคำขอ

สำหรับคำขอที่มีอินพุต 20,000 โทเค็น และเอาต์พุต 4,000 โทเค็น:

GPT-6 Astra

อินพุต: 20,000 × $10 / 1,000,000 = $0.20
เอาต์พุต: 4,000 × $50 / 1,000,000 = $0.20
รวม: $0.40
Enter fullscreen mode Exit fullscreen mode

Claude Opus 5.5

อินพุต: 20,000 × $4 / 1,000,000 = $0.08
เอาต์พุต: 4,000 × $20 / 1,000,000 = $0.08
รวม: $0.16
Enter fullscreen mode Exit fullscreen mode

Gemini 4 Argon

ราคาแนะนำ: $0.08
ราคาปกติ: $0.16
Enter fullscreen mode Exit fullscreen mode

แต่ราคาต่อโทเค็นไม่ใช่ต้นทุนต่อภารกิจทั้งหมด Artificial Analysis วัดว่า Argon ใช้เอาต์พุตราว 62K โทเค็นต่อภารกิจ เทียบกับ Astra ราว 27K โทเค็นที่ระดับความพยายามสูงสุด ดังนั้นให้วัด output token จาก workload ของคุณเอง ไม่ใช่ตัดสินจากอัตราราคาเพียงอย่างเดียว

เมื่อ Argon ใช้งานได้ ให้เปลี่ยนค่า GEMINI_MODEL เป็น ID จริงของ Argon แล้วรัน test scenario เดิมอีกครั้ง คุณจะได้การเปรียบเทียบแบบ apples-to-apples กับ Astra และ Opus 5.5 ที่ใช้งานได้อยู่แล้ว

คำถามที่พบบ่อย

Gemini 4 Argon ดีกว่า GPT-6 Astra หรือไม่?

ทั้งคู่ได้ 53 บน Artificial Analysis ในตารางของ Google Argon ได้คะแนนสูงกว่าในแถวส่วนใหญ่ แต่ Astra ชนะ FrontierSWE v2, Terminal-Bench Science 0.1 และ OSWorld-2.0 ที่สำคัญ Astra เป็นรุ่นที่คุณเรียกใช้ได้วันนี้

Gemini 4 Argon เทียบกับ Claude Opus 5.5 รุ่นไหนดีกว่า?

ตารางของ Google ให้ Argon นำในแถวส่วนใหญ่ ขณะที่ Opus 5.5 ชนะ Terminal-bench 4.0 และ PostTrainBench Opus 5.5 ยังนำ Artificial Analysis ที่ 58 ต่อ 53 และราคา Argon หลังช่วงแนะนำจะเท่ากับ Opus 5.5

Gemini 4 Argon ถูกกว่า Claude Opus 5.5 หรือไม่?

ในช่วงราคาแนะนำ Argon ถูกกว่าครึ่งหนึ่ง: $2/$10 เทียบกับ $4/$20 หลังจากนั้นราคา Argon ที่ระบุจะเท่ากับ Opus 5.5 และ Google ยังไม่ประกาศวันสิ้นสุดช่วงแนะนำ

โมเดลใดมีขีดจำกัดเอาต์พุตสูงสุด?

Argon ระบุเอาต์พุตสูงสุด 1 ล้านโทเค็น แม้ Vals AI จะรายงาน 262K สำหรับ configuration ที่ทดสอบ โมเดลอื่นจำกัด synchronous output ที่ 128K ส่วน Opus 5.5 Batch รุ่นเบต้ารองรับ 300K ดูรายละเอียดผลกระทบต่อไคลเอ็นต์ได้ในคู่มือเอาต์พุต 1 ล้านโทเค็น

ฉันใช้ Gemini 4 Argon ได้วันนี้หรือไม่?

ได้เฉพาะผ่าน Fairwind Program ของ Google สำหรับกลุ่มพันธมิตรด้านการป้องกันภัยไซเบอร์ที่ผ่านการตรวจสอบ ลูกค้า API แบบชำระเงินและสมาชิก Google AI Ultra จะได้รับสิทธิ์ในลำดับถัดไป แต่ยังไม่มีการประกาศวัน

เลือกตาม workload แล้วทดสอบ

Argon ดูแข็งแกร่งในงานความรู้ บริบทยาว และงานมัลติโมเดล Astra เด่นใน FrontierSWE, Terminal-Bench Science และ OSWorld ส่วน Opus 5.5 เด่นในงานเทอร์มินัลและวิศวกรรม ML โดยมีราคาเท่ากับ Argon หลังช่วงแนะนำ

แนวทางที่นำไปใช้ได้ทันทีคือ:

  1. เริ่มจาก Astra หรือ Opus 5.5 ซึ่งเรียกใช้ได้แล้ว
  2. เก็บชื่อโมเดล Gemini ไว้ใน environment variable
  3. สร้างชุด prompt และ assertions ที่สะท้อน production workload
  4. บันทึกคุณภาพ latency token และต้นทุน
  5. รัน scenario เดิมซ้ำทันทีเมื่อ Argon เปิดให้ใช้งาน

หากต้องการตั้งค่าการเปรียบเทียบสามคำขอในโปรเจกต์เดียว ให้ดาวน์โหลด Apidog

Top comments (0)