Gemini 4 Argon นำตารางเปรียบเทียบของ Google ใน 13 จาก 19 แถว เมื่อเทียบกับ GPT-6 Astra, Claude Opus 5.5 และ Claude Fable 5.1 แต่ประเด็นสำคัญกว่าคะแนนคือ: วันนี้คุณซื้อและเรียกใช้ Astra กับ Opus 5.5 ได้แล้ว ขณะที่ Argon ยังเปิดให้เฉพาะผู้เข้าร่วม Fairwind Program ของ Google เท่านั้น Argon มีราคาแนะนำ $2/$10 ต่อล้านโทเค็น และจะเป็น $4/$20 หลังจากนั้น ซึ่งเท่ากับราคา Claude Opus 5.5
บทความนี้สรุปราคา ข้อจำกัด และผล benchmark ของทั้งสี่โมเดล พร้อมแนวทางเลือกโมเดลตามประเภทงาน และขั้นตอนทดสอบ GPT-6 Astra, Claude Opus 5.5 และ Gemini ด้วยพรอมต์จริงของคุณใน Apidog หากเพิ่งเริ่มศึกษา Argon ให้ดู Gemini 4 Argon คืออะไร และดูสถานะการเปิดตัวจากคู่มือกำหนดวันวางจำหน่าย Argon
ราคาและข้อจำกัดเคียงข้างกัน
Google เปรียบเทียบ Argon กับ Claude Fable 5.1 ด้วย ตารางด้านล่างใช้ราคาต่อ 1 ล้านโทเค็นจากโพสต์เปิดตัวของ Google, หน้าโมเดล GPT-6 Astra ของ OpenAI และหน้าราคาของ Anthropic
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| วันนี้เรียกใช้ได้หรือไม่ | ไม่, เฉพาะ Fairwind | ใช่ | ใช่ | ใช่ |
| รหัสโมเดล API | ยังไม่เผยแพร่ | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| อินพุต | $2 ช่วงแนะนำ, จากนั้น $4 | $10 | $4 | $10 |
| แคชอินพุต | $0.10 ช่วงแนะนำ, จากนั้น $0.20 | $1 | $0.20 | $0.25 |
| เอาต์พุต | $10 ช่วงแนะนำ, จากนั้น $20 | $50 | $20 | $50 |
| เอาต์พุตสูงสุด | 1 ล้าน (ตามที่ Google ระบุ) | 128K | 128K; 300K สำหรับ Batch รุ่นเบต้า | 128K |
| หน้าต่างบริบท | ยังไม่เผยแพร่ | 1,050,000; อินพุตสูงสุด 922K | 1 ล้าน | 1 ล้าน |
| ค่าธรรมเนียมสำหรับพรอมต์ยาว | ไม่ได้ระบุ | อินพุตเกิน 272K: อินพุตและแคช 2 เท่า, เอาต์พุต 1.5 เท่า สำหรับคำขอทั้งหมด | ไม่มี | ไม่มี |
ข้อสังเกตสำหรับการวางแผนต้นทุน:
- ราคา Argon หลังช่วงแนะนำเท่ากับ Opus 5.5 ทั้งอินพุต แคช และเอาต์พุต
- Astra และ Fable 5.1 มีราคาอินพุต/เอาต์พุต 2.5 เท่าของ Argon ในอัตราปกติ และ 5 เท่าของอัตราแนะนำ
- Google ยังไม่ประกาศวันสิ้นสุดราคาแนะนำของ Argon
- ตัวเลขเอาต์พุต 1 ล้านเป็นตัวเลขที่ Google ระบุ ขณะที่ Vals AI รายงานเอาต์พุตสูงสุด 262K สำหรับการตั้งค่า Argon ที่ทดสอบ
สำหรับตัวอย่างคำนวณต้นทุนต่อคำขอ ดูราคา Gemini 4 Argon
โมเดลใดนำในตารางของ Google
ก่อนใช้ผลลัพธ์ตัดสินใจ ต้องอ่านตัวเลขเป็น “สัญญาณ” ไม่ใช่ข้อสรุปเด็ดขาด: คะแนน Argon รายงานโดย Google ส่วนคะแนนคู่แข่งส่วนใหญ่มาจากผู้ให้บริการหรือ leaderboard สาธารณะ และชุดการทดสอบไม่เหมือนกัน
| ผู้นำ | เกณฑ์มาตรฐาน | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: งานความรู้ | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: งานความรู้ | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: งานความรู้ | เกณฑ์มาตรฐานตัวแทนทางกฎหมายของ Harvey | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: การเขียนโค้ด | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: บริบทยาว | GraphWalks 256K ถึง 1M (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: มัลติโมเดล | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: มัลติโมเดล | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (ออฟไลน์, บางส่วน) | 69.2% | 72.6% | ไม่ได้รายงาน | ไม่ได้รายงาน |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| เสมอ | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Argon ยังนำใน Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks สูงสุด 128K และ Agent’s Last Exam
Claude Fable 5.1 ไม่ได้นำในแถวใดของตารางนี้ สำหรับ CWE-bench v1 Cyber leaderboard ของ DeepMind แสดงผลเสมอสามทางที่ 68% ระหว่าง Argon, Astra และ Grok 4.7 โดย Opus 5.5 อยู่ที่ 67%
เมื่อเทียบ Argon กับ Fable 5.1 โดยตรง Argon ทำคะแนนสูงกว่า 15 จาก 17 แถวที่ทั้งสองรุ่นมีตัวเลขรายงาน ส่วน Fable ชนะเล็กน้อยใน FrontierSWE v2 (56.3% เทียบกับ 55.0%) และ Terminal-bench 4.0 (57.9% เทียบกับ 57.4%) ดูตัวเลขของ Anthropic เพิ่มเติมได้ที่เกณฑ์มาตรฐาน Claude Fable 5.1 และดูตาราง 19 แถวฉบับเต็มได้ที่เกณฑ์มาตรฐาน Gemini 4 Argon
สามข้อควรระวังก่อนเชื่อความแตกต่างของคะแนน
1. คะแนนคู่แข่งไม่ใช่ผลทดสอบที่ Google รันทั้งหมด
เอกสารวิธีการของ Google ระบุว่าผลลัพธ์ของโมเดลที่ไม่ใช่ Gemini “มาจากตัวเลขที่ผู้ให้บริการรายงานเอง เว้นแต่จะระบุไว้เป็นอย่างอื่น” หลายแถวมาจาก leaderboard สาธารณะของ Vals AI, Proximal และ Surge
2. ชุดทดสอบและการตั้งค่าไม่เหมือนกัน
ตัวอย่างเช่น DeepSWE v1.1:
- Google คำนวณ Argon ที่ 77.9% ด้วยชุดทดสอบ
mini-swe-agent - คะแนน Astra มาจาก leaderboard สาธารณะ
- คะแนน Anthropic มาจาก system cards
สำหรับ LVBench, Gemini สุ่มวิดีโอที่ 1 เฟรมต่อวินาที ขณะที่ Astra ใช้ 800 เฟรม, Opus 5.5 ใช้ 600 เฟรม และ Fable 5.1 ใช้ 300 เฟรม เนื่องจากข้อจำกัดของ API
3. โมเดลเดียวกันอาจมีหลายคะแนน
Terminal-bench 4.0 ของ Opus 5.5 เปลี่ยนไปตามชุดทดสอบและระดับความพยายาม Anthropic รายงาน 66.4% ที่ระดับความพยายาม xhigh ดังนั้นอย่านำคะแนนจากคนละแหล่ง คนละเวอร์ชัน หรือคนละ configuration มารวมเป็นตารางเดียวโดยไม่ระบุเงื่อนไข
สิ่งที่ผู้ประเมินภายนอกกล่าวถึง
Leaderboard อิสระให้ภาพที่ต่างออกไป:
- Artificial Analysis จัด Argon อันดับ 8 จาก 223 รายการ แต่รายการแยกการตั้งค่า reasoning ออกเป็นคนละรายการ
- เมื่อนับเฉพาะโมเดลที่แตกต่างกัน Argon ได้ 53 เท่ากับ GPT-6 Astra และ Claude Fable 5.1 ตามหลัง Opus 5.5 ที่ 58 และ Sonnet 5.5 ที่ 56
- Artificial Analysis รายงานอัตราหลอนของ Argon บน AA-Omniscience ที่ 15% เทียบกับ Astra 51% ที่การตั้งค่าสูงสุด
- บน Arena Argon อยู่อันดับหนึ่งด้าน Text ที่ 1525 คะแนน แต่มีสถานะ Preliminary จาก 4,942 คะแนนโหวต ขณะที่ Opus 5.5 อยู่อันดับสี่
- Vals AI จัด Argon อันดับหนึ่งจาก 41 โมเดลใน Vals Index ซึ่งเป็น Gemini รุ่นแรกที่ขึ้นนำ
อย่างไรก็ตาม ผลใช้งานจริงอาจต่างจาก benchmark: Bloomberg รายงาน ว่าพนักงาน Google บางคนที่เข้าถึงโมเดลกล่าวว่า Argon ทำงานด้านการเขียนโค้ดและออกแบบ frontend บางงานได้ไม่น่าประทับใจเมื่อเทียบกับ benchmark ซึ่ง Google ระบุว่าคำอธิบายดังกล่าวไม่ถูกต้อง
ควรเลือกใช้โมเดลใด
อย่าเลือกจากคะแนนรวมเพียงตัวเดียว ให้ route ตามประเภทงาน ต้นทุน ความยาว context และข้อจำกัด output
| งาน | เส้นทางวันนี้ | เมื่อ Argon พร้อมใช้งาน |
|---|---|---|
| ตัวแทนด้านกฎหมาย การเงิน และระบบอัตโนมัติในสำนักงาน | Opus 5.5: Vals Index 67.0% | ทดสอบ Argon เพราะนำในสี่แถวงานความรู้ |
| ตัวแทนเขียนโค้ดที่เน้นเทอร์มินัล | Opus 5.5: Terminal-bench 4.0 66.4% | Opus 5.5 ยังนำ |
| วิศวกรรมซอฟต์แวร์แบบตัวแทน | Astra: FrontierSWE v2 65.5% หรือ Opus 5.5 | Argon นำ DeepSWE แต่ตาม FrontierSWE; ทดสอบทั้งคู่ |
| ตัวแทนใช้งานคอมพิวเตอร์และ GUI | Astra: OSWorld-2.0 72.6% | Astra นำ OSWorld; Argon นำ Agent’s Last Exam |
| Reasoning กับพรอมต์เกิน 256K โทเค็น | Opus 5.5 ไม่มีค่าธรรมเนียมเพิ่ม หรือ Astra ที่มีค่าธรรมเนียมเกิน 272K | Argon: GraphWalks 256K ถึง 1M 84.2% |
| ความเข้าใจวิดีโอและแผนภูมิ | Astra: LVBench 87.5% | Argon 91.7% แต่ต้องควบคุมจำนวนเฟรมให้เท่ากัน |
| วิทยาศาสตร์และวิศวกรรม ML | Astra สำหรับ Terminal-Bench Science; Opus 5.5 สำหรับ PostTrainBench | Argon นำ LABBench 2 และ RiemannBench; ทดสอบจริง |
| การตอบกลับเดี่ยวเกิน 128K โทเค็น | Opus 5.5 บน Batch: 300K รุ่นเบต้า | Argon: สูงสุด 1 ล้านตามที่ Google ระบุ |
| งานปริมาณมากที่ไวต่อต้นทุน | Opus 5.5: $4/$20 | Argon: $2/$10 ตราบใดที่ราคาแนะนำยังอยู่ |
หากต้นทุนสำคัญกว่าคะแนนสูงสุด ดูการเปรียบเทียบ GPT-6 Sol เทียบกับ Claude Opus 5.5 สำหรับตัวเลือก OpenAI ที่ราคาต่ำกว่า
เปรียบเทียบทั้งสามด้วยพรอมต์ของคุณเอง
Benchmark ของผู้ขายตอบไม่ได้ว่าโมเดลใดเหมาะกับ schema, tool call, codebase หรือข้อกำหนด latency ของระบบคุณ วิธีที่ใช้งานได้จริงคือสร้าง evaluation ขนาดเล็กด้วยApidog
1. สร้างคำขอแยกตามผู้ให้บริการ
สร้างโปรเจกต์เดียวที่มีคำขอ 3 รายการ:
- GPT-6 Astra
- Claude Opus 5.5
- Gemini โดยใช้ตัวแปร
{{GEMINI_MODEL}}
ตั้งค่า GEMINI_MODEL เป็น gemini-3.8-flash ชั่วคราว จนกว่า Google จะเปิดเผย model ID ของ Argon
ดูรูปแบบ API ของแต่ละผู้ให้บริการจากคู่มือ API ของ GPT-6 Astra และClaude Opus 5.5 คืออะไร
2. ใช้ environment variables สำหรับคีย์และพรอมต์
เก็บ API key ของแต่ละผู้ให้บริการเป็น environment variable และใช้ prompt variable เดียวกันในทุกคำขอ
OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...
GEMINI_MODEL=gemini-3.8-flash
PROMPT=สรุปข้อกำหนด API นี้เป็น JSON ตาม schema ที่ระบุ
แนวทางนี้ช่วยให้ทั้งสามโมเดลรับอินพุตเดียวกัน และลดความผิดพลาดจากการแก้พรอมต์ไม่พร้อมกัน
3. เพิ่ม assertions ที่วัดผลได้
อย่างน้อยควรตรวจสอบ:
- HTTP status เป็น
200 - ฟิลด์คำตอบไม่ว่าง
- JSON parse ได้ หากระบบต้องการ JSON
- จำนวน output token ไม่เกินเพดาน
- ค่าใช้จ่ายต่อคำขออยู่ภายใต้งบ
- การเรียก tool หรือ function ตรงตาม schema ที่กำหนด
ตัวอย่าง pseudocode สำหรับตรวจงบประมาณ:
const inputTokens = 20000;
const outputTokens = 4000;
const inputPricePerMillion = 10;
const outputPricePerMillion = 50;
const estimatedCost =
(inputTokens / 1_000_000) * inputPricePerMillion +
(outputTokens / 1_000_000) * outputPricePerMillion;
if (estimatedCost > 0.5) {
throw new Error(`เกินงบประมาณ: $${estimatedCost}`);
}
4. รันเป็น test scenario เดียว
รันคำขอทั้งสามในสถานการณ์เดียวกัน แล้วเปรียบเทียบ:
- คุณภาพคำตอบ
- ความถูกต้องตาม schema
- เวลา response
- input/output tokens
- ต้นทุนโดยประมาณ
- ความเสถียรเมื่อรันซ้ำหลายครั้ง
อย่าทดสอบแค่พรอมต์เดียว ควรใช้ชุดพรอมต์ที่แทน workload จริง เช่น งานสรุปเอกสาร งานสร้างโค้ด งานแก้บั๊ก งาน tool use และงาน long-context
ตัวอย่างคำนวณต้นทุนต่อคำขอ
สำหรับคำขอที่มีอินพุต 20,000 โทเค็น และเอาต์พุต 4,000 โทเค็น:
GPT-6 Astra
อินพุต: 20,000 × $10 / 1,000,000 = $0.20
เอาต์พุต: 4,000 × $50 / 1,000,000 = $0.20
รวม: $0.40
Claude Opus 5.5
อินพุต: 20,000 × $4 / 1,000,000 = $0.08
เอาต์พุต: 4,000 × $20 / 1,000,000 = $0.08
รวม: $0.16
Gemini 4 Argon
ราคาแนะนำ: $0.08
ราคาปกติ: $0.16
แต่ราคาต่อโทเค็นไม่ใช่ต้นทุนต่อภารกิจทั้งหมด Artificial Analysis วัดว่า Argon ใช้เอาต์พุตราว 62K โทเค็นต่อภารกิจ เทียบกับ Astra ราว 27K โทเค็นที่ระดับความพยายามสูงสุด ดังนั้นให้วัด output token จาก workload ของคุณเอง ไม่ใช่ตัดสินจากอัตราราคาเพียงอย่างเดียว
เมื่อ Argon ใช้งานได้ ให้เปลี่ยนค่า GEMINI_MODEL เป็น ID จริงของ Argon แล้วรัน test scenario เดิมอีกครั้ง คุณจะได้การเปรียบเทียบแบบ apples-to-apples กับ Astra และ Opus 5.5 ที่ใช้งานได้อยู่แล้ว
คำถามที่พบบ่อย
Gemini 4 Argon ดีกว่า GPT-6 Astra หรือไม่?
ทั้งคู่ได้ 53 บน Artificial Analysis ในตารางของ Google Argon ได้คะแนนสูงกว่าในแถวส่วนใหญ่ แต่ Astra ชนะ FrontierSWE v2, Terminal-Bench Science 0.1 และ OSWorld-2.0 ที่สำคัญ Astra เป็นรุ่นที่คุณเรียกใช้ได้วันนี้
Gemini 4 Argon เทียบกับ Claude Opus 5.5 รุ่นไหนดีกว่า?
ตารางของ Google ให้ Argon นำในแถวส่วนใหญ่ ขณะที่ Opus 5.5 ชนะ Terminal-bench 4.0 และ PostTrainBench Opus 5.5 ยังนำ Artificial Analysis ที่ 58 ต่อ 53 และราคา Argon หลังช่วงแนะนำจะเท่ากับ Opus 5.5
Gemini 4 Argon ถูกกว่า Claude Opus 5.5 หรือไม่?
ในช่วงราคาแนะนำ Argon ถูกกว่าครึ่งหนึ่ง: $2/$10 เทียบกับ $4/$20 หลังจากนั้นราคา Argon ที่ระบุจะเท่ากับ Opus 5.5 และ Google ยังไม่ประกาศวันสิ้นสุดช่วงแนะนำ
โมเดลใดมีขีดจำกัดเอาต์พุตสูงสุด?
Argon ระบุเอาต์พุตสูงสุด 1 ล้านโทเค็น แม้ Vals AI จะรายงาน 262K สำหรับ configuration ที่ทดสอบ โมเดลอื่นจำกัด synchronous output ที่ 128K ส่วน Opus 5.5 Batch รุ่นเบต้ารองรับ 300K ดูรายละเอียดผลกระทบต่อไคลเอ็นต์ได้ในคู่มือเอาต์พุต 1 ล้านโทเค็น
ฉันใช้ Gemini 4 Argon ได้วันนี้หรือไม่?
ได้เฉพาะผ่าน Fairwind Program ของ Google สำหรับกลุ่มพันธมิตรด้านการป้องกันภัยไซเบอร์ที่ผ่านการตรวจสอบ ลูกค้า API แบบชำระเงินและสมาชิก Google AI Ultra จะได้รับสิทธิ์ในลำดับถัดไป แต่ยังไม่มีการประกาศวัน
เลือกตาม workload แล้วทดสอบ
Argon ดูแข็งแกร่งในงานความรู้ บริบทยาว และงานมัลติโมเดล Astra เด่นใน FrontierSWE, Terminal-Bench Science และ OSWorld ส่วน Opus 5.5 เด่นในงานเทอร์มินัลและวิศวกรรม ML โดยมีราคาเท่ากับ Argon หลังช่วงแนะนำ
แนวทางที่นำไปใช้ได้ทันทีคือ:
- เริ่มจาก Astra หรือ Opus 5.5 ซึ่งเรียกใช้ได้แล้ว
- เก็บชื่อโมเดล Gemini ไว้ใน environment variable
- สร้างชุด prompt และ assertions ที่สะท้อน production workload
- บันทึกคุณภาพ latency token และต้นทุน
- รัน scenario เดิมซ้ำทันทีเมื่อ Argon เปิดให้ใช้งาน
หากต้องการตั้งค่าการเปรียบเทียบสามคำขอในโปรเจกต์เดียว ให้ดาวน์โหลด Apidog
Top comments (0)