Gemini 4 Argon นำ 13 จาก 19 แถวในตารางเปิดตัวของ Google อย่างชัดเจน เสมอ 1 แถวใน CWE-bench v1 กับ GPT-6 Astra และตามหลัง 5 แถว ได้แก่ FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-bench Science 0.1 และ OSWorld-2.0 อย่างไรก็ตาม Argon ยังเข้าถึงได้เฉพาะผู้เข้าร่วมโปรแกรม Fairwind จึงยังไม่สามารถทำซ้ำผลลัพธ์เหล่านี้ได้โดยทั่วไปนอกเครือข่ายพาร์ตเนอร์ของ Google และองค์กรเกณฑ์มาตรฐานบางแห่ง
บทความนี้สรุปตารางเต็ม ผู้วัดผลแต่ละแถว จุดที่ Argon แพ้ ข้อจำกัดด้านระเบียบวิธี คะแนนไซเบอร์ กระดานคะแนนภายนอก และขั้นตอนสร้าง evaluation ของคุณเองใน Apidog เพื่อพร้อมทดสอบทันทีเมื่อเปิดการเข้าถึง
- ดูภาพรวมโมเดล: Gemini 4 Argon คืออะไร
- เปรียบเทียบเพื่อการตัดสินใจ: Argon vs GPT-6 Astra vs Claude Opus 5.5
ตารางฉบับเต็ม พร้อมผู้ที่วัดผลแต่ละแถว
ตัวเลขต่อไปนี้เป็นผลที่ Google รายงานจากโพสต์เปิดตัว และเอกสาร PDF ระเบียบวิธีการประเมิน ซึ่งระบุว่าเป็น “ผลลัพธ์ ณ เดือนตุลาคม 2026”
วิธีอ่านตาราง:
- Google คำนวณคะแนน Argon เอง 10 จาก 19 แถว
- อีก 9 แถวมาจากกระดานผู้นำสาธารณะ
- คะแนนคู่แข่งอาจมาจากกระดานผู้นำ การทดสอบ Google การ์ดระบบ หรือบล็อกโพสต์ของผู้จำหน่าย
- ระเบียบวิธีจึงไม่เหมือนกันในทุกแถว
- ตัวหนา คือคะแนนสูงสุดในแถวนั้น
| เกณฑ์มาตรฐาน | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | ผู้ที่วัดผล |
|---|---|---|---|---|---|
| Vals Index | 68.9% | 63.1% | 65.8% | 67.0% | Vals AI |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | กระดานผู้นำ Zapier (ชุดข้อมูลส่วนตัว) |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | Vals AI |
| Harvey Legal Agent | 19.6% | 5.4% | 6.7% | 3.8% | Vals AI |
| DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% | Argon คำนวณเอง; กระดานผู้นำ Astra; การ์ดระบบ Anthropic |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | กระดานผู้นำ Proximal |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | Vals AI |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% | คำนวณเองสำหรับทุกโมเดล |
| Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | คำนวณเองสำหรับทุกโมเดล |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | กระดานผู้นำ Surge |
| GraphWalks up to 128K | 99.7% | 98.7% | 91.4% | 90.6% | คำนวณเองสำหรับทุกโมเดล |
| GraphWalks 256K to 1M | 84.2% | 71.8% | 65.0% | 66.8% | คำนวณเองสำหรับทุกโมเดล |
| Agent’s Last Exam | 39.5% | 34.2% | n/r | 38.2% | Argon คำนวณเอง; กระดานผู้นำคู่แข่ง |
| OSWorld-2.0 (offline) | 69.2% | 72.6% | n/r | n/r | Argon คำนวณเอง; Astra จากบล็อกโพสต์ของ OpenAI |
| Chartography | 71.6% | 71.0% | 46.2% | 66.3% | กระดานผู้นำ Surge |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | คำนวณเองสำหรับทุกโมเดล |
| CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% | กระดานผู้นำสาธารณะ |
n/r= ไม่ได้รายงาน
Grok 4.7 ซึ่งไม่อยู่ในตารางของ Google ก็ได้ 68% บนกระดานผู้นำ CWE-bench เช่นกัน ทำให้ CWE-bench เป็นการเสมอกันสามทาง
เมื่อจัดตามแหล่งข้อมูล:
-
9 แถวจากกระดานผู้นำสาธารณะ สำหรับทุกโมเดล เช่น Vals AI, Zapier, Proximal, Surge และ CWE-bench
- Argon นำ 7 แถว
- เสมอ 1 แถว
-
5 แถวที่ Google ทดสอบเองสำหรับทั้งสี่โมเดล
- Argon นำ 4 แถว
-
5 แถวผสม ที่ Google ทดสอบ Argon แล้วนำคะแนนคู่แข่งจากแหล่งอื่นมาเทียบ
- Argon แพ้ 3 จาก 5 ความพ่ายแพ้ในกลุ่มนี้
หากการคำนวณเองของ Google ทำให้ Argon ดูดีเกินจริง ผลลัพธ์ควรออกมาในทิศทางตรงข้ามมากกว่านี้ แต่ข้อมูลที่เผยแพร่ไม่ได้แสดงรูปแบบนั้น
จุดที่ Argon ตามหลัง และเหตุใดจึงสำคัญสำหรับการเขียนโค้ดแบบเอเจนต์
จุดที่ Argon แพ้ไม่ใช่รายละเอียดเล็กน้อย โดยเฉพาะหากคุณกำลังเลือกโมเดลให้กับ coding agent, terminal workflow หรือ repository task
FrontierSWE v2: Argon ได้ 55.0% เทียบกับ Astra ที่ 65.5%
Argon อยู่อันดับสุดท้ายจากสี่โมเดล รองจาก Fable 5.1 ที่ 56.3% และ Opus 5.5 ที่ 62.3%Terminal-bench 4.0: Argon ได้ 57.4% เทียบกับ Opus 5.5 ที่ 66.4%
Argon อยู่อันดับสุดท้ายอีกครั้ง แม้ Astra และ Fable 5.1 จะมีคะแนนใกล้กันPostTrainBench: Argon ได้ 45.3% เทียบกับ Opus 5.5 ที่ 49.3%
Argon เป็นอันดับสองในแถวที่ Google ทดสอบทุกโมเดลด้วยตนเองTerminal-bench Science 0.1: Argon ได้ 57.6% เทียบกับ Astra ที่ 68.1%
Argon อยู่อันดับสาม นำหน้าเพียง Fable 5.1 และ Google ทดสอบ Argon ด้วยการจำกัดเวลาตรวจสอบ 6 เท่าOSWorld-2.0 (ชุดย่อยออฟไลน์): Argon ได้ 69.2% เทียบกับ Astra ที่ 72.6%
ไม่มีคะแนน Claude เพราะ Anthropic รายงานเฉพาะคะแนนรวมของชุดออนไลน์และออฟไลน์
สำหรับงานเขียนโค้ดแบบเอเจนต์ ผลลัพธ์แบ่งเป็น 2 ต่อ 2:
| กลุ่มงาน | ผลของ Argon |
|---|---|
| DeepSWE v1.1 | ชนะ |
| Vibe Code Bench | ชนะ |
| FrontierSWE v2 | อันดับสุดท้าย |
| Terminal-bench 4.0 | อันดับสุดท้าย |
มีข้อควรระวังสำหรับ DeepSWE v1.1: วิธีทดสอบต่างกันระหว่างแต่ละโมเดล
- Argon ใช้
mini-swe agent harness - คะแนน Astra มาจากกระดานผู้นำสาธารณะ
- คะแนน Claude มาจาก system card
Vibe Code Bench เปรียบเทียบได้ตรงกว่า เพราะ Vals AI วัดทั้งสี่โมเดล แต่ส่วนต่างระหว่าง Argon กับ Astra อยู่ที่เพียง 1.6 คะแนน
หาก workload ของคุณเป็นงาน terminal-heavy หรือ repository task ที่ยาวและมีหลายขั้นตอน ควรให้ความสำคัญกับ FrontierSWE v2 และ Terminal-bench 4.0 มากกว่าดูจำนวนแถวที่ชนะรวมเพียงอย่างเดียว
Astra เป็นผู้นำใน FrontierSWE และคุณสามารถดูพฤติกรรมในการใช้งานจริงได้จาก การทดลองใช้ GPT-6 Astra ของเรา ส่วนข้อมูลฝั่ง Anthropic ดูได้จาก รายละเอียดเกณฑ์มาตรฐานของ Claude Fable 5.1
Bloomberg รายงานว่าพนักงาน Google ที่ไม่เปิดเผยชื่อซึ่งเข้าถึงโมเดลได้ระบุว่า Argon ทำงานได้ไม่น่าประทับใจนักในงานเขียนโค้ดและออกแบบส่วนหน้าบางประเภทเมื่อเทียบกับคะแนน benchmark ขณะที่ Google ระบุว่าลักษณะดังกล่าวไม่ถูกต้อง
ข้อควรระวังเกี่ยวกับระเบียบวิธีที่เปลี่ยนวิธีที่คุณอ่านตาราง
อย่าใช้คะแนนในตารางเป็นตัวแทนต้นทุน ความเร็ว หรือพฤติกรรมค่าเริ่มต้นในการใช้งานจริงโดยตรง
ใช้การตั้งค่าความพยายามสูงสุด
Argon ทำงานด้วย Gemini API ที่ตั้งค่าการคิดสูงสุด ส่วน Astra, Fable 5.1 และ Opus 5.5 ถูกตั้งเป็นระดับ thinking/reasoning สูงสุดที่มีอยู่ นี่เป็นการเทียบขีดจำกัดบน ไม่ใช่การวัดค่าใช้จ่ายหรือ latency ของค่าเริ่มต้น-
อินพุตของ LVBench ไม่เท่ากัน
Google ทดสอบ LVBench เองสำหรับทั้งสี่โมเดลโดยไม่มีเครื่องมือ Gemini และสุ่มตัวอย่างวิดีโอที่ 1 FPS- Astra ได้ 800 เฟรม
- Fable 5.1 ได้ 300 เฟรม
- Opus 5.5 ได้ 600 เฟรม เหตุผลที่ระบุคือข้อจำกัด API ดังนั้นโมเดลไม่ได้รับอินพุตชุดเดียวกัน
OSWorld ใช้คะแนนดีที่สุดจากสามรอบ
คะแนน Argon คือ “สูงสุดจากการรัน 3 ครั้ง โดยพยายามครั้งเดียวต่อการรัน” จึงเป็น best-of-three ไม่ใช่ค่าเฉลี่ยAgent’s Last Exam มีกรอบเวลา 5 ชั่วโมง
Argon ทำงานบน ALE-Claw harness ด้วยระยะเวลา 5 ชั่วโมงเปิดตัวกรองความปลอดภัยไว้
Agent’s Last Exam และ OSWorld ทำงานโดยเปิด safety filters และคำตอบที่ถูกตั้งค่าสถานะจะคืนค่าเป็นสตริงว่าง ซึ่งหากมีผล ก็มีแนวโน้มทำให้คะแนน Argon ลดลง
แถวไซเบอร์จากหน้าไซเบอร์ของ DeepMind
หน้าไซเบอร์ของ DeepMind เพิ่มผลการประเมินอีก 4 รายการนอกตารางเปิดตัวหลัก
| การประเมินไซเบอร์ | Gemini 4 Argon | การเปรียบเทียบ |
|---|---|---|
| การค้นพบช่องโหว่ในโลกจริง | 85.8% | Gemini 3.8 Flash Cyber 71.0% |
| เกณฑ์มาตรฐานการทดสอบการเจาะระบบ Wiz | 70.9% | Gemini 3.8 Flash Cyber 58.2% |
ความสำเร็จของการโจมตี Gray Swan IPI (k=15, ยิ่งน้อยยิ่งดี) |
0.7% | ต่ำสุดในกราฟ; Kimi K3 สูงสุดที่ 52.7% |
| CWE-bench v1 | 68% | เสมอกันสามทางกับ Grok 4.7 และ GPT-6 Astra; Opus 5.5 ที่ 67% |
การประเมินการค้นหาช่องโหว่ใช้ Antigravity harness ภายในที่ “ไม่เชี่ยวชาญด้านไซเบอร์” และให้โมเดลเข้าถึงซอร์สโค้ด
ส่วนการทดสอบ Wiz ให้โมเดลเข้าถึงเฉพาะเว็บไซต์ที่กำลังทำงานและพฤติกรรมสาธารณะ โดยไม่มีซอร์สโค้ดของแอปพลิเคชัน
ข้อเปรียบเทียบสำคัญคือผลพาดหัวทั้งสองรายการเทียบกับโมเดลไซเบอร์รุ่นก่อนหน้าของ Google ไม่ใช่โมเดลคู่แข่ง ดูผลกระทบต่อ API ที่คุณดูแลได้ใน คำอธิบายการป้องกันทางไซเบอร์ของ Argon
กระดานคะแนนของบุคคลที่สาม
องค์กรต่อไปนี้โพสต์คะแนนภายในไม่กี่นาทีหลังเปิดตัว จึงมีแนวโน้มว่าเข้าถึงโมเดลได้ก่อนเผยแพร่สู่สาธารณะ
Artificial Analysis
จัดอันดับ Gemini 4 Argon (สูง) ที่ดัชนีความฉลาด 53 เป็นอันดับ 8 จาก 223 การจัดอันดับนับแต่ละ reasoning setting แยกเป็นโมเดลต่างกัน Argon เสมอกับ Fable 5.1 และ GPT-6 Astra และตามหลัง Opus 5.5 ที่ 58 และ Sonnet 5.5 ที่ 56
Artificial Analysis รายงาน hallucination rate 15% บน AA-Omniscience เทียบกับ Astra ที่สูงสุด 51% และความแม่นยำ 50% เทียบกับ 63% ค่าใช้จ่ายในการรันดัชนีคือ 1.99 ดอลลาร์ต่อภารกิจ โดย Argon ใช้เอาต์พุตประมาณ 62K โทเค็นต่อภารกิจ เทียบกับ Astra ที่สูงสุดประมาณ 27K โทเค็น
ดูข้อมูล Artificial AnalysisVals AI
ให้ Argon ได้ 68.90% บน Vals Index เป็นอันดับ 1 จาก 41 และเป็นโมเดล Gemini รุ่นแรกที่ขึ้นอันดับสูงสุด ค่าใช้จ่ายอยู่ที่ 15.68 ดอลลาร์ต่อการทดสอบ
Vals AI ระบุเอาต์พุตสูงสุด 262K สำหรับ configuration ที่ทดสอบ ซึ่งต่ำกว่า 1M ที่ Google ระบุ
ดูข้อมูล Vals AIArena
จัด Argon เป็นอันดับ 1 บน Text ที่คะแนน 1525 โดยมีสถานะ “เบื้องต้น” จาก 4,942 โหวต และอยู่อันดับ 8 บน WebDev
เหตุผลที่สื่อเผยแพร่จำนวนชัยชนะ 12, 13 และ 14 ครั้ง
จำนวนชัยชนะขึ้นอยู่กับว่าคุณกำลังเทียบ Argon กับใคร
| นับเทียบกับ | Argon ชนะ | เสมอ | Argon แพ้ | ไม่ได้รายงาน |
|---|---|---|---|---|
| ดีที่สุดในบรรดาคู่แข่งทั้งสาม | 13 | 1 | 5 | 0 |
| GPT-6 Astra เท่านั้น | 14 | 1 | 4 | 0 |
| Claude Opus 5.5 เท่านั้น | 14 | 0 | 4 | 1 |
| Claude Fable 5.1 เท่านั้น | 15 | 0 | 2 | 2 |
สรุป:
- 13 ชัยชนะ ถูกต้องเมื่อเปรียบเทียบกับคู่แข่งที่ดีที่สุดในทุกแถว
- 14 ชัยชนะ ถูกต้องเมื่อเทียบตัวต่อตัวกับ Astra หรือ Opus 5.5
- 12 ชัยชนะ ไม่ตรงกับการนับตามกรอบใดใน 19 แถวนี้
ก่อนอ้างอิงตัวเลขจากแหล่งใด ให้ตรวจสอบว่าแหล่งนั้นนับแถวใดและเปรียบเทียบกับโมเดลใด
ขนาดส่วนต่างก็สำคัญเช่นกัน:
- Harvey Legal Agent: Argon 19.6% เทียบกับ Fable 5.1 ที่ 6.7%
- Chartography: Argon 71.6% เทียบกับ Astra 71.0% หรือแตกต่างเพียง 0.6 คะแนน
วิธีเรียกใช้การประเมินของคุณเองในวันที่เปิดการเข้าถึง
Benchmark บอกข้อมูลเกี่ยวกับระบบทดสอบของ Google แต่ไม่ได้แทน prompt, toolchain และข้อจำกัดในผลิตภัณฑ์ของคุณ วิธีที่ใช้งานได้จริงคือสร้าง evaluation suite ตอนนี้ด้วยโมเดลที่เรียกใช้ได้ แล้วเปลี่ยนเฉพาะ model ID เมื่อ Argon เปิดตัว
1. เลือก prompt จากงานจริง
เลือก prompt ที่สะท้อน workflow ที่คุณต้องการวัด เช่น
- แก้ไข repository
- วิเคราะห์หรือแก้ปัญหาผ่าน terminal
- ตอบคำถามจากเอกสารขนาดยาว
- สร้างหรือแก้ API integration
- ตรวจสอบผลลัพธ์แบบมีโครงสร้าง JSON
อย่าเริ่มจาก prompt สังเคราะห์เพียงอย่างเดียว หากคุณมี incident, bug report หรือ PR จริง ให้แปลงงานเหล่านั้นเป็น test case ที่ลบข้อมูลละเอียดอ่อนแล้ว
2. สร้าง environment ใน Apidog
ใน Apidog สร้าง environment และกำหนดตัวแปรอย่างน้อยดังนี้
GEMINI_API_KEY=<your-api-key>
GEMINI_MODEL=gemini-3.8-flash
Google ยังไม่ได้เผยแพร่ model ID ของ Argon ดังนั้น GEMINI_MODEL ควรเป็นตัวแปรเดียวที่ต้องเปลี่ยนเมื่อโมเดลพร้อมใช้งาน
3. บันทึกคำขอให้ใช้ model variable
สร้างคำขอหนึ่งรายการต่อหนึ่ง test case และอ้างอิง model จาก {{GEMINI_MODEL}}
ตัวอย่าง payload เชิงแนวคิด:
{
"model": "{{GEMINI_MODEL}}",
"input": "{{test_prompt}}"
}
จัดคำขอเป็นกลุ่มตามสถานการณ์ เช่น
evals/
repository-fix/
terminal-task/
long-context-docs/
api-contract-validation/
แนวทางนี้ช่วยให้คุณรันชุดทดสอบเดียวกันกับหลายโมเดลได้โดยไม่ต้องแก้ request body ทุกครั้ง
4. เพิ่ม assertion ที่วัดผลได้
อย่าวัดแค่ HTTP status ให้เพิ่ม assertions กับข้อมูลที่สำคัญต่อผลิตภัณฑ์ เช่น
- response status สำเร็จ
- ฟิลด์ที่จำเป็นต้องมี
- JSON ต้อง parse ได้
- คำตอบต้องมีเนื้อหาหรือ keyword ที่คาดหวัง
- ห้ามมีข้อความปฏิเสธในกรณีที่ควรตอบได้
- จำนวนโทเค็นต้องอยู่ภายใต้งบประมาณ
ตัวอย่างเงื่อนไขที่ควรติดตาม:
status == 200
response.output is not empty
response.usageMetadata exists
response.usageMetadata.thoughtsTokenCount <= budget
กำหนดเพดาน thoughtsTokenCount ให้สอดคล้องกับงบประมาณต้นทุนของคุณ ไม่เช่นนั้นโมเดลที่ได้คำตอบดีขึ้นเล็กน้อยอาจมีต้นทุนสูงเกินรับได้ในการใช้งานจริง
5. รัน baseline บน Gemini 3.8 Flash
รันทุก scenario บน gemini-3.8-flash ตอนนี้ และเก็บผลลัพธ์เป็น baseline
ควรบันทึกอย่างน้อย:
| ฟิลด์ | เหตุผล |
|---|---|
| Test case ID | ใช้เปรียบเทียบผลซ้ำ |
| Model ID | ระบุรุ่นที่รัน |
| Prompt version | ป้องกันการเปลี่ยน prompt โดยไม่ตั้งใจ |
| Pass/fail | วัดความถูกต้องตามเกณฑ์ |
| Output | ตรวจทานกรณีผิดพลาด |
| Latency | ใช้วัดผลกระทบต่อผู้ใช้ |
| Usage metadata | ตรวจสอบต้นทุนและ token usage |
| Run timestamp | ติดตามความเปลี่ยนแปลงตามเวลา |
6. สลับเป็น Argon เมื่อเผยแพร่ model ID
เมื่อ Google เปิดเผย ID ของ Argon ให้เปลี่ยนเพียงค่าเดียว:
GEMINI_MODEL=<argon-model-id>
จากนั้นรัน collection หรือ scenario เดิมซ้ำทั้งหมด และเทียบกับ baseline
Google ระบุว่า “โมเดลใหม่ทั้งหมด” จะเปิดตัวบน Interactions API ดังนั้นควรบันทึก request เวอร์ชัน Interactions ของแต่ละ test case ไว้ด้วย
ดูความแตกต่างด้านราคาและข้อจำกัดได้จาก การเปรียบเทียบ Argon กับ Gemini 3.8 Flash
คำถามที่พบบ่อย
เกณฑ์มาตรฐานของ Gemini 4 Argon ได้รับการตรวจสอบอย่างอิสระหรือไม่?
บางส่วน เก้าใน 19 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล และ Artificial Analysis, Vals AI และ Arena ได้เผยแพร่ผลของตนเอง ส่วนที่เหลือเป็นการทดสอบโดย Google สำหรับ Argon
คะแนน DeepSWE ของ Gemini 4 Argon คือเท่าไร?
77.9% บน DeepSWE v1.1 นำหน้า Opus 5.5 ที่ 74.2% และ Astra ที่ 74.1% อย่างไรก็ตาม Argon ใช้ mini-swe agent harness ขณะที่ตัวเลขคู่แข่งมาจากกระดานผู้นำและ system cards
Argon ชนะ GPT-6 Astra ในเกณฑ์มาตรฐานหรือไม่?
เมื่อเทียบตัวต่อตัวในตารางของ Google Argon ชนะ 14 แถว เสมอ 1 แถว และแพ้ 4 แถว บน Artificial Analysis ทั้งคู่เสมอกันที่ 53
ฉันสามารถรันเกณฑ์มาตรฐานเหล่านี้ด้วยตนเองได้หรือไม่?
ยังไม่ได้ Argon ถูกจำกัดให้ใช้เฉพาะพาร์ตเนอร์ Fairwind และ Google ยังไม่ได้ระบุวันเปิดตัวสู่สาธารณะ ติดตามสถานะได้จาก ตัวติดตามวันวางจำหน่าย Argon
ขั้นตอนต่อไป
สร้าง scenario จากงานจริงของคุณตอนนี้ รันบน Gemini 3.8 Flash และเก็บรายงานไว้เป็น baseline เมื่อ Argon เปิดให้ใช้งาน คุณจะสามารถสลับ model variable และได้ผลเปรียบเทียบของตัวเองภายในไม่กี่นาที
ดาวน์โหลด Apidog เพื่อตั้งค่า evaluation workflow ของคุณ
Top comments (0)