DEV Community

Cover image for ผล Benchmark Gemini 4 Argon: ครบ 19 รายการ, วิธีที่ Google ทดสอบ และ 5 จุดที่พ่ายแพ้
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

ผล Benchmark Gemini 4 Argon: ครบ 19 รายการ, วิธีที่ Google ทดสอบ และ 5 จุดที่พ่ายแพ้

Gemini 4 Argon นำ 13 จาก 19 แถวในตารางเปิดตัวของ Google อย่างชัดเจน เสมอ 1 แถวใน CWE-bench v1 กับ GPT-6 Astra และตามหลัง 5 แถว ได้แก่ FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-bench Science 0.1 และ OSWorld-2.0 อย่างไรก็ตาม Argon ยังเข้าถึงได้เฉพาะผู้เข้าร่วมโปรแกรม Fairwind จึงยังไม่สามารถทำซ้ำผลลัพธ์เหล่านี้ได้โดยทั่วไปนอกเครือข่ายพาร์ตเนอร์ของ Google และองค์กรเกณฑ์มาตรฐานบางแห่ง

ลองใช้ Apidog วันนี้

บทความนี้สรุปตารางเต็ม ผู้วัดผลแต่ละแถว จุดที่ Argon แพ้ ข้อจำกัดด้านระเบียบวิธี คะแนนไซเบอร์ กระดานคะแนนภายนอก และขั้นตอนสร้าง evaluation ของคุณเองใน Apidog เพื่อพร้อมทดสอบทันทีเมื่อเปิดการเข้าถึง

ตารางฉบับเต็ม พร้อมผู้ที่วัดผลแต่ละแถว

ตัวเลขต่อไปนี้เป็นผลที่ Google รายงานจากโพสต์เปิดตัว และเอกสาร PDF ระเบียบวิธีการประเมิน ซึ่งระบุว่าเป็น “ผลลัพธ์ ณ เดือนตุลาคม 2026”

วิธีอ่านตาราง:

  • Google คำนวณคะแนน Argon เอง 10 จาก 19 แถว
  • อีก 9 แถวมาจากกระดานผู้นำสาธารณะ
  • คะแนนคู่แข่งอาจมาจากกระดานผู้นำ การทดสอบ Google การ์ดระบบ หรือบล็อกโพสต์ของผู้จำหน่าย
  • ระเบียบวิธีจึงไม่เหมือนกันในทุกแถว
  • ตัวหนา คือคะแนนสูงสุดในแถวนั้น
เกณฑ์มาตรฐาน Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 ผู้ที่วัดผล
Vals Index 68.9% 63.1% 65.8% 67.0% Vals AI
AutomationBench 51.3% 41.4% 31.4% 42.5% กระดานผู้นำ Zapier (ชุดข้อมูลส่วนตัว)
Vals Finance Agent v2 65.4% 53.5% 58.9% 58.6% Vals AI
Harvey Legal Agent 19.6% 5.4% 6.7% 3.8% Vals AI
DeepSWE v1.1 77.9% 74.1% 67.4% 74.2% Argon คำนวณเอง; กระดานผู้นำ Astra; การ์ดระบบ Anthropic
FrontierSWE v2 55.0% 65.5% 56.3% 62.3% กระดานผู้นำ Proximal
Vibe Code Bench 91.9% 89.6% 90.3% 90.3% Vals AI
Terminal-bench 4.0 57.4% 58.2% 57.9% 66.4% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
PostTrainBench 45.3% 44.3% 40.2% 49.3% คำนวณเองสำหรับทุกโมเดล
Terminal-Bench Science 0.1 57.6% 68.1% 52.6% 63.3% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
LABBench 2 88.8% 85.4% 68.6% 73.1% คำนวณเองสำหรับทุกโมเดล
RiemannBench 76.0% 72.0% 65.6% 69.6% กระดานผู้นำ Surge
GraphWalks up to 128K 99.7% 98.7% 91.4% 90.6% คำนวณเองสำหรับทุกโมเดล
GraphWalks 256K to 1M 84.2% 71.8% 65.0% 66.8% คำนวณเองสำหรับทุกโมเดล
Agent’s Last Exam 39.5% 34.2% n/r 38.2% Argon คำนวณเอง; กระดานผู้นำคู่แข่ง
OSWorld-2.0 (offline) 69.2% 72.6% n/r n/r Argon คำนวณเอง; Astra จากบล็อกโพสต์ของ OpenAI
Chartography 71.6% 71.0% 46.2% 66.3% กระดานผู้นำ Surge
LVBench 91.7% 87.5% 79.7% 83.7% คำนวณเองสำหรับทุกโมเดล
CWE-bench v1 68.0% 68.0% 58.0% 67.0% กระดานผู้นำสาธารณะ

n/r = ไม่ได้รายงาน

Grok 4.7 ซึ่งไม่อยู่ในตารางของ Google ก็ได้ 68% บนกระดานผู้นำ CWE-bench เช่นกัน ทำให้ CWE-bench เป็นการเสมอกันสามทาง

เมื่อจัดตามแหล่งข้อมูล:

  1. 9 แถวจากกระดานผู้นำสาธารณะ สำหรับทุกโมเดล เช่น Vals AI, Zapier, Proximal, Surge และ CWE-bench

    • Argon นำ 7 แถว
    • เสมอ 1 แถว
  2. 5 แถวที่ Google ทดสอบเองสำหรับทั้งสี่โมเดล

    • Argon นำ 4 แถว
  3. 5 แถวผสม ที่ Google ทดสอบ Argon แล้วนำคะแนนคู่แข่งจากแหล่งอื่นมาเทียบ

    • Argon แพ้ 3 จาก 5 ความพ่ายแพ้ในกลุ่มนี้

หากการคำนวณเองของ Google ทำให้ Argon ดูดีเกินจริง ผลลัพธ์ควรออกมาในทิศทางตรงข้ามมากกว่านี้ แต่ข้อมูลที่เผยแพร่ไม่ได้แสดงรูปแบบนั้น

จุดที่ Argon ตามหลัง และเหตุใดจึงสำคัญสำหรับการเขียนโค้ดแบบเอเจนต์

จุดที่ Argon แพ้ไม่ใช่รายละเอียดเล็กน้อย โดยเฉพาะหากคุณกำลังเลือกโมเดลให้กับ coding agent, terminal workflow หรือ repository task

  • FrontierSWE v2: Argon ได้ 55.0% เทียบกับ Astra ที่ 65.5%

    Argon อยู่อันดับสุดท้ายจากสี่โมเดล รองจาก Fable 5.1 ที่ 56.3% และ Opus 5.5 ที่ 62.3%

  • Terminal-bench 4.0: Argon ได้ 57.4% เทียบกับ Opus 5.5 ที่ 66.4%

    Argon อยู่อันดับสุดท้ายอีกครั้ง แม้ Astra และ Fable 5.1 จะมีคะแนนใกล้กัน

  • PostTrainBench: Argon ได้ 45.3% เทียบกับ Opus 5.5 ที่ 49.3%

    Argon เป็นอันดับสองในแถวที่ Google ทดสอบทุกโมเดลด้วยตนเอง

  • Terminal-bench Science 0.1: Argon ได้ 57.6% เทียบกับ Astra ที่ 68.1%

    Argon อยู่อันดับสาม นำหน้าเพียง Fable 5.1 และ Google ทดสอบ Argon ด้วยการจำกัดเวลาตรวจสอบ 6 เท่า

  • OSWorld-2.0 (ชุดย่อยออฟไลน์): Argon ได้ 69.2% เทียบกับ Astra ที่ 72.6%

    ไม่มีคะแนน Claude เพราะ Anthropic รายงานเฉพาะคะแนนรวมของชุดออนไลน์และออฟไลน์

สำหรับงานเขียนโค้ดแบบเอเจนต์ ผลลัพธ์แบ่งเป็น 2 ต่อ 2:

กลุ่มงาน ผลของ Argon
DeepSWE v1.1 ชนะ
Vibe Code Bench ชนะ
FrontierSWE v2 อันดับสุดท้าย
Terminal-bench 4.0 อันดับสุดท้าย

มีข้อควรระวังสำหรับ DeepSWE v1.1: วิธีทดสอบต่างกันระหว่างแต่ละโมเดล

  • Argon ใช้ mini-swe agent harness
  • คะแนน Astra มาจากกระดานผู้นำสาธารณะ
  • คะแนน Claude มาจาก system card

Vibe Code Bench เปรียบเทียบได้ตรงกว่า เพราะ Vals AI วัดทั้งสี่โมเดล แต่ส่วนต่างระหว่าง Argon กับ Astra อยู่ที่เพียง 1.6 คะแนน

หาก workload ของคุณเป็นงาน terminal-heavy หรือ repository task ที่ยาวและมีหลายขั้นตอน ควรให้ความสำคัญกับ FrontierSWE v2 และ Terminal-bench 4.0 มากกว่าดูจำนวนแถวที่ชนะรวมเพียงอย่างเดียว

Astra เป็นผู้นำใน FrontierSWE และคุณสามารถดูพฤติกรรมในการใช้งานจริงได้จาก การทดลองใช้ GPT-6 Astra ของเรา ส่วนข้อมูลฝั่ง Anthropic ดูได้จาก รายละเอียดเกณฑ์มาตรฐานของ Claude Fable 5.1

Bloomberg รายงานว่าพนักงาน Google ที่ไม่เปิดเผยชื่อซึ่งเข้าถึงโมเดลได้ระบุว่า Argon ทำงานได้ไม่น่าประทับใจนักในงานเขียนโค้ดและออกแบบส่วนหน้าบางประเภทเมื่อเทียบกับคะแนน benchmark ขณะที่ Google ระบุว่าลักษณะดังกล่าวไม่ถูกต้อง

ข้อควรระวังเกี่ยวกับระเบียบวิธีที่เปลี่ยนวิธีที่คุณอ่านตาราง

อย่าใช้คะแนนในตารางเป็นตัวแทนต้นทุน ความเร็ว หรือพฤติกรรมค่าเริ่มต้นในการใช้งานจริงโดยตรง

  • ใช้การตั้งค่าความพยายามสูงสุด

    Argon ทำงานด้วย Gemini API ที่ตั้งค่าการคิดสูงสุด ส่วน Astra, Fable 5.1 และ Opus 5.5 ถูกตั้งเป็นระดับ thinking/reasoning สูงสุดที่มีอยู่ นี่เป็นการเทียบขีดจำกัดบน ไม่ใช่การวัดค่าใช้จ่ายหรือ latency ของค่าเริ่มต้น

  • อินพุตของ LVBench ไม่เท่ากัน

    Google ทดสอบ LVBench เองสำหรับทั้งสี่โมเดลโดยไม่มีเครื่องมือ Gemini และสุ่มตัวอย่างวิดีโอที่ 1 FPS

    • Astra ได้ 800 เฟรม
    • Fable 5.1 ได้ 300 เฟรม
    • Opus 5.5 ได้ 600 เฟรม เหตุผลที่ระบุคือข้อจำกัด API ดังนั้นโมเดลไม่ได้รับอินพุตชุดเดียวกัน
  • OSWorld ใช้คะแนนดีที่สุดจากสามรอบ

    คะแนน Argon คือ “สูงสุดจากการรัน 3 ครั้ง โดยพยายามครั้งเดียวต่อการรัน” จึงเป็น best-of-three ไม่ใช่ค่าเฉลี่ย

  • Agent’s Last Exam มีกรอบเวลา 5 ชั่วโมง

    Argon ทำงานบน ALE-Claw harness ด้วยระยะเวลา 5 ชั่วโมง

  • เปิดตัวกรองความปลอดภัยไว้

    Agent’s Last Exam และ OSWorld ทำงานโดยเปิด safety filters และคำตอบที่ถูกตั้งค่าสถานะจะคืนค่าเป็นสตริงว่าง ซึ่งหากมีผล ก็มีแนวโน้มทำให้คะแนน Argon ลดลง

แถวไซเบอร์จากหน้าไซเบอร์ของ DeepMind

หน้าไซเบอร์ของ DeepMind เพิ่มผลการประเมินอีก 4 รายการนอกตารางเปิดตัวหลัก

การประเมินไซเบอร์ Gemini 4 Argon การเปรียบเทียบ
การค้นพบช่องโหว่ในโลกจริง 85.8% Gemini 3.8 Flash Cyber 71.0%
เกณฑ์มาตรฐานการทดสอบการเจาะระบบ Wiz 70.9% Gemini 3.8 Flash Cyber 58.2%
ความสำเร็จของการโจมตี Gray Swan IPI (k=15, ยิ่งน้อยยิ่งดี) 0.7% ต่ำสุดในกราฟ; Kimi K3 สูงสุดที่ 52.7%
CWE-bench v1 68% เสมอกันสามทางกับ Grok 4.7 และ GPT-6 Astra; Opus 5.5 ที่ 67%

การประเมินการค้นหาช่องโหว่ใช้ Antigravity harness ภายในที่ “ไม่เชี่ยวชาญด้านไซเบอร์” และให้โมเดลเข้าถึงซอร์สโค้ด

ส่วนการทดสอบ Wiz ให้โมเดลเข้าถึงเฉพาะเว็บไซต์ที่กำลังทำงานและพฤติกรรมสาธารณะ โดยไม่มีซอร์สโค้ดของแอปพลิเคชัน

ข้อเปรียบเทียบสำคัญคือผลพาดหัวทั้งสองรายการเทียบกับโมเดลไซเบอร์รุ่นก่อนหน้าของ Google ไม่ใช่โมเดลคู่แข่ง ดูผลกระทบต่อ API ที่คุณดูแลได้ใน คำอธิบายการป้องกันทางไซเบอร์ของ Argon

กระดานคะแนนของบุคคลที่สาม

องค์กรต่อไปนี้โพสต์คะแนนภายในไม่กี่นาทีหลังเปิดตัว จึงมีแนวโน้มว่าเข้าถึงโมเดลได้ก่อนเผยแพร่สู่สาธารณะ

  • Artificial Analysis

    จัดอันดับ Gemini 4 Argon (สูง) ที่ดัชนีความฉลาด 53 เป็นอันดับ 8 จาก 223 การจัดอันดับนับแต่ละ reasoning setting แยกเป็นโมเดลต่างกัน Argon เสมอกับ Fable 5.1 และ GPT-6 Astra และตามหลัง Opus 5.5 ที่ 58 และ Sonnet 5.5 ที่ 56

    Artificial Analysis รายงาน hallucination rate 15% บน AA-Omniscience เทียบกับ Astra ที่สูงสุด 51% และความแม่นยำ 50% เทียบกับ 63% ค่าใช้จ่ายในการรันดัชนีคือ 1.99 ดอลลาร์ต่อภารกิจ โดย Argon ใช้เอาต์พุตประมาณ 62K โทเค็นต่อภารกิจ เทียบกับ Astra ที่สูงสุดประมาณ 27K โทเค็น

    ดูข้อมูล Artificial Analysis

  • Vals AI

    ให้ Argon ได้ 68.90% บน Vals Index เป็นอันดับ 1 จาก 41 และเป็นโมเดล Gemini รุ่นแรกที่ขึ้นอันดับสูงสุด ค่าใช้จ่ายอยู่ที่ 15.68 ดอลลาร์ต่อการทดสอบ

    Vals AI ระบุเอาต์พุตสูงสุด 262K สำหรับ configuration ที่ทดสอบ ซึ่งต่ำกว่า 1M ที่ Google ระบุ

    ดูข้อมูล Vals AI

  • Arena

    จัด Argon เป็นอันดับ 1 บน Text ที่คะแนน 1525 โดยมีสถานะ “เบื้องต้น” จาก 4,942 โหวต และอยู่อันดับ 8 บน WebDev

เหตุผลที่สื่อเผยแพร่จำนวนชัยชนะ 12, 13 และ 14 ครั้ง

จำนวนชัยชนะขึ้นอยู่กับว่าคุณกำลังเทียบ Argon กับใคร

นับเทียบกับ Argon ชนะ เสมอ Argon แพ้ ไม่ได้รายงาน
ดีที่สุดในบรรดาคู่แข่งทั้งสาม 13 1 5 0
GPT-6 Astra เท่านั้น 14 1 4 0
Claude Opus 5.5 เท่านั้น 14 0 4 1
Claude Fable 5.1 เท่านั้น 15 0 2 2

สรุป:

  • 13 ชัยชนะ ถูกต้องเมื่อเปรียบเทียบกับคู่แข่งที่ดีที่สุดในทุกแถว
  • 14 ชัยชนะ ถูกต้องเมื่อเทียบตัวต่อตัวกับ Astra หรือ Opus 5.5
  • 12 ชัยชนะ ไม่ตรงกับการนับตามกรอบใดใน 19 แถวนี้

ก่อนอ้างอิงตัวเลขจากแหล่งใด ให้ตรวจสอบว่าแหล่งนั้นนับแถวใดและเปรียบเทียบกับโมเดลใด

ขนาดส่วนต่างก็สำคัญเช่นกัน:

  • Harvey Legal Agent: Argon 19.6% เทียบกับ Fable 5.1 ที่ 6.7%
  • Chartography: Argon 71.6% เทียบกับ Astra 71.0% หรือแตกต่างเพียง 0.6 คะแนน

วิธีเรียกใช้การประเมินของคุณเองในวันที่เปิดการเข้าถึง

Benchmark บอกข้อมูลเกี่ยวกับระบบทดสอบของ Google แต่ไม่ได้แทน prompt, toolchain และข้อจำกัดในผลิตภัณฑ์ของคุณ วิธีที่ใช้งานได้จริงคือสร้าง evaluation suite ตอนนี้ด้วยโมเดลที่เรียกใช้ได้ แล้วเปลี่ยนเฉพาะ model ID เมื่อ Argon เปิดตัว

1. เลือก prompt จากงานจริง

เลือก prompt ที่สะท้อน workflow ที่คุณต้องการวัด เช่น

  • แก้ไข repository
  • วิเคราะห์หรือแก้ปัญหาผ่าน terminal
  • ตอบคำถามจากเอกสารขนาดยาว
  • สร้างหรือแก้ API integration
  • ตรวจสอบผลลัพธ์แบบมีโครงสร้าง JSON

อย่าเริ่มจาก prompt สังเคราะห์เพียงอย่างเดียว หากคุณมี incident, bug report หรือ PR จริง ให้แปลงงานเหล่านั้นเป็น test case ที่ลบข้อมูลละเอียดอ่อนแล้ว

2. สร้าง environment ใน Apidog

ใน Apidog สร้าง environment และกำหนดตัวแปรอย่างน้อยดังนี้

GEMINI_API_KEY=<your-api-key>
GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Google ยังไม่ได้เผยแพร่ model ID ของ Argon ดังนั้น GEMINI_MODEL ควรเป็นตัวแปรเดียวที่ต้องเปลี่ยนเมื่อโมเดลพร้อมใช้งาน

3. บันทึกคำขอให้ใช้ model variable

สร้างคำขอหนึ่งรายการต่อหนึ่ง test case และอ้างอิง model จาก {{GEMINI_MODEL}}

ตัวอย่าง payload เชิงแนวคิด:

{
  "model": "{{GEMINI_MODEL}}",
  "input": "{{test_prompt}}"
}
Enter fullscreen mode Exit fullscreen mode

จัดคำขอเป็นกลุ่มตามสถานการณ์ เช่น

evals/
  repository-fix/
  terminal-task/
  long-context-docs/
  api-contract-validation/
Enter fullscreen mode Exit fullscreen mode

แนวทางนี้ช่วยให้คุณรันชุดทดสอบเดียวกันกับหลายโมเดลได้โดยไม่ต้องแก้ request body ทุกครั้ง

4. เพิ่ม assertion ที่วัดผลได้

อย่าวัดแค่ HTTP status ให้เพิ่ม assertions กับข้อมูลที่สำคัญต่อผลิตภัณฑ์ เช่น

  • response status สำเร็จ
  • ฟิลด์ที่จำเป็นต้องมี
  • JSON ต้อง parse ได้
  • คำตอบต้องมีเนื้อหาหรือ keyword ที่คาดหวัง
  • ห้ามมีข้อความปฏิเสธในกรณีที่ควรตอบได้
  • จำนวนโทเค็นต้องอยู่ภายใต้งบประมาณ

ตัวอย่างเงื่อนไขที่ควรติดตาม:

status == 200
response.output is not empty
response.usageMetadata exists
response.usageMetadata.thoughtsTokenCount <= budget
Enter fullscreen mode Exit fullscreen mode

กำหนดเพดาน thoughtsTokenCount ให้สอดคล้องกับงบประมาณต้นทุนของคุณ ไม่เช่นนั้นโมเดลที่ได้คำตอบดีขึ้นเล็กน้อยอาจมีต้นทุนสูงเกินรับได้ในการใช้งานจริง

5. รัน baseline บน Gemini 3.8 Flash

รันทุก scenario บน gemini-3.8-flash ตอนนี้ และเก็บผลลัพธ์เป็น baseline

ควรบันทึกอย่างน้อย:

ฟิลด์ เหตุผล
Test case ID ใช้เปรียบเทียบผลซ้ำ
Model ID ระบุรุ่นที่รัน
Prompt version ป้องกันการเปลี่ยน prompt โดยไม่ตั้งใจ
Pass/fail วัดความถูกต้องตามเกณฑ์
Output ตรวจทานกรณีผิดพลาด
Latency ใช้วัดผลกระทบต่อผู้ใช้
Usage metadata ตรวจสอบต้นทุนและ token usage
Run timestamp ติดตามความเปลี่ยนแปลงตามเวลา

6. สลับเป็น Argon เมื่อเผยแพร่ model ID

เมื่อ Google เปิดเผย ID ของ Argon ให้เปลี่ยนเพียงค่าเดียว:

GEMINI_MODEL=<argon-model-id>
Enter fullscreen mode Exit fullscreen mode

จากนั้นรัน collection หรือ scenario เดิมซ้ำทั้งหมด และเทียบกับ baseline

Google ระบุว่า “โมเดลใหม่ทั้งหมด” จะเปิดตัวบน Interactions API ดังนั้นควรบันทึก request เวอร์ชัน Interactions ของแต่ละ test case ไว้ด้วย

ดูความแตกต่างด้านราคาและข้อจำกัดได้จาก การเปรียบเทียบ Argon กับ Gemini 3.8 Flash

คำถามที่พบบ่อย

เกณฑ์มาตรฐานของ Gemini 4 Argon ได้รับการตรวจสอบอย่างอิสระหรือไม่?

บางส่วน เก้าใน 19 แถวมาจากกระดานผู้นำสาธารณะสำหรับทุกโมเดล และ Artificial Analysis, Vals AI และ Arena ได้เผยแพร่ผลของตนเอง ส่วนที่เหลือเป็นการทดสอบโดย Google สำหรับ Argon

คะแนน DeepSWE ของ Gemini 4 Argon คือเท่าไร?

77.9% บน DeepSWE v1.1 นำหน้า Opus 5.5 ที่ 74.2% และ Astra ที่ 74.1% อย่างไรก็ตาม Argon ใช้ mini-swe agent harness ขณะที่ตัวเลขคู่แข่งมาจากกระดานผู้นำและ system cards

Argon ชนะ GPT-6 Astra ในเกณฑ์มาตรฐานหรือไม่?

เมื่อเทียบตัวต่อตัวในตารางของ Google Argon ชนะ 14 แถว เสมอ 1 แถว และแพ้ 4 แถว บน Artificial Analysis ทั้งคู่เสมอกันที่ 53

ฉันสามารถรันเกณฑ์มาตรฐานเหล่านี้ด้วยตนเองได้หรือไม่?

ยังไม่ได้ Argon ถูกจำกัดให้ใช้เฉพาะพาร์ตเนอร์ Fairwind และ Google ยังไม่ได้ระบุวันเปิดตัวสู่สาธารณะ ติดตามสถานะได้จาก ตัวติดตามวันวางจำหน่าย Argon

ขั้นตอนต่อไป

สร้าง scenario จากงานจริงของคุณตอนนี้ รันบน Gemini 3.8 Flash และเก็บรายงานไว้เป็น baseline เมื่อ Argon เปิดให้ใช้งาน คุณจะสามารถสลับ model variable และได้ผลเปรียบเทียบของตัวเองภายในไม่กี่นาที

ดาวน์โหลด Apidog เพื่อตั้งค่า evaluation workflow ของคุณ

Top comments (0)