DEV Community

Nokka
Nokka

Posted on AI-assisted

Gemini 4 Argon ขึ้นที่ 1 Arena AI แล้ว แต่มีตัวเลขสามตัวที่บทความต้นทางไม่ได้บอก

Gemini 4 Argon ขึ้นที่ 1 Arena AI แล้ว แต่มีตัวเลขสามตัวที่บทความต้นทางไม่ได้บอก

โดย Nokka (นก-กา) | 2 ตุลาคม 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

TL;DR

Geeky Gadgets เขียนบทความเรื่อง Gemini 4 Argon โดยอ้างคลิปของ Sam Witteveen ว่าทำได้ 1 ล้านโทเคนต่อคำตอบ โดยตัวเลขอัตราการหลอน 15% และคะแนน 53 ที่บทความยกมาเป็นผลวัดของ Artificial Analysis สนามอิสระ ตัวเลขเหล่านี้ถูกต้องทุกตัว[1][2] แต่เมื่อผมเปิดสนามวัดจริงกลับเจอสามจุดที่คนอ่านควรรู้ก่อนตัดสินใจ คืออันดับที่หนึ่งใน Arena AI ไม่ได้แปลว่านำทุกสนาม ตัวเลขหลอน 15% อยู่บรรทัดเดียวกับความแม่นยำที่ต่ำกว่าคู่แข่ง 13 จุด และราคาที่เห็นถูกขึ้นป้ายว่าเป็นราคาโปรโมชันซึ่งยังไม่มีวันสิ้นสุด[1][2]

บทความต้นทางเขียนอะไร

บทความของ Geeky Gadgets ตีพิมพ์เมื่อวันที่ 2 ตุลาคม 2026 เวลา 07:15 น. ตามเวลาสากล โดยขึ้นต้นว่า Google Gemini 4 Argon เอาชนะ Claude Opus 5.5 บน Arena AI และเครดิตเนื้อหาทั้งชิ้นให้คลิปวิดีโอของ Sam Witteveen[1][3]

หัวข้อหลักที่บทความยกมาคือ

  • Argon สร้างข้อความได้ถึง 1 ล้านโทเคนในคำตอบเดียว เพิ่มจากเดิมที่ 64,000 โทเคน
  • อัตราการหลอน 15% ต่ำกว่าคู่แข่งที่เคยสูงเกิน 50%
  • คะแนนความฉลาด 53 อยู่ในระดับเดียวกับโมเดลชั้นนำ
  • ราคาเริ่มต้น 2 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 10 ดอลลาร์ต่อล้านโทเคนขาออก
  • เป็นอันดับหนึ่งด้านการจัดลำดับงานและการมอบหมายงาน

ผมตรวจคลิปต้นทางด้วย oEmbed API แล้ว ปรากฏว่าวิดีโอชื่อ "Gemini 4 Argon" ของช่อง Sam Witteveen มีอยู่จริง[3] และตัวเลขทุกตัวที่บทความยกมา ตรงกับที่ Artificial Analysis วัดได้จริง[2]

อันดับที่หนึ่ง Arena AI ไม่ได้แปลว่านำทุกสนาม

พาดหัวของบทความต้นทางเน้นว่า Argon เอาชนะ Claude Opus 5.5 บน Arena AI ซึ่งเป็นความจริง สนามนั้นให้ Argon อยู่ที่หนึ่งในหมวดข้อความ[5]

แต่เมื่อเปิดสนามอื่นเทียบกลับได้ภาพคนละแบบ

สามสนาม สามคำตอบ

  • Arena AI ให้ Argon เป็นที่หนึ่งหมวดข้อความ[5]
  • Artificial Analysis Intelligence Index ให้ Argon ได้ 53 เท่ากับ GPT-6 Astra แต่ Claude Opus 5.5 ได้ 58 เป็นที่หนึ่งของสนามนี้[2]
  • UnifyBench ซึ่งถ่วงน้ำหนักจากหลายสนาม จัด Argon ไว้ที่ห้าด้านการเขียนโค้ด เป็นรองทั้ง GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 และ GPT-6.1 Sol[10]

ทั้งสามอย่างถูกต้องพร้อมกันได้ เพราะแต่ละสนามถามคนละคำถาม Arena ถามว่า คนชอบคำตอบไหน ส่วน Artificial Analysis ถามว่า โมเดลแก้ปัญหายากได้แค่ไหน จึงไม่แปลกที่คำตอบจะต่างกัน[2][5]

เหมือนร้านอาหารที่ร้านหนึ่งชนะรางวัลจากคะแนนลูกค้า อีกร้านชนะจากคะแนนกรรมการอาหาร ทั้งสองร้านพูดถูกทั้งคู่ แต่ตอบคำถามคนละข้อ ถ้าคุณจะไปกินข้าว ควรรู้ว่ากำลังเชื่อคะแนนจากใคร

ต้องบอกตรง ๆ ว่า บทความต้นทางไม่ได้เขียนผิด ตัวเลขทุกตัวที่ยกมาถูกต้อง และคลิปต้นทางก็มีอยู่จริง ผมตั้งคำถามกับการเลือกหยิบเฉพาะตัวเลขที่ทำให้ Argon ดูนำ ขณะที่ตัวเลขที่ทำให้เห็นภาพครบกว่านั้นอยู่ในแหล่งเดียวกันและหาไม่ยาก[1][2]

ถ้าอ่านแค่พาดหัว จะเข้าใจว่า Argon คือที่หนึ่งของทุกสนาม ซึ่งไม่ตรงกับผลวัดจริงในสนามอื่น[2][10]

ตัวเลขหลอน 15% อยู่บรรทัดเดียวกับความแม่นยำ 50%

ตัวเลขที่น่าสนใจที่สุดของ Argon คืออัตราการหลอน 15% ซึ่ง Artificial Analysis ระบุว่า ต่ำที่สุดในบรรดาโมเดลทุกตัวที่ได้คะแนน 45 ขึ้นไป เทียบกับ GPT-6 Astra ที่ 51% และ GPT-6.1 Sol ที่ 54%[2]

ฟังดูดีมาก จนกว่าจะอ่านบรรทัดถัดไป

ความแม่นยำของ Argon อยู่ที่ 50% ซึ่ง ต่ำกว่า Gemini 3.1 Pro Preview รุ่นก่อนหน้าถึง 5 จุด และต่ำกว่า GPT-6 Astra ที่ 63% อยู่ 13 จุด[2]

สองตัวเลขนี้ไม่ขัดกัน เพราะมันวัดคนละเรื่อง อัตราการหลอนต่ำหมายความว่า Argon เลือกจะตอบว่า "ผมไม่รู้" แทนที่จะเดาคำตอบ ส่วนความแม่นยำวัดว่าในข้อที่มันยอมตอบ ตอบถูกกี่ข้อ เมื่อรวมสองอย่างเข้าด้วยกัน คะแนน AA-Omniscience ของ Argon อยู่ที่ 42 ใกล้เคียงกับ Astra ที่ 43 และ Sol ที่ 42[2]

พูดง่าย ๆ คือ Argon ฉลาดพอ ๆ กับคู่แข่ง แต่แลกความกล้าตอบมาด้วยความระมัดระวัง ซึ่งสำหรับงานอย่างกฎหมายหรือการเงิน การตอบว่าไม่รู้มีค่ากว่าการเดาผิด และตัวเลข Harvey Legal Agent ก็ชี้ทางเดียวกัน คือ Argon ได้ 19.6% ขณะที่ Astra ได้ 5.4%[9][2]

ราคาที่เห็นคือครึ่งเดียว

บทความต้นทางเขียนว่าราคาเริ่มต้นที่ 2 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 10 ดอลลาร์ต่อล้านโทเคนขาออก ซึ่งเป็นตัวเลขจริง แต่คำว่า ราคาเริ่มต้น ในที่นี้หมายถึงราคาโปรโมชันที่ลดไป 50% ไม่ใช่ราคาปกติ[1][2]

ราคาปกติของ Argon คือ 4 ดอลลาร์ต่อล้านโทเคนขาเข้า และ 20 ดอลลาร์ต่อล้านโทเคนขาออก Google ยังไม่ประกาศว่าราคาโปรโมชันจะสิ้นสุดเมื่อไร[2][6]

ผลต่างนี้เปลี่ยนการเปรียบเทียบทั้งเรื่อง Artificial Analysis คำนวณต้นทุนต่องานไว้แบบนี้[2]

ราคาโปรโมชัน: 1.99 ดอลลาร์ต่องาน = 60% ของ GPT-6 Astra
ราคาปกติ: 3.98 ดอลลาร์ต่องาน = 120% ของ GPT-6 Astra
Enter fullscreen mode Exit fullscreen mode

ตัวเลข 1.99 กับ 3.98 คือ ต้นทุนต่องาน เป็นการวัดคนละแบบกับราคาต่อโทเคน เพราะมันเอาโทเคนที่โมเดลใช้จริงทั้งงานมาคูณราคา แล้วหารด้วยจำนวนงานที่ทำได้

ตัวเลข 2.7 ที่คนพูดถึงกันคือการเทียบ Argon กับ GPT-6.1 Sol ซึ่งเปิดตัวที่ราคาเดียวกันและขายอยู่จริงในตอนนี้ ไม่ใช่การเทียบกับ Astra[2]

อีกจุดที่ทำให้ต้นทุนจริงสูงกว่าที่คิด คือ Argon ใช้โทเคนขาออกเฉลี่ย 62,000 โทเคนต่องาน ขณะที่ GPT-6 Astra ใช้เพียง 27,000 โทเคน นั่นหมายความว่าความประหยัดของ Argon มาจากราคาต่อโทเคนที่ถูกกว่า ไม่ได้มาจากการพูดน้อยกว่า และเมื่อโทเคนขาออกแพงขึ้นเป็น 20 ดอลลาร์ ช่องว่างตรงนี้จะกว้างขึ้น[2]

สิ่งที่ควรรู้ก่อนอ่านตัวเลขจำพวกนี้

ตัวเลขจำพวกนี้มาจากการวัดสามแบบที่ต่างกัน และถ้าอ่านปนกันจะเข้าใจผิดง่ายมาก

  • Intelligence Index คือคะแนนรวมจากการรันชุดข้อสอบมาตรฐานหลายชุด แล้วแปลงเป็นคะแนนเดียว ตัวนี้บอกว่าคุณภาพโดยรวมอยู่ตรงไหน
  • ต้นทุนต่องาน (cost per task) คือการเอาโทเคนที่ใช้จริงทั้งงานคูณราคา แล้วหารด้วยจำนวนงานที่ทำสำเร็จ ต่างจากราคาต่อโทเคนตรงที่มันคิดเรื่องความเปลืองคำของโมเดลเข้าไปด้วย
  • อัตราการหลอน (hallucination rate) คือสัดส่วนข้อที่โมเดลตอบผิดแบบมั่นใจ ทั้งที่ความจริงคือไม่มีคำตอบในข้อมูล วัดด้วยชุดคำถาม AA-Omniscience

เวลาอ่านบทความไหน ให้ดูว่าตัวเลขกำลังพูดถึงการวัดแบบไหน[2]

กับดักที่คนอ่านมักมองข้าม

มีอีกหนึ่งอย่างที่บทความข่าวทั่วไปแทบไม่พูดถึง

หน้าแคตตาล็อกโมเดลทางการของ Google ในวันที่ผมเขียน ยังไม่มีชื่อ Argon หรือชื่อ Gemini 4 อยู่ในรายการเลย หน้าที่มีคือตระกูล Gemini 3.8 Flash ทั้งชุด[7] และหน้า pricing ก็ไม่มีบรรทัดของ Argon เช่นกัน[8]

เรื่องนี้สอดคล้องกับที่ Artificial Analysis และสำนักอื่นรายงานตรงกันว่า Argon ยังไม่เปิดให้ใช้ทั่วไป มีเพียงกลุ่มผู้ป้องกันไซเบอร์ที่ผ่านการคัดกรองในโครงการ Fairwind และทีมภายในของ Google เท่านั้นที่ได้ใช้ ลำดับถัดไปที่ Google ประกาศคือลูกค้า API แบบเสียเงินและสมาชิก Google AI Ultra แต่ยังไม่ระบุวัน[2][6][9]

ด้วยเหตุนี้ ตัวเลขราคาและผลทดสอบทั้งหมดในบทความนี้จึงเป็น ผลการวัดของวันที่ 30 กันยายน ถึง 2 ตุลาคม 2026 ไม่ใช่ราคาที่คุณเปิดเว็บแล้วซื้อได้ตอนนี้[2][6]

ข้อควรระวัง

  • ผมไม่ได้ติดตั้งหรือเรียกใช้ Argon ด้วยตัวเอง เนื้อหาทั้งหมดอ้างจากคลิปต้นทาง บทความ Geeky Gadgets และผลวัดของสนามอิสระ ตัวเลขทุกตัวระบุที่มาไว้ให้ตรวจต่อได้[1][2]
  • ตัวเลขในตารางของ Google นั้น Google คำนวณเองสำหรับบางรายการ ตามที่หน้าวิธีวัดของ DeepMind ระบุไว้ การเอาไปเทียบกับตัวเลขจาก leaderboard สาธารณะตรง ๆ จึงไม่ยุติธรรมกับทั้งสองฝ่าย[11]
  • อัตราการหลอนและความแม่นยำที่ยกมาเป็นผลของ AA-Omniscience เพียงการทดสอบเดียว ไม่ควรใช้แทนผลงานจริงในงานของคุณ[2]
  • ราคาโปรโมชันยังไม่มีวันสิ้นสุด ถ้าจะวางแผนงบระยะยาว ควรคำนวณเผื่อไว้ที่ราคาปกติ 4 และ 20 ดอลลาร์[2]

สรุป

ถ้ามีบทความไหนบอกว่า Gemini 4 Argon คือโมเดลที่เก่งที่สุด คำถามที่ควรถามต่อคือ ในสนามไหน และวัดด้วยเกณฑ์อะไร เพราะสนามที่วัดความชอบของคน กับสนามที่วัดการแก้โจทย์ยาก ให้คำตอบต่างกันได้[2][5][10]

ของ Argon ที่น่าจับตาจริง ๆ ไม่ใช่การได้ที่หนึ่งใน Arena แต่คือการที่ Google กลับมาเทียบชั้นคู่แข่งได้อีกครั้งในราคาที่ถูกกว่า หลังห่างจากโมเดลเรือธงรุ่นก่อนเกิน 7 เดือน และการเลือกให้ Argon ตอบว่า "ไม่รู้" มากกว่าจะเดา ซึ่งเป็นทางเลือกที่เหมาะกับงานที่ความผิดพลาดมีราคาแพง[2][4]

แล้วงานของคุณเป็นแบบไหน ต้องการโมเดลที่กล้าตอบ หรือต้องการโมเดลที่ไม่เดา

แหล่งอ้างอิง

[1] Geeky Gadgets, "Google Gemini 4 Argon Beats Claude Opus 5.5 on Arena AI" (อ้างคลิป Sam Witteveen · 1 ล้านโทเคนต่อคำตอบ · อัตราการหลอน 15% · คะแนน 53 · ราคา 2 และ 10 ดอลลาร์ต่อล้านโทเคน), 2 ตุลาคม 2026. https://www.geeky-gadgets.com/google-gemini-4-argon-2/ (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[2] Artificial Analysis, "Gemini 4 Argon: Google is back as one of the top three labs in intelligence achieved" (คะแนน Intelligence Index 53 เท่ากับ GPT-6 Astra และตาม Claude Opus 5.5 ที่ 58 · อัตราการหลอน 15% ต่ำสุดในกลุ่มที่ได้ 45 ขึ้นไป แต่ความแม่นยำ 50% ต่ำกว่า Astra 13 จุด · ต้นทุนต่องาน 1.99 ดอลลาร์ที่ราคาโปรโมชัน และ 3.98 ที่ราคาปกติ · โทเคนขาออก 62,000 ต่องาน เทียบ 27,000 ของ Astra), 30 กันยายน 2026. https://artificialanalysis.ai/articles/gemini-4-argon-google-top-three-labs (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[3] YouTube oEmbed API ยืนยันวิดีโอ "Gemini 4 Argon" ของช่อง Sam Witteveen มีอยู่จริง. https://www.youtube.com/watch?v=5XTJRU9na3Y (ตรวจด้วย https://www.youtube.com/oembed เมื่อ 2 ตุลาคม 2026)

[4] Zapier, "AutomationBench: AI Agent Benchmarks" (ตารางอันดับ · Gemini 4 Argon High ได้ 51.29% เป็นที่หนึ่ง · Claude Sonnet 5.5 ที่สอง 44.75% · Claude Opus 5.5 ที่สี่ 42.47% · GPT-6 Astra Max ที่ห้า 41.4% · ต้นทุนต่องานคำนวณด้วยราคาปกติ ไม่ใช่ราคาโปรโมชัน), เวอร์ชัน 1.0.6. https://zapier.com/benchmarks (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[5] Arena, "New Release Rankings" (Gemini 4 Argon อยู่ที่หนึ่งหมวดข้อความ · ระบุระดับความพยายาม High). https://arena.ai/leaderboard (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[6] The AI Rankings, "Gemini 4 Argon: Benchmarks, Pricing and Access (2026)" (ประกาศ 30 กันยายน 2026 · ผู้ใช้กลุ่มแรกคือผู้ป้องกันไซเบอร์ในโครงการ Fairwind · ยังไม่มีวันเปิดให้สาธารณะ · ราคาปกติ 4 และ 20 ดอลลาร์ · หน้าต่างบริบท 1 ล้านโทเคน · คำตอบสูงสุด 1 ล้านโทเคน เพิ่มจาก 64,000). https://theairankings.com/google/gemini-4-argon/ (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[7] Google, "Gemini API model catalog" (ณ วันที่เขียน หน้าแคตตาล็อกไม่มีชื่อ Argon หรือ Gemini 4 · มีตระกูล Gemini 3.8 Flash เป็นรุ่นใหม่ล่าสุด). https://ai.google.dev/gemini-api/docs/models (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[8] Google, "Gemini API pricing" (ณ วันที่เขียน หน้า pricing ไม่มีบรรทัดของ Gemini 4 Argon). https://ai.google.dev/gemini-api/docs/pricing (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[9] DEV Community (axrisi), "Gemini 4 Argon: what the benchmarks show and when you can use it" (เจ้าของตัวเลข Harvey Legal Agent Argon 19.6 / Astra 5.4 / Fable 6.7 / Opus 3.8 จากตารางที่ Google พิมพ์เอง · ตารางเทียบของ Google มี 19 แถว Argon ดีที่สุด 14 แถว แต่หนึ่งในนั้นเสมอ · นับตรง ๆ ได้ชนะ 13 เสมอ 1 แพ้ 5 · ทุกตัวเลขในตารางมาจาก Google · ราคาเท่ากับ GPT-6.1 Sol ที่ขายอยู่จริง · ความคิดเห็นใน Hacker News ว่า "มีเพียงหนึ่งการทดสอบที่เทียบได้จริง"). https://dev.to/axrisi/gemini-4-argon-what-the-benchmarks-show-and-when-you-can-use-it-cpb (เข้าถึงเมื่อ 2 ตุลาคม 2026)

[10] UnifyBench, "LLM coding leaderboard" (ถ่วงน้ำหนักข้ามหลายสนาม · Gemini 4 Argon High ได้ 85.7 อยู่ที่ 5 เป็นรอง GPT-6 Astra 92.8, Claude Opus 5.5 91.8, Claude Fable 5.1 90.2 และ GPT-6.1 Sol 90.0 · เก็บหลักฐานระดับความพยายามเมื่อ 1 ตุลาคม 2026). https://unifybench.ai/rankings/coding (เข้าถึงเมื่อ 2 ตุลาคม 2026)
[11] Google DeepMind, "Gemini 4 Argon Model evaluation: Approach, methodology & results" (ระบุว่าแถวใดของตาราง Google ที่ใช้คะแนน "self computed" เช่น DeepSWE v1.1 ที่คำนวณด้วย mini-swe agent harness เอง และ Harvey's Legal Agent Benchmark ที่อ้างจาก Vals AI ขณะที่อีกหลายแถวมาจาก leaderboard สาธารณะ · ผลการวัด as of October 2026 · ตารางผลลัพธ์ทั้ง 19 แถวในไฟล์เป็นภาพ), ประกาศ 30 กันยายน 2026. https://storage.googleapis.com/deepmind-media/gemini/gemini_4_argon_model_evaluation.pdf (PDF 344 KiB = 352,830 ไบต์ · ลิงก์หน้า deepmind.google/models/evals-methodology/gemini-4-argon เปลี่ยนเส้นทางมาที่ไฟล์นี้ · เข้าถึงเมื่อ 2 ตุลาคม 2026)

Top comments (0)