Grok 4.7 ครึ่งราคาคู่แข่งระดับเดียวกัน Terminal-Bench พุ่งเกือบเท่าตัว
โดย Nokka (นก-กา) | 24 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
สงครามราคาโมเดลของสัปดาห์ที่ผ่านมากินพื้นที่โซเชียลแทบไม่มีที่เหลือ จนหลายคนลืมว่ามีโมเดลเปิดตัวก่อนความวุ่นวายนั้นหนึ่งวัน นั่นคือ Grok 4.7 โมเดล AI รุ่นใหม่ของ SpaceXAI ออกเมื่อ 21 กันยายน ในราคา 2 ดอลลาร์ต่อล้านโทเคนขาเข้าและ 6 ดอลลาร์ขาออก
ผมไล่อ่านหน้าประกาศทางการจนจบเพื่อดูว่าคำโปรยเรื่องราคาต่อประสิทธิภาพของบริษัทเพี้ยนจากตัวเลขจริงไหม คำตอบคือตรงเป็นส่วนใหญ่ แต่มีจุดที่ควรอ่านให้เป็นเหมือนการอ่านผลทดสอบของทุกค่าย
อัปเกรดจาก Grok 4.6 ตรงไหน
จุดต่างเริ่มจากฐานโมเดลใหม่ที่ใหญ่กว่า Grok 4.6 [4] ผ่านการฝึกด้วย reinforcement learning ที่ยาวขึ้นบนชุดโจทย์ที่ยากกว่าเดิม โดยให้น้ำหนักโจทย์ที่ต้องทำต่อเนื่องหลายชั่วโมง [1]
ทีมงานระบุว่าโมเดลตรวจทานงานของตัวเองได้รอบคอบขึ้นและจัดการบริบทยาวได้ดีขึ้น สำหรับคนทำเอเจนต์ อีกจุดที่น่าสนใจคือโมเดลถูกฝึกให้เข้าใจ harness ของ Grok Bot โดยตรง ซึ่งช่วยงานสนทนาและงานความรู้ทั่วไป [1]
ตัวเลขเทียบกับคู่แข่งระดับเดียวกัน
ตารางนี้คัดจากหน้าประกาศทางการของ SpaceXAI ซึ่งเลือกคู่เทียบเป็น GPT-5.6 Sol Max และ Fable 5.1 Max [1]
| การทดสอบ | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol Max | Fable 5.1 Max |
|---|---|---|---|---|
| ราคาขาเข้า/ขาออก ต่อล้านโทเคน | $2/$6 | $2/$6 | $4/$20 | $10/$50 |
| CursorBench 4.0 งานซอฟต์แวร์ยาว | 46.3% | 40.4% | 41.7% | 51.8% |
| Terminal-Bench 4.0 งานเทอร์มินัลหลายชั่วโมง | 38.0% | 20.3% | 37.3% | 57.9% |
| DeepSWE v1.1 (high effort) | 71.0% | 65.2% | 72.7% | 70.0% |
| EEBench วิศวกรรมไฟฟ้า | 64.0% | 53.0% | 39.4% | 56.4% |
| Harvey Legal Agent งานกฎหมาย | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional งานคลินิก | 56.7% | 48.5% | 60.5% | 62.1% |
| AA Briefcase v1.1 งานสำนักงานยาว | 1,657 | 1,546 | 1,487 | 1,678 |
จุดเด่นที่เห็นชัด
นโยบายให้น้ำหนักโจทย์ยาวเห็นผลชัดที่สุดใน Terminal-Bench 4.0 ที่ขยับจาก 20.3% มาที่ 38.0% เกือบเท่าตัว และเกือบเทียบ Sol Max ที่ 37.3% ได้แล้ว [1]
งานกฎหมายบน Harvey Legal Agent Benchmark คะแนน 19.6% ทิ้งห่างคู่แข่งทั้งสองตัวที่เหลือ 2.5% กับ 6.7% อย่างชัดเจน ส่วน GDPval ที่จำลองงานวิชาชีพอย่างทนายความ พยาบาล และนักวิเคราะห์การเงิน ขยับจาก 1,605 เป็น 1,695 คะแนน ตามที่ TechTalkThai อ่านจากกราฟของทางการ [2]
จุดที่ยังตามหลัง
งานคลินิกบน HealthBench Professional ยังอยู่ที่ 56.7% ตามหลัง Sol Max ที่ 60.5% และ Fable ที่ 62.1% ส่วน CursorBench และ DeepSWE ยังไม่แตะหัวตาราง อ่านรวม ๆ แล้ว Grok 4.7 เก่งเฉพาะทางไม่ยึดติดกับสนามใดสนามหนึ่งแต่ยังไม่ครองแชมป์เรื่องความเก่งรอบด้าน
จุดขายจริงคือราคาต่อประสิทธิภาพ
หัวข้อประกาศเขียนสั้น ๆ ว่าเร็วเป็นสองเท่าในราคาครึ่งหนึ่งของโมเดลระดับเทียบเคียง โดยเสิร์ฟในราคาและความเร็วเดียวกับ Grok 4.6 [1]
ตัวอย่างคิดเป็นเงินจริง ถ้าทีมใช้โค้ดผ่านโมเดลวันละ 5 ล้านโทเคนขาเข้าและ 10 ล้านขาออก กับ Grok 4.7 จ่ายราว 70 ดอลลาร์ต่อวัน กับ Sol Max จ่ายราว 220 ดอลลาร์ ต่างกันราว 4,500 ดอลลาร์ต่อเดือนโดยประมาณ และกับ Fable 5.1 Max คือราว 550 ดอลลาร์ต่อวัน ต่างกันเป็นหมื่นดอลลาร์ต่อเดือน เทียบเป็นตัวเลขก็คือ Sol Max เก็บขาเข้าแพงกว่าสองเท่าและขาออกแพงกว่าสามเท่า ส่วน Fable 5.1 Max เก็บขาเข้าแพงกว่าห้าเท่าและขาออกแพงกว่าแปดเท่า ถ้าคิดเป็นค่าใช้จ่ายต่องานจริง ช่องว่างนี้คือสนามที่ Grok 4.7 เล่นเกมของตัวเอง ผู้ที่ต้องการความเร็วยังมีตัวเลือก fast variant ที่ความเร็วขาออกเพิ่มสองเท่าในราคาสองเท่า [2]
เกราะป้องกันชุดใหม่ที่ถูกพูดถึงน้อยไป
ส่วนที่องค์กรควรให้น้ำหนักคือ safeguard stack ที่ออกแบบใหม่ทั้งชุด ซึ่งบริษัทอ้างว่าแข็งแรงที่สุดเท่าที่เคยทดสอบมา ทั้งการปฏิเสธคำขอที่ไม่เหมาะสมและการต้านทาน jailbreak โดยเฉพาะโดเมน dual-use อย่างงาน cybersecurity และงานชีวภาพ ตัวเลขที่น่าสนใจคือชนะสุดของ biosafety benchmark ของ LatchBio ที่ 62.4% และบน HackerBench v0.3 ซึ่งวัดงาน cyber ที่มีความเสี่ยง โมเดลปล่อย prompt กลุ่มเสี่ยงผ่านเพียง 3.3% แต่แทบไม่บล็อกงานความปลอดภัยที่ถูกต้องตามวัตถุประสงค์ ล่าสุดบริษัทเริ่มเปิดให้พันธมิตร cybersecurity บางรายเข้าถึงความสามารถ red-team แบบ invite-only เพื่องานวิจัยเชิงป้องกัน [1][2]
ใช้ได้จากไหน และมุมของทีมเล็ก
Grok 4.7 เปิดใช้แล้วผ่าน Cursor และ Grok Build รวมถึง Grok API, coding harness จากผู้อื่น, model router และ cloud platform ต่าง ๆ รายละเอียดเชิงเทคนิคอยู่ที่เอกสารของ docs.x.ai [2][3] สำหรับทีมไทยที่กำลังเลือกโมเดลทำงานจริง ผมสรุปเป็นสามข้อ งานเทอร์มินัลหนัก ๆ Fable ยังนำห่างและยังแพงมาก งานกฎหมายและวิศวกรรมไฟฟ้าเป็นจุดเด่นที่ Grok 4.7 หนีคู่แข่งชัด และถ้าคิดเรื่องงบจริง ราคาขาออกที่ถูกกว่า Sol Max กว่าสามเท่าคือเหตุผลที่คุ้มลอง
ข้อควรระวังท้ายบท ตารางทั้งหมดมาจากการเลือกของค่ายเอง อ่านเป็นทิศทางได้ แต่ตัดสินใจซื้อควรทดสอบกับงานจริงของทีมก่อนเสมอ
อ้างอิง:
[1] SpaceXAI. "Introducing Grok 4.7." x.ai, 21 กันยายน 2026. https://x.ai/news/grok-4-7
[2] TechTalkThai. "SpaceXAI เปิดตัว Grok 4.7 โมเดล AI สำหรับงาน Coding ชูจุดเด่นด้านราคาต่อประสิทธิภาพ." techtalkthai.com, กันยายน 2026. https://www.techtalkthai.com/spacexai-launches-grok-4-7-coding-ai-model-price-performance/
[3] SpaceXAI. "Grok API Documentation." docs.x.ai, 2026. https://docs.x.ai
[4] SpaceXAI. "Introducing Grok 4.6." x.ai, 2026. https://x.ai/news/grok-4-6

Top comments (0)