Flash ฆ่า Pro, วันที่ DeepSeek ทิ้งเรือธงตัวเองเพราะรุ่นถูกกว่าเก่งกว่า
โดย Nokka (นก-กา) | 12 กันยายน 2026
บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka
วันที่ 14 กันยายน 2026 เวลา 04:00 UTC จะเป็นวันที่แปลกในประวัติศาสตร์ของวงการ AI
เพราะตั้งแต่วินาทีนั้นเป็นต้นไป ทุกคำขอที่ส่งไปที่ deepseek-v4-pro จะถูกส่งต่อไปยัง V4.1-Flash แทน และจะทำแบบนี้ไปจนกว่า V4.1-Pro จะเปิดตัว [1]
พูดให้ตรงคือ DeepSeek กำลังทิ้งชื่อรุ่นเรือธงของตัวเอง แล้วให้รุ่นที่ตั้งชื่อว่า Flash รับงานแทน
เหตุผลที่บริษัทให้ไว้สั้นมาก การทดสอบจากหลายฝ่ายพบว่า V4.1-Flash ชนะ V4-Pro ทั้งด้านความสามารถ ต้นทุน ความเร็ว และเวลาที่ใช้ทั้งหมด [1]
ประโยคที่ตรงที่สุดในประกาศคือ "เรากำลังทยอยเลิกรุ่น V4-Pro"
ตัวเลขที่อธิบายว่าทำไมถึงเป็นแบบนั้น
ถ้าดูเฉพาะงานที่ต้องลงมือทำจริง ช่องว่างไม่ได้เล็กเลย [2]
| การทดสอบ | V4.1-Flash | V4-Pro |
|---|---|---|
| Terminal-Bench 2.1 | 90.6 | 87.9 |
| Terminal-Bench 4.0 | 31.2 | 12.4 |
| DeepSWE v1.1 | 74.2 | 62.7 |
| AutomationBench | 54.8 | 43.2 |
| Agents' Last Exam | 31.8 | 25.7 |
| CyberGym | 88.1 | 83.3 |
คะแนน Terminal-Bench 2.1 ที่ 90.6 ไม่ได้ชนะแค่รุ่นพี่ในบ้านตัวเอง แต่ยังสูงกว่า Claude Opus 5 ที่ได้ 89.1 และ GPT-5.6 Sol ที่ได้ 88.8 ด้วย [3]
จุดนี้สำคัญกว่าที่เห็น เพราะ Opus 5 เป็นรุ่นที่เปิดตัวหลัง Opus 4.8 การชนะรุ่นใหม่จึงต่างจากการชนะรุ่นเก่ามาก
จากโมเดลที่ราคาต่อล้านโทเคนอยู่ระดับไม่ถึงหนึ่งดอลลาร์
แต่มีอีกด้านที่ตัวเลขเดียวกันบอก
ความสามารถไม่ได้เพิ่มขึ้นทุกด้าน งานที่ต้องใช้ความรู้รอบตัวกลับถอยลงชัดเจน [2][3]
| การทดสอบ | V4.1-Flash | V4-Pro |
|---|---|---|
| GPQA Diamond | 90.9 | 92.4 |
| HLE (ไม่มีเครื่องมือ, ข้อความล้วน) | 39.1 | 42.7 |
| SimpleQA-Verified (ฐาน) | 42.3 | 55.2 |
SimpleQA ที่ตกจาก 55.2 เหลือ 42.3 คือการถอยที่ชัดที่สุด ตัวเลขนี้วัดว่าตัวแบบตอบคำถามข้อเท็จจริงได้แม่นแค่ไหน และเป็นด้านที่คนมักไม่ทันสังเกต เพราะคะแนนที่สื่อนำไปพาดหัวคือด้าน agentic ที่พุ่งขึ้น
ภาพที่ออกมาคือโมเดลที่เก่งขึ้นในการลงมือทำงาน แต่รู้เรื่องโลกน้อยลง
สมมติฐานที่คนส่วนใหญ่เข้าใจผิด
หลายคนเข้าใจว่าค่ายใหญ่ทั้งสามมีทั้งรุ่นเรือธงและรุ่น Flash ให้เลือกครบ ตรวจจากแหล่งทางการแล้วความจริงไม่เหมือนกัน [1][4][5]
Z.ai มีคู่จริง ทั้ง GLM-5.3 (753,000 ล้านพารามิเตอร์) และ GLM-5.3-Flash (320,000 ล้าน) เปิดตัวพร้อมหน้ากระดาษเดียวกัน [4]
DeepSeek มีทุ่มเดียว V4.1 ออกมาในร่าง Flash ก่อน และ V4.1-Pro ยังไม่มีกำหนด ระหว่างนี้คำขอเดิมจะถูกส่งมาที่ Flash [1]
Moonshot ไม่มีเลย Kimi K3 มีรุ่นเดียวที่ 2,800,000 ล้านพารามิเตอร์ ทางเลือกที่ถูกกว่าคือ K2.7 Code ที่ราคา 0.95 ต่อ 4.00 ดอลลาร์ ซึ่งเป็นคนละรุ่น ไม่ใช่ K3 ที่ย่อส่วน [5][6]
ความต่างนี้ไม่ใช่รายละเอียดเล็กน้อย เพราะมันบอกว่าค่ายไหนเชื่อว่าเส้นทางของ Flash คือคำตอบของอนาคต
สามกลยุทธ์ในสมรภูมิเดียว
เมื่อวางสามค่ายข้างกัน จะเห็นว่าแต่ละรายเดิมพันคนละทาง ไม่ได้แข่งกันที่ราคาอย่างเดียว
Z.ai เดิมพันที่การย่อส่วนพร้อมขยายคู่ เขาทำทั้งรุ่นใหญ่และรุ่นเล็ก และเปิดตัวเลขว่าตัวเล็กใช้พลังประมวลผลความสนใจน้อยกว่า 3 เท่า และแคช KV เล็กลง 4.4 เท่า เมื่อเทียบกับรุ่นใหญ่ [4]
ตัวเลขนี้สำคัญกว่าที่เห็น เพราะบริบททั้งคู่รองรับ 1 ล้านโทเคนเท่ากัน แต่ต้นทุนในการเสิร์ฟบริบทนั้นไม่เท่ากัน
DeepSeek เดิมพันที่การทุ่มสุดตัวไปทางเดียว เขาไม่ได้ทำรุ่นเล็กให้เป็นตัวเลือกรอง แต่ย้ายทั้ง API มาไว้ที่ Flash และลดราคาลงตามสถาปัตยกรรมใหม่ที่ใหญ่ขึ้นจริง (552,000 ล้านพารามิเตอร์) แต่เดินงานน้อยลงต่อโทเคน [1]
พร้อมระบุว่าแคช KV ใช้หน่วยความจำเหลือหนึ่งในสี่ และพื้นที่จัดเก็บเหลือหนึ่งในแปด [1]
Moonshot เดิมพันที่ขนาด เขาเลือกสร้างรุ่นใหญ่ที่สุดในโลกแบบเปิดน้ำหนัก และไม่ยอมทำรุ่นย่อที่แข่งราคา ผลคือ K3 ไม่ได้อยู่ในตลาดราคาถูกอีกต่อไป ราคา 3.00 ต่อ 15.00 ดอลลาร์ถือว่าแพงกว่าที่ค่ายจีนเคยทำ [5][6]
ราคาที่บอกความต่างของสามกลยุทธ์
| โมเดล | พารามิเตอร์รวม/ใช้งาน | ราคาต่อล้าน (เข้า/ออก) | คะแนนรวม AA | ต้นทุนต่องาน |
|---|---|---|---|---|
| GLM-5.3-Flash | 320B / 18B | $0.15 / $0.50 | 42 | $0.25 |
| DeepSeek V4.1 Flash | 552B / 16B | $0.30 / $1.20 | 40 | $0.27 |
| GLM-5.3 | 753B / 40B | $1.40 / $4.40 | 45 | $2.01 |
| Kimi K3 | 2.8T / 104B | $3.00 / $15.00 | 44 | $2.00 |
ตัวเลขในคอลัมน์สุดท้ายมาจากการวัดของ Artificial Analysis บนดัชนีเวอร์ชัน 4.3 ชุดเดียวกัน [7][8]
อ่านแล้วจะเห็นภาพว่าคะแนนรวมต่างกันไม่มาก แต่ต้นทุนต่องานต่างกันได้ถึงแปดเท่า
จุดที่ต้องระวังคือคะแนนชุดนี้ขึ้นกับเวอร์ชันของดัชนีด้วย ไม่ได้ขึ้นกับตัวโมเดลอย่างเดียว ตัวอย่างที่ชัดคือ GLM-5.3-Flash ได้ 57 บนดัชนีเวอร์ชัน 4.1.1 ซึ่งเป็นตัวเลขที่ค่ายผู้ผลิตอ้างในหน้าประกาศของตัวเอง [4] แต่บนเวอร์ชัน 4.3 ที่เปิดตัววันที่ 7 กันยายน คะแนนเดียวกันเหลือ 42 [10]
ต่างกัน 15 จุดโดยที่ตัวโมเดลไม่ได้เปลี่ยน แต่ชุดทดสอบยากขึ้น ถ้าเห็นตัวเลขสองชุดที่ขัดกัน ต้องเช็คก่อนว่าอ้างดัชนีเวอร์ชันไหน
กับดักที่ซ่อนอยู่ในราคา
ทั้ง GLM-5.3 และ Kimi K3 มีกลไกที่ทำให้ต้นทุนจริงสูงกว่าที่ราคาต่อโทเคนบอก คือโหมดคิดเหตุผลเปิดอยู่ตลอดและปิดไม่ได้ [6][9]
Kimi K3 ปรับได้แค่ระดับต่ำ กลาง และสูงสุด โดยค่าตั้งต้นคือสูงสุด และโมเดลนี้ถูกฝึกมาให้คิดเสมอ ไม่มีโหมดปิดสมอง [5]
ผลคือทุกคำขอจะสร้างโทเคนของการคิดเพิ่มขึ้นเสมอ ซึ่งเป็นโทเคนที่จ่ายเงินจริง
อีกกับดักหนึ่งเจาะจงที่ Kimi K3 คือการใช้งานหลายรอบต้องส่งข้อความของผู้ช่วยกลับไปทั้งก้อน รวมถึงส่วนการคิดและรายการเรียกเครื่องมือ ถ้าเครื่องมือที่ใช้เก็บมาแค่เนื้อหาคำตอบ โมเดลจะตอบแย่ลงแบบเงียบ ๆ โดยไม่มีข้อความเตือน [5]
ข้อควรระวังก่อนตัดสินใจ
หนึ่ง ตัวเลขการทดสอบทั้งหมดที่ยกมาเป็นของแต่ละค่ายหรือหน่วยวัดอิสระที่เลือกชุดทดสอบเอง การเทียบข้ามค่ายต้องดูว่าชุดทดสอบเดียวกันหรือไม่ ไม่ใช่ดูแค่ตัวเลข [2][4]
สอง คะแนนรวมแบบเดียวไม่บอกว่าตัวไหนเหมาะกับงานคุณ งานเขียนโค้ดยาวกับงานตอบคำถามข้อเท็จจริงใช้ตัวเลขชุดต่างกัน และผลออกมาต่างกันชัด
สาม ราคาที่ประกาศมักมีช่วงเวลาโปรโมชันและอัตราแคชที่ต่างจากราคาปกติหลายเท่า ค่าแคชของ DeepSeek อยู่ที่ 0.006 ดอลลาร์ต่อล้านโทเคน ซึ่งต่ำกว่าราคาปกติถึงห้าสิบเท่า [1] งานที่ใช้บริบทซ้ำจะถูกลงมากกว่าราคาบนกระดาษ
สี่ การที่ DeepSeek เปลี่ยนเส้นทางคำขอเดิมไปยังรุ่นใหม่หมายความว่าระบบที่ยังระบุชื่อรุ่นเก่าจะเปลี่ยนพฤติกรรมทันที ควรตรึงชื่อรุ่นให้ชัดเจนและทดสอบซ้ำก่อนใช้งานจริง [1]
มุมมองจากคนที่ใช้โมเดลเหล่านี้ทำงานทุกวัน
ผมใช้ทั้งสามค่ายในงานเขียนและตรวจงานทุกวัน และสิ่งที่บทเรียนนี้สอนผมคือการเลือกโมเดลจากชื่อหรือจากราคาต่อโทเคนไม่พออีกแล้ว
ผมเคยคิดว่ารุ่นที่มีคำว่า Flash ต่อท้ายคือรุ่นที่ถูกลดความสามารถเพื่อประหยัดเงิน แต่สิ่งที่ DeepSeek ทำคือกลับสมมติฐานนั้น เพราะรุ่น Flash ของเขาเอาชนะรุ่นที่ไม่มีคำต่อท้ายได้ตรง ๆ
สิ่งที่ผมเห็นว่าควรจับตาต่อไปไม่ใช่ตัวเลขในรอบนี้ แต่ว่าอีกสองค่ายจะตอบโต้อย่างไร ถ้า Moonshot ออกรุ่นย่อของ K3 ออกมาจริง ตลาดราคาถูกจะแข่งกันดุขึ้นอีก และถ้า V4.1-Pro ออกมาแล้วชนะ Flash ของตัวเองได้ ก็จะยืนยันว่าเส้นทางนี้ยังไม่จบ
คำแนะนำที่ผมใช้อยู่จริงคืออย่าผูกกับค่ายเดียว ตั้งค่าให้สลับโมเดลได้ด้วยการแก้ค่าเดียว แล้ววัดด้วยงานจริงของตัวเองทุกครั้งที่มีรุ่นใหม่ เพราะกระดานนี้เปลี่ยนทุกเดือน และชื่อรุ่นที่เคยหมายถึงระดับความสามารถ ก็ไม่หมายความแบบนั้นอีกแล้ว
แหล่งอ้างอิง
[1] DeepSeek, "DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient" (10 ก.ย. 2026), https://api-docs.deepseek.com/news/news260910/
[2] DeepSeek API Docs, "Change Log" (2026), https://api-docs.deepseek.com/updates/
[3] Coursiv, "DeepSeek V4.1 Flash Replaces V4 Pro: Pricing and Benchmarks" (2026), https://coursiv.io/blog/deepseek-v4-1-flash
[4] Z.ai, "GLM-5.3-Flash: Frontier Intelligence, Flash Cost" (2026), https://z.ai/blog/glm-5.3-flash
[5] Moonshot AI, "Kimi K3 Tech Blog: Open Frontier Intelligence" (16 ก.ค. 2026), https://www.kimi.ai/blog/kimi-k3
[6] BenchLM.ai, "Kimi API Pricing (September 2026): Kimi K3 at $3/$15" (2026), https://benchlm.ai/moonshot/api-pricing
[7] Artificial Analysis, "DeepSeek V4.1 Flash (Reasoning, Max Effort) vs GLM-5.3-Flash" (2026), https://artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash
[8] Artificial Analysis, "GLM-5.3-Flash vs Kimi K3 (max)" (2026), https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-glm-5-3-flash
[9] OpenRouter, "Z.ai: GLM 5.3 Flash" (2026), https://openrouter.ai/z-ai/glm-5.3-flash
[10] Artificial Analysis, "Announcing the Artificial Analysis Intelligence Index v4.3" (7 ก.ย. 2026), https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3
Top comments (0)