DEV Community

Nokka
Nokka

Posted on

Flash ฆ่า Pro, วันที่ DeepSeek ทิ้งเรือธงตัวเองเพราะรุ่นถูกกว่าเก่งกว่า

Flash ฆ่า Pro, วันที่ DeepSeek ทิ้งเรือธงตัวเองเพราะรุ่นถูกกว่าเก่งกว่า

โดย Nokka (นก-กา) | 12 กันยายน 2026

บทความนี้เขียนโดย AI (deepseek-v4.1-flash) ผ่าน Hermes Agent ตรวจสอบและเรียบเรียงโดย Nokka

วันที่ 14 กันยายน 2026 เวลา 04:00 UTC จะเป็นวันที่แปลกในประวัติศาสตร์ของวงการ AI

เพราะตั้งแต่วินาทีนั้นเป็นต้นไป ทุกคำขอที่ส่งไปที่ deepseek-v4-pro จะถูกส่งต่อไปยัง V4.1-Flash แทน และจะทำแบบนี้ไปจนกว่า V4.1-Pro จะเปิดตัว [1]

พูดให้ตรงคือ DeepSeek กำลังทิ้งชื่อรุ่นเรือธงของตัวเอง แล้วให้รุ่นที่ตั้งชื่อว่า Flash รับงานแทน

เหตุผลที่บริษัทให้ไว้สั้นมาก การทดสอบจากหลายฝ่ายพบว่า V4.1-Flash ชนะ V4-Pro ทั้งด้านความสามารถ ต้นทุน ความเร็ว และเวลาที่ใช้ทั้งหมด [1]

ประโยคที่ตรงที่สุดในประกาศคือ "เรากำลังทยอยเลิกรุ่น V4-Pro"

ตัวเลขที่อธิบายว่าทำไมถึงเป็นแบบนั้น

ถ้าดูเฉพาะงานที่ต้องลงมือทำจริง ช่องว่างไม่ได้เล็กเลย [2]

การทดสอบ V4.1-Flash V4-Pro
Terminal-Bench 2.1 90.6 87.9
Terminal-Bench 4.0 31.2 12.4
DeepSWE v1.1 74.2 62.7
AutomationBench 54.8 43.2
Agents' Last Exam 31.8 25.7
CyberGym 88.1 83.3

คะแนน Terminal-Bench 2.1 ที่ 90.6 ไม่ได้ชนะแค่รุ่นพี่ในบ้านตัวเอง แต่ยังสูงกว่า Claude Opus 5 ที่ได้ 89.1 และ GPT-5.6 Sol ที่ได้ 88.8 ด้วย [3]

จุดนี้สำคัญกว่าที่เห็น เพราะ Opus 5 เป็นรุ่นที่เปิดตัวหลัง Opus 4.8 การชนะรุ่นใหม่จึงต่างจากการชนะรุ่นเก่ามาก

จากโมเดลที่ราคาต่อล้านโทเคนอยู่ระดับไม่ถึงหนึ่งดอลลาร์

แต่มีอีกด้านที่ตัวเลขเดียวกันบอก

ความสามารถไม่ได้เพิ่มขึ้นทุกด้าน งานที่ต้องใช้ความรู้รอบตัวกลับถอยลงชัดเจน [2][3]

การทดสอบ V4.1-Flash V4-Pro
GPQA Diamond 90.9 92.4
HLE (ไม่มีเครื่องมือ, ข้อความล้วน) 39.1 42.7
SimpleQA-Verified (ฐาน) 42.3 55.2

SimpleQA ที่ตกจาก 55.2 เหลือ 42.3 คือการถอยที่ชัดที่สุด ตัวเลขนี้วัดว่าตัวแบบตอบคำถามข้อเท็จจริงได้แม่นแค่ไหน และเป็นด้านที่คนมักไม่ทันสังเกต เพราะคะแนนที่สื่อนำไปพาดหัวคือด้าน agentic ที่พุ่งขึ้น

ภาพที่ออกมาคือโมเดลที่เก่งขึ้นในการลงมือทำงาน แต่รู้เรื่องโลกน้อยลง

สมมติฐานที่คนส่วนใหญ่เข้าใจผิด

หลายคนเข้าใจว่าค่ายใหญ่ทั้งสามมีทั้งรุ่นเรือธงและรุ่น Flash ให้เลือกครบ ตรวจจากแหล่งทางการแล้วความจริงไม่เหมือนกัน [1][4][5]

Z.ai มีคู่จริง ทั้ง GLM-5.3 (753,000 ล้านพารามิเตอร์) และ GLM-5.3-Flash (320,000 ล้าน) เปิดตัวพร้อมหน้ากระดาษเดียวกัน [4]

DeepSeek มีทุ่มเดียว V4.1 ออกมาในร่าง Flash ก่อน และ V4.1-Pro ยังไม่มีกำหนด ระหว่างนี้คำขอเดิมจะถูกส่งมาที่ Flash [1]

Moonshot ไม่มีเลย Kimi K3 มีรุ่นเดียวที่ 2,800,000 ล้านพารามิเตอร์ ทางเลือกที่ถูกกว่าคือ K2.7 Code ที่ราคา 0.95 ต่อ 4.00 ดอลลาร์ ซึ่งเป็นคนละรุ่น ไม่ใช่ K3 ที่ย่อส่วน [5][6]

ความต่างนี้ไม่ใช่รายละเอียดเล็กน้อย เพราะมันบอกว่าค่ายไหนเชื่อว่าเส้นทางของ Flash คือคำตอบของอนาคต

สามกลยุทธ์ในสมรภูมิเดียว

เมื่อวางสามค่ายข้างกัน จะเห็นว่าแต่ละรายเดิมพันคนละทาง ไม่ได้แข่งกันที่ราคาอย่างเดียว

Z.ai เดิมพันที่การย่อส่วนพร้อมขยายคู่ เขาทำทั้งรุ่นใหญ่และรุ่นเล็ก และเปิดตัวเลขว่าตัวเล็กใช้พลังประมวลผลความสนใจน้อยกว่า 3 เท่า และแคช KV เล็กลง 4.4 เท่า เมื่อเทียบกับรุ่นใหญ่ [4]

ตัวเลขนี้สำคัญกว่าที่เห็น เพราะบริบททั้งคู่รองรับ 1 ล้านโทเคนเท่ากัน แต่ต้นทุนในการเสิร์ฟบริบทนั้นไม่เท่ากัน

DeepSeek เดิมพันที่การทุ่มสุดตัวไปทางเดียว เขาไม่ได้ทำรุ่นเล็กให้เป็นตัวเลือกรอง แต่ย้ายทั้ง API มาไว้ที่ Flash และลดราคาลงตามสถาปัตยกรรมใหม่ที่ใหญ่ขึ้นจริง (552,000 ล้านพารามิเตอร์) แต่เดินงานน้อยลงต่อโทเคน [1]

พร้อมระบุว่าแคช KV ใช้หน่วยความจำเหลือหนึ่งในสี่ และพื้นที่จัดเก็บเหลือหนึ่งในแปด [1]

Moonshot เดิมพันที่ขนาด เขาเลือกสร้างรุ่นใหญ่ที่สุดในโลกแบบเปิดน้ำหนัก และไม่ยอมทำรุ่นย่อที่แข่งราคา ผลคือ K3 ไม่ได้อยู่ในตลาดราคาถูกอีกต่อไป ราคา 3.00 ต่อ 15.00 ดอลลาร์ถือว่าแพงกว่าที่ค่ายจีนเคยทำ [5][6]

ราคาที่บอกความต่างของสามกลยุทธ์

โมเดล พารามิเตอร์รวม/ใช้งาน ราคาต่อล้าน (เข้า/ออก) คะแนนรวม AA ต้นทุนต่องาน
GLM-5.3-Flash 320B / 18B $0.15 / $0.50 42 $0.25
DeepSeek V4.1 Flash 552B / 16B $0.30 / $1.20 40 $0.27
GLM-5.3 753B / 40B $1.40 / $4.40 45 $2.01
Kimi K3 2.8T / 104B $3.00 / $15.00 44 $2.00

ตัวเลขในคอลัมน์สุดท้ายมาจากการวัดของ Artificial Analysis บนดัชนีเวอร์ชัน 4.3 ชุดเดียวกัน [7][8]

อ่านแล้วจะเห็นภาพว่าคะแนนรวมต่างกันไม่มาก แต่ต้นทุนต่องานต่างกันได้ถึงแปดเท่า

จุดที่ต้องระวังคือคะแนนชุดนี้ขึ้นกับเวอร์ชันของดัชนีด้วย ไม่ได้ขึ้นกับตัวโมเดลอย่างเดียว ตัวอย่างที่ชัดคือ GLM-5.3-Flash ได้ 57 บนดัชนีเวอร์ชัน 4.1.1 ซึ่งเป็นตัวเลขที่ค่ายผู้ผลิตอ้างในหน้าประกาศของตัวเอง [4] แต่บนเวอร์ชัน 4.3 ที่เปิดตัววันที่ 7 กันยายน คะแนนเดียวกันเหลือ 42 [10]

ต่างกัน 15 จุดโดยที่ตัวโมเดลไม่ได้เปลี่ยน แต่ชุดทดสอบยากขึ้น ถ้าเห็นตัวเลขสองชุดที่ขัดกัน ต้องเช็คก่อนว่าอ้างดัชนีเวอร์ชันไหน

กับดักที่ซ่อนอยู่ในราคา

ทั้ง GLM-5.3 และ Kimi K3 มีกลไกที่ทำให้ต้นทุนจริงสูงกว่าที่ราคาต่อโทเคนบอก คือโหมดคิดเหตุผลเปิดอยู่ตลอดและปิดไม่ได้ [6][9]

Kimi K3 ปรับได้แค่ระดับต่ำ กลาง และสูงสุด โดยค่าตั้งต้นคือสูงสุด และโมเดลนี้ถูกฝึกมาให้คิดเสมอ ไม่มีโหมดปิดสมอง [5]

ผลคือทุกคำขอจะสร้างโทเคนของการคิดเพิ่มขึ้นเสมอ ซึ่งเป็นโทเคนที่จ่ายเงินจริง

อีกกับดักหนึ่งเจาะจงที่ Kimi K3 คือการใช้งานหลายรอบต้องส่งข้อความของผู้ช่วยกลับไปทั้งก้อน รวมถึงส่วนการคิดและรายการเรียกเครื่องมือ ถ้าเครื่องมือที่ใช้เก็บมาแค่เนื้อหาคำตอบ โมเดลจะตอบแย่ลงแบบเงียบ ๆ โดยไม่มีข้อความเตือน [5]

ข้อควรระวังก่อนตัดสินใจ

หนึ่ง ตัวเลขการทดสอบทั้งหมดที่ยกมาเป็นของแต่ละค่ายหรือหน่วยวัดอิสระที่เลือกชุดทดสอบเอง การเทียบข้ามค่ายต้องดูว่าชุดทดสอบเดียวกันหรือไม่ ไม่ใช่ดูแค่ตัวเลข [2][4]

สอง คะแนนรวมแบบเดียวไม่บอกว่าตัวไหนเหมาะกับงานคุณ งานเขียนโค้ดยาวกับงานตอบคำถามข้อเท็จจริงใช้ตัวเลขชุดต่างกัน และผลออกมาต่างกันชัด

สาม ราคาที่ประกาศมักมีช่วงเวลาโปรโมชันและอัตราแคชที่ต่างจากราคาปกติหลายเท่า ค่าแคชของ DeepSeek อยู่ที่ 0.006 ดอลลาร์ต่อล้านโทเคน ซึ่งต่ำกว่าราคาปกติถึงห้าสิบเท่า [1] งานที่ใช้บริบทซ้ำจะถูกลงมากกว่าราคาบนกระดาษ

สี่ การที่ DeepSeek เปลี่ยนเส้นทางคำขอเดิมไปยังรุ่นใหม่หมายความว่าระบบที่ยังระบุชื่อรุ่นเก่าจะเปลี่ยนพฤติกรรมทันที ควรตรึงชื่อรุ่นให้ชัดเจนและทดสอบซ้ำก่อนใช้งานจริง [1]

มุมมองจากคนที่ใช้โมเดลเหล่านี้ทำงานทุกวัน

ผมใช้ทั้งสามค่ายในงานเขียนและตรวจงานทุกวัน และสิ่งที่บทเรียนนี้สอนผมคือการเลือกโมเดลจากชื่อหรือจากราคาต่อโทเคนไม่พออีกแล้ว

ผมเคยคิดว่ารุ่นที่มีคำว่า Flash ต่อท้ายคือรุ่นที่ถูกลดความสามารถเพื่อประหยัดเงิน แต่สิ่งที่ DeepSeek ทำคือกลับสมมติฐานนั้น เพราะรุ่น Flash ของเขาเอาชนะรุ่นที่ไม่มีคำต่อท้ายได้ตรง ๆ

สิ่งที่ผมเห็นว่าควรจับตาต่อไปไม่ใช่ตัวเลขในรอบนี้ แต่ว่าอีกสองค่ายจะตอบโต้อย่างไร ถ้า Moonshot ออกรุ่นย่อของ K3 ออกมาจริง ตลาดราคาถูกจะแข่งกันดุขึ้นอีก และถ้า V4.1-Pro ออกมาแล้วชนะ Flash ของตัวเองได้ ก็จะยืนยันว่าเส้นทางนี้ยังไม่จบ

คำแนะนำที่ผมใช้อยู่จริงคืออย่าผูกกับค่ายเดียว ตั้งค่าให้สลับโมเดลได้ด้วยการแก้ค่าเดียว แล้ววัดด้วยงานจริงของตัวเองทุกครั้งที่มีรุ่นใหม่ เพราะกระดานนี้เปลี่ยนทุกเดือน และชื่อรุ่นที่เคยหมายถึงระดับความสามารถ ก็ไม่หมายความแบบนั้นอีกแล้ว

แหล่งอ้างอิง

[1] DeepSeek, "DeepSeek-V4.1-Flash: Smarter, Faster, More Efficient" (10 ก.ย. 2026), https://api-docs.deepseek.com/news/news260910/

[2] DeepSeek API Docs, "Change Log" (2026), https://api-docs.deepseek.com/updates/

[3] Coursiv, "DeepSeek V4.1 Flash Replaces V4 Pro: Pricing and Benchmarks" (2026), https://coursiv.io/blog/deepseek-v4-1-flash

[4] Z.ai, "GLM-5.3-Flash: Frontier Intelligence, Flash Cost" (2026), https://z.ai/blog/glm-5.3-flash

[5] Moonshot AI, "Kimi K3 Tech Blog: Open Frontier Intelligence" (16 ก.ค. 2026), https://www.kimi.ai/blog/kimi-k3

[6] BenchLM.ai, "Kimi API Pricing (September 2026): Kimi K3 at $3/$15" (2026), https://benchlm.ai/moonshot/api-pricing

[7] Artificial Analysis, "DeepSeek V4.1 Flash (Reasoning, Max Effort) vs GLM-5.3-Flash" (2026), https://artificialanalysis.ai/models/comparisons/deepseek-v4-1-flash-vs-glm-5-3-flash

[8] Artificial Analysis, "GLM-5.3-Flash vs Kimi K3 (max)" (2026), https://artificialanalysis.ai/models/comparisons/kimi-k3-vs-glm-5-3-flash

[9] OpenRouter, "Z.ai: GLM 5.3 Flash" (2026), https://openrouter.ai/z-ai/glm-5.3-flash

[10] Artificial Analysis, "Announcing the Artificial Analysis Intelligence Index v4.3" (7 ก.ย. 2026), https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-3

Top comments (0)