หลัง Gemma 4 มีอะไรตามมา โมเดลใหม่ 7 ตัวที่คนรันเองควรรู้ ปี 2026
โดย Nokka (นก-กา) | 23 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
ตอนที่แล้วเราคุยเรื่อง Gemma 4 ครอบครัวโมเดลเปิดของ Google ที่ออกปลายเดือนมีนาคม แล้วจบลงด้วยคำถามว่าค่ายอื่นจะตอบโต้อย่างไร คำตอบมาเร็วกว่าที่คิด ภายในหกเดือนถัดมามีโมเดลเปิดน้ำหนักใหม่ออกมารั่วไหลแทบทุกเดือน บางตัวออกมาทีเดียวก็ข้ามหัว Gemma 4 ไปเลย อย่าง Qwen3.8-27B ที่เราจะเห็นกันวันนี้ [1]
ผมรวบรวมจากหน้าเปิดตัวทางการและเอกสารโมเดลบน Hugging Face ทั้งหมด แล้วกรองเหลือเฉพาะตัวที่คนรันเองต้องรู้จริง โดยเกณฑ์สำคัญคือออกหลัง Gemma 4 และมีน้ำหนักเปิดให้ดาวน์โหลดจริง ตัวที่ประกาศแล้วแต่ยังไม่ปล่อยไฟล์จริงอย่าง MiniMax M3 ผมตัดออก ไม่ใช่ข่าวลือแต่ยังใช้ไม่ได้
สนามเดิม มือใหม่ล้วน
โมเดลที่ออกตามหลัง Gemma 4 แบ่งได้สองกลุ่มชัดเจน กลุ่มแรกแข่งตรงกับตัว 31B ของ Google กลุ่มที่สองเล่นเกมราคาถูกจนน่าตกใจ
Muse Glimmer 30B ของ Meta เป็นข่าวใหญ่ที่สุดของกลุ่มแรก ออกเมื่อ 10 สิงหาคม ภายใต้สัญญา Apache 2.0 เต็มตัว ไม่มีเพดานผู้ใช้แบบที่ Llama เคยมี [2] ครั้งนี้เป็นการกลับมาเปิดน้ำหนักครั้งแรกของ Meta หลังหันไปปิดกับสาย Muse Spark พร้อมตอบข้อวิจารณ์เรื่องสัญญาที่ตามมาตั้งแต่ยุค Llama
| โมเดล | ค่าย | ออกเมื่อ | ขนาด | สัญญา | Q4 ราว |
|---|---|---|---|---|---|
| Qwen3.6-35B-A3B | Alibaba | 16 เม.ย. | 35B MoE (3B active) | Apache 2.0 | 18 GB |
| Qwen3.6-27B | Alibaba | 22 เม.ย. | 27B dense | Apache 2.0 | 16 GB |
| Kimi K3 | Moonshot | 26 ก.ค. | 2.8T MoE | Modified MIT | 140 GB |
| Muse Glimmer 30B | Meta | 10 ส.ค. | 29.6B dense | Apache 2.0 | 17 GB |
| Nemotron 3.5 Lightning | NVIDIA | 11 ส.ค. | 31.6B MoE (3.6B active) | OpenMDW-1.1 | 18 GB |
| Qwen3.8-27B | Alibaba | 14 ส.ค. | 27B dense | Apache 2.0 | 16 GB |
| GLM-5.3-Flash | Z.ai | 25 ส.ค. | 320B MoE (18B active) | MIT | 165 GB (FP8) |
ตารางนี้อ่านคู่กับจำนวนเงินในกระเป๋า ตัวสี่อันดับแรกพร้อมสองอันดับถัดมาใส่ได้ในการ์ดจอ 24 GB หนึ่งใบ ซึ่งเป็นเครื่องมาตรฐานของคนรันเองยุคนี้ ส่วน Kimi K3 กับ GLM-5.3-Flash เป็นของคนมีเครื่องแรงหรือเซิร์ฟเวอร์จริงจัง [6][7][8]
Muse Glimmer มือใหม่ที่แข็งที่สุดในสนามเอเจนต์
ตัวเลขที่ต้องพูดถึง
ขอเจาะตัวที่คนรันเองพูดถึงมากที่สุดก่อน ตัวเลขที่ Meta รายงานเองบนงานเอเจนต์สูงกว่าคู่แข่งขามุมอย่างชัดเจน บน MCP Atlas ชุดทดสอบการเรียกใช้เครื่องมือ Glimmer ทำได้ 75.5 ขณะที่ Qwen3.6-27B ได้ 62.5 และ Gemma 4 31B ได้ 54.2 บนงานแก้โค้ดจริงอย่าง SWE-bench Pro ก็ได้ 51.2 แซงหน้าทั้งคู่ [3]
ตัวเลขเหล่านี้มาจากการวัดของ Meta เอง ดังนั้นอ่านเป็นทิศทางได้แต่อย่าเทียบข้ามค่ายแบบเป๊ะ ๆ แม้จะหักความเชื่อมั่นลงครึ่งหนึ่ง ช่องว่างบนงานเอเจนต์ก็ยังกว้างพอให้ Glimmer เป็นตัวเลือกอันดับหนึ่งของสายนี้ในตอนนี้
จุดที่น่าสนใจทางเทคนิคคือสถาปัตยกรรม dense แท้ ๆ 29.6 พันล้านพารามิเตอร์ยิงครบทุกโทเคน ไม่ใช่ MoE แบบคู่แข่งส่วนใหญ่ Meta ส่งชุดควอนไทซ์มาให้พร้อมใช้ ตัวที่ลงการ์ด 24 GB กินพื้นที่ราว 17 GB และแลกคะแนนไปเฉลี่ยราว 1 เปอร์เซ็นต์ บวกกับตัวเร่งความเร็ว DFlash ที่อ้างว่าเร่งได้ถึง 3.1 เท่าบนการ์ดใหม่ [3][4]
Qwen อัปเกรดต่อเนื่องจนเป็นอันตราย
ฝั่งอาลีบาบาเดินหน้าเรื่อย ๆ Qwen3.6-27B ออกเดือนเมษายน แล้ว Qwen3.8-27B มาต่อในสิงหาคมด้วยคะแนนเด่นกว่าเดิมอีก ตัวเลขที่ค่ายรายงานเองชนะ Gemma 4 31B แทบทุกชุดที่เทียบได้ ทั้งงานความรู้ทั่วไป คณิตศาสตร์ และโค้ดแข่งขัน [1][5]
ข้อสังเกตที่สำคัญกว่าชัยชนะรายตัวคือจังหวะการปล่อย อาลีบาบาไม่ได้ปล่อยรุ่นใหญ่ทีเดียวจบ แต่หมั่นส่งรุ่นปรับปรุงเข้ามาเป็นระยะ ทุกสามถึงสี่เดือนก็มีของใหม่ วิธีนี้ทำให้ชุมชนคนรันเองหมุนตัวตามทัน และทำให้โมเดลเดิมอย่าง Gemma 4 ดูเก่งอยู่ไม่กี่เดือนก็มีคนมาแทรกแซง
ส่วนที่ยังเป็นจุดอ่อนของ Qwen คือเอกสารสัญญาที่ซับซ้อนขึ้นเรื่อย ๆ เมื่อไปถึงตัวใหญ่พิเศษอย่าง Qwen3.8-Max ที่ใช้สัญญาแบบแบ่งรายได้ ต่างจากตัว 27B ที่ยังเป็น Apache 2.0 สบาย ๆ
ตัวเล็กที่แอบดี
สองตัวที่ผมคิดว่าคนมองข้ามที่สุดคือ Qwen3.6-35B-A3B และ Nemotron 3.5 Lightning ทั้งคู่เป็น MoE ที่มีพารามิเตอร์รวมสามสิบกว่าพันล้านแต่กระตุ้นจริงแค่สามกว่าพันล้านต่อโทเคน ผลคือความเร็วระดับโมเดลเล็กกับคุณภาพใกล้รุ่นใหญ่
ตัวอย่างที่เป็นรูปธรรม ไฟล์ Q4 ของ Nemotron 3.5 Lightning อยู่ราว 18 GB ใส่ได้สบายในการ์ด 24 GB ที่เหลือพอสำหรับบริบทยาว ขณะที่ความเร็วต่อโทเคนใกล้เคียงโมเดล 4B เพราะจ่ายแค่พารามิเตอร์ที่ตื่นจริง ใครเคยชอบแนวคิด 26B A4B ของ Gemma 4 ต้องลองสองตัวนี้เป็นอย่างแรกเลย [6]
ทางฝั่ง MiMo-V2.6 ของ Xiaomi ที่เพิ่งออกเมื่อวานนี้เองก็เป็นอีกหนึ่งที่น่าจับตา เพราะออกมาไม่ถึงสองวัน ข้อมูลการวัดที่เปิดเผยยังไม่ครบ ผมขอไม่รีบสรุปจนกว่าจะมีตัวเลขจากหน่วยวัดอิสระ
โต๊ะตัดสินสำหรับคนรันเอง
ถ้าถามผมตอนนี้ว่าเลือกตัวไหน คำตอบแบ่งตามงาน งานเอเจนต์และการเรียกเครื่องมือถือว่า Muse Glimmer นำอยู่ รองลงมาคือ Qwen3.6 สายรุ่นล่าสุด ส่วนงานทั่วไปที่ต้องความสมดุลภาษาไทยกับความเร็ว Qwen ยังเป็นทางที่ปลอดภัยกว่า และถ้าเครื่องมีแรมจำกัดสองตัว MoE ที่กระตุ้นสามพันล้านคือคำตอบสำหรับเครื่องระดับแล็ปท็อป
ข้อสังเกตสุดท้ายก่อนจากกัน ครั้งนี้ไม่ได้มีแค่ตัวเลข benchmark ที่แตกต่าง แต่สัญญาอนุญาตเริ่มกลายเป็นสมรภูมิจริงจัง Meta ใช้ Apache 2.0 เต็มตัวเป็นครั้งแรก อาลีบาบาคุม Apache ไว้ที่ตัวเล็กแต่ใช้สัญญาพิเศษกับตัวใหญ่ Moonshot อยู่กับ Modified MIT ถ้างานของคุณเป็นผลิตภัณฑ์เชิงพาณิชย์ การอ่านสัญญาให้จบก่อนโหลดน้ำหนักจึงสำคัญไม่แพ้การอ่านตารางคะแนนเลย
อ้างอิง:
[1] QwenLM. "Qwen3.8 Model Card." huggingface.co, 14 สิงหาคม 2026. https://huggingface.co/Qwen/Qwen3.8-27B
[2] Meta Models. "Muse-Glimmer-30B Model Card." huggingface.co, 10 สิงหาคม 2026. https://huggingface.co/meta-models/Muse-Glimmer-30B
[3] The AI Ranklings. "Muse Glimmer." theairankings.com, 12 สิงหาคม 2026. https://theairankings.com/meta/muse-glimmer
[4] Babelwire. "Meta Returns to Open Source With Muse Glimmer, a 30B Agentic Model." babelwire.ai, 10 สิงหาคม 2026. https://babelwire.ai/en/story/meta-muse-glimmer-30b-open-source
[5] QwenLM. "Qwen3.6-27B Model Card." huggingface.co, 22 เมษายน 2026. https://huggingface.co/Qwen/Qwen3.6-27B
[6] NVIDIA. "NVIDIA-Nemotron-3.5-Lightning-30B-A3B Model Card." huggingface.co, 11 สิงหาคม 2026. https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
[7] Moonshot AI. "Kimi-K3 Model Card." huggingface.co, 26 กรกฎาคม 2026. https://huggingface.co/MoonshotAI/Kimi-K3
[8] Z.ai. "GLM-5.3-Flash Model Card." huggingface.co, 25 สิงหาคม 2026. https://huggingface.co/zai-org/GLM-5.3-Flash

Top comments (0)