Hy4 Preview เจาะเบื้องหลัง, MoE 1.56TB ที่ Tencent ยอมรับว่ายัง Overthink
โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 30 สิงหาคม 2026
บทความนี้เขียนโดย AI (glm-5.3 via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก Tencent Hunyuan และ Simon Willison
📚 บทความคู่กัน: บทก่อนหน้า Tencent Hy4 Preview, โมเดล 770B open source ที่ชนะ GLM-5.3 ใน blind test เล่าภาพรวม release, บทนี้เจาะเบื้องหลังเชิงเทคนิคที่ประกาศทางการ + มุมของ Simon Willison เผยเพิ่ม
ก่อนอื่น, ทำความเข้าใจศัพท์
- MoE (Mixture of Experts): โมเดลที่มี "ผู้เชี่ยวชาญ" หลายชุด แต่เปิดใช้เฉพาะชุดที่เกี่ยวข้องต่อโทเคน, ตัวใหญ่แต่วิ่งเบา
- Reasoning effort: ระดับ "ความพยายามในการคิด" ที่ตั้งได้, สูง = คิดนานขึ้นก่อนตอบ
- Reasoning trace: ข้อความ "ความคิดภายใน" ที่โมเดลพิมพ์ก่อนให้คำตอบจริง
ถ้าให้อุปมา: reasoning effort เหมือน "ตั้งเวลาคิด", high คือให้เวลาประชุมยาวๆ ก่อนตัดสินใจ, no_think คือตอบทันทีตามสัญชาตญาณ
ขนาดที่เปลี่ยนไปจากรุ่นพี่ Hy3
ตัวเลขที่น่าทึ่งที่สุดคือ "การกระโดด" จากรุ่นก่อน [1]:
| ตัวชี้วัด | Hy3 (ก.ค. 2026) | Hy4 Preview (ส.ค. 2026) | โตขึ้น |
|---|---|---|---|
| พารามิเตอร์ทั้งหมด | 295B | 770B | 2.6 เท่า |
| Active ต่อโทเคน | 21B | 49B | 2.3 เท่า |
| Context | 256,000 | 1 ล้าน | ~4 เท่า |
| ขนาดไฟล์บน Hugging Face | 598 GB | 1.56 TB | 2.6 เท่า |
(ทุกตัวเลขจากหน้า Hugging Face ทางการ [3])
จาก Hy3 เป็น Hy4 ในเวลาแค่ เดือนเดียว, Tencent ยอมรับเองว่านี่คือ "largest generation-over-generation gain we've measured" (ก้าวกระโดดระหว่างรุ่นที่ใหญ่ที่สุดที่เคยวัดได้) [2]
5 จุดเด่นเชิงเทคนิคจากประกาศทางการ
1. "อยู่ที่งานยากที่สุด", เลือกสนามรบชัดเจน
Tencent ระบุว่า Hy4 Preview ทำได้ดีที่สุดใน 3 งานหนัก [2]:
| สนาม | ทำอะไรได้ |
|---|---|
| Long-horizon software engineering | งานโค้ดที่ต่อเนื่องยาวๆ |
| Document-heavy office work | รวมไฟล์ยุ่งๆ หลายฉบับเป็น document/spreadsheet/presentation |
| Scientific research | จัดการ experiment + ปรับทิศทางวิจัย |
2. สร้างเกม Unity ได้จริง
ตัวอย่างที่ Tencent โชว์: เกม 3D มุมมองบุคคลที่สามใน Unity, นกเพนกวินสำรวจทุ่งหิมะ เก็บเบอร์รี่ เปิดหีป สู้มอนสเตอร์ มี menu/loading/pause ครบ พร้อม animation blend tree, inventory, quest HUD, เพลงและเสียง [2]
3. ใช้เป็น "หัวหน้านักวิจัย" คุม Codex หลายตัว
ส่วนที่น่าสนใจทางเทคนิคสุด: Hy4 Preview ทำหน้าที่ researcher คุม Codex sessions หลายตัวแบบขนาน ปรับทิศทางวิจัยตามผลที่ได้ และชนะ Codex ที่ทำงานคนเดียวในทั้ง 8 benchmarks [2]
นี่คือ "multi-agent orchestration" จริงๆ, โมเดลหนึ่งทำหน้าที่เป็น brain คุม agent อื่นๆ
4. Blind test: ตัวเลขจริงเต็มๆ
จากประกาศทางการ: ผู้เชี่ยวชาญ 163 คน ให้คะแนนงานวิศวกรรม 203 งาน [2]:
| เทียบกับ | คะแนน | Win/Draw/Lose |
|---|---|---|
| GLM 5.3 | 2.99 vs 2.92 | 46.8% / 12.8% / 40.4% |
| Kimi K3 | 2.99 vs 2.94 | 51.2% / 7.9% / 40.9% |
อ่านตัวเลขให้ตรง: ชนะแบบ "เล็กน้อย" จริงๆ, ไม่ใช่ domination (แพ้กันยัง 40% ของงาน)
5. ราคาที่ยังถูกตามสไตล์จีน
- API: $0.834/1M input, $2.501/1M output (ผ่าน Tencent Cloud + OpenRouter)
- ใช้ฟรีใน CodeBuddy, WorkBuddy (2 สัปดาห์แรก), Yuanbao, ima
🔍 มุมของ Simon Willison: สิ่งที่ประกาศไม่ได้บอก
Simon Willison (นักวิเคราะห์ LLM ชื่อดัง) ทดลอง Hy4 Preview และเผยเรื่องน่าสนใจ 3 อย่าง [1]:
1. Reasoning effort มีแค่ 2 ระดับ
จากการอ่าน chat_template.jinja ของโมเดล:
-
high(default), คิดเต็มที่ -
no_think, ปิดการคิด
ไม่มีระดับกลาง แบบที่ค่ายอื่นมี (เช่น low/medium/high), เลือกได้แค่ "คิดเต็มสปีด" หรือ "ไม่คิดเลย"
2. Reasoning trace "ภาษาอังกฤษตัดๆ"
เมื่อสั่งวาด SVG นกเพลิกันขี่จักรยาน (prompt ทดสอบคลาสสิกของเขา), ได้ผลลัพธ์สวยงามจริง แต่ที่น่าสนใจคือ reasoning trace ภายใน:
"Let's maybe add a helmet?... The user didn't ask; can add red helmet? Might be cute. But pelican with big beak; a helmet might obscure. Better maybe no."
"Maybe add sunglasses? no."
"Maybe add water? no."
Simon สังเกตว่าโมเดลใช้ "อังกฤษแบบสั้นตัดๆ" ในการคิดลับ, เพราะ grammar สมบูรณ์ไม่จำเป็นสำหรับความคิดภายใน และประหยัดโทเคน [1]
3. ประกาศทางการยอมรับจุดอ่อนเอง
ส่วนที่ผมชอบที่สุดในประกาศของ Tencent [2]:
"เรา ship พร้อม known issues, รวมถึงการใช้เวลาคิดนานเกินจำเป็นในงานซับซ้อน และแนวโน้มที่จะ over-verify งานตัวเอง"
แปลง่ายๆ: โมเดล "overthink", คิดยาวเกินและตรวจซ้ำเยอะ ซึ่งตรงกับที่ reasoning effort มีแค่ high/no_think: ยังไม่มีตัวเลือก "คิดพอดีๆ"
ทำไมการ "ยอมรับว่ายัง overthink" ถึงสำคัญ
นี่คือมุมที่ผมอยากเน้น, บทวิเคราะห์จาก Claude Memory, DeepSeek ที่มาก่อนหน้า ต่างก็พบปัญหาเดียวกัน:
| โมเดล | ปัญหาที่ยอมรับ |
|---|---|
| Hy4 Preview | คิดนานเกิน + over-verify |
| โมเดล reasoning อื่นๆ ปี 2026 | จ่ายโทเคนแพงเพราะ "คิดยาวเกินจำเป็น" |
และทางออกที่ทุกค่ายกำลังเดิน: ควบคุม "เวลาคิด" ให้เป็นตัวแปรที่จูนได้, เหมือนกับ "Auto mode" ของ Claude Code ที่ผมเขียนไป หรือ DeepAgents ที่ควบคุม reasoning per step
อนาคตของโมเดลใหญ่อาจไม่ใช่ "คิดเก่งขึ้น" แต่คือ "รู้ว่าเมื่อไหร่ไม่ควรคิดนาน"
ข้อควรระวัง: มุมที่ต้องสมดุล
| ข้อดี | ข้อควรระวัง |
|---|---|
| Blind test ผ่านการตรวจจริง (163 experts) | ยังเป็น internal test ของ Tencent |
| ยอมรับ known issues ตรงๆ | Overthink = จ่ายแพงขึ้นในงานง่าย |
| 1M context + MoE เปิดกว้าง | 1.56TB ไฟล์ = คนทั่วไปโหลดไม่ไหว (ต้องรอ quantized) |
| ราคาถูก + ใช้ฟรีหลายช่องทาง | เพิ่งปล่อย 1 วัน, ยังต้องดูการใช้งานจริง |
สรุปมุมมองของผม
ผมมองว่า Hy4 Preview น่าสนใจที่ "ความซื่อสัตย์ของ release", แทนที่จะโฆษณาว่าเก่งทุกอย่าง Tencent เลือกบอกตรงๆ ว่า:
- เก่งสุดใน 3 สนามเฉพาะ (โค้ดยาว, เอกสาร, วิจัย)
- ชนะคู่แข่ง "แบบเล็กน้อย" (ไม่ใช่ domination)
- ยัง overthink, และจะแก้เร็ว
และจุดที่ตื่นเต้นที่สุดเชิงเทคนิคคือส่วน "researcher คุม Codex", เพราะมันคือ preview ของอนาคตที่ผมเขียนเรื่อง multi-agent มาตลอด: โมเดลหนึ่งไม่ได้ทำทุกอย่างเอง แต่ทำหน้าที่ "คิด + มองหา worker ที่เหมาะ", และ 1M context คือสิ่งที่ทำให้การคุม agent หลายตัวเป็นไปได้จริง
ตัวเลขที่อยากให้จำ: 770B พารามิเตอร์ → 49B active → 1 ล้าน context → 1.56TB ไฟล์, ในเดือนเดียวจาก Hy3
คุณคิดยังไงครับ, "โมเดลที่ยอมรับว่าตัวเอง overthink" ดีกว่า "โมเดลที่โฆษณาว่าเก่งทุกอย่าง" ไหม? แล้วเคยเจอ AI ที่คิดยาวเกินจำเป็นจนคิดค่า API แพงกันไหม? คอมเมนต์แลกเปลี่ยนกันได้ครับ
ถ้าชอบบทความแนวเจาะโมเดลแบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon
แหล่งอ้างอิง
[1] Willison, Simon. "Introducing Hy4 Preview". 2026. https://simonwillison.net/2026/Aug/29/hy4/
[2] Tencent Hunyuan. "Introducing Hy4 preview". 2026. https://hy.tencent.ai/research/hy4-preview
[3] Hugging Face. "tencent/Hy4-preview". 2026. https://huggingface.co/tencent/Hy4-preview
บทความนี้วิเคราะห์จากประกาศทางการของ Tencent Hunyuan และบทวิเคราะห์ของ Simon Willison ข้อมูล ณ 30 สิงหาคม 2026 Nokka

Top comments (0)