DEV Community

Nokka
Nokka

Posted on

Hy4 Preview เจาะเบื้องหลัง, MoE 1.56TB ที่ Tencent ยอมรับว่ายัง Overthink

Hy4 Preview เจาะเบื้องหลัง, MoE 1.56TB ที่ Tencent ยอมรับว่ายัง Overthink

โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 30 สิงหาคม 2026

บทความนี้เขียนโดย AI (glm-5.3 via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก Tencent Hunyuan และ Simon Willison

Hy4 Preview

📚 บทความคู่กัน: บทก่อนหน้า Tencent Hy4 Preview, โมเดล 770B open source ที่ชนะ GLM-5.3 ใน blind test เล่าภาพรวม release, บทนี้เจาะเบื้องหลังเชิงเทคนิคที่ประกาศทางการ + มุมของ Simon Willison เผยเพิ่ม

ก่อนอื่น, ทำความเข้าใจศัพท์

  • MoE (Mixture of Experts): โมเดลที่มี "ผู้เชี่ยวชาญ" หลายชุด แต่เปิดใช้เฉพาะชุดที่เกี่ยวข้องต่อโทเคน, ตัวใหญ่แต่วิ่งเบา
  • Reasoning effort: ระดับ "ความพยายามในการคิด" ที่ตั้งได้, สูง = คิดนานขึ้นก่อนตอบ
  • Reasoning trace: ข้อความ "ความคิดภายใน" ที่โมเดลพิมพ์ก่อนให้คำตอบจริง

ถ้าให้อุปมา: reasoning effort เหมือน "ตั้งเวลาคิด", high คือให้เวลาประชุมยาวๆ ก่อนตัดสินใจ, no_think คือตอบทันทีตามสัญชาตญาณ

ขนาดที่เปลี่ยนไปจากรุ่นพี่ Hy3

ตัวเลขที่น่าทึ่งที่สุดคือ "การกระโดด" จากรุ่นก่อน [1]:

ตัวชี้วัด Hy3 (ก.ค. 2026) Hy4 Preview (ส.ค. 2026) โตขึ้น
พารามิเตอร์ทั้งหมด 295B 770B 2.6 เท่า
Active ต่อโทเคน 21B 49B 2.3 เท่า
Context 256,000 1 ล้าน ~4 เท่า
ขนาดไฟล์บน Hugging Face 598 GB 1.56 TB 2.6 เท่า

(ทุกตัวเลขจากหน้า Hugging Face ทางการ [3])

จาก Hy3 เป็น Hy4 ในเวลาแค่ เดือนเดียว, Tencent ยอมรับเองว่านี่คือ "largest generation-over-generation gain we've measured" (ก้าวกระโดดระหว่างรุ่นที่ใหญ่ที่สุดที่เคยวัดได้) [2]

5 จุดเด่นเชิงเทคนิคจากประกาศทางการ

1. "อยู่ที่งานยากที่สุด", เลือกสนามรบชัดเจน

Tencent ระบุว่า Hy4 Preview ทำได้ดีที่สุดใน 3 งานหนัก [2]:

สนาม ทำอะไรได้
Long-horizon software engineering งานโค้ดที่ต่อเนื่องยาวๆ
Document-heavy office work รวมไฟล์ยุ่งๆ หลายฉบับเป็น document/spreadsheet/presentation
Scientific research จัดการ experiment + ปรับทิศทางวิจัย

2. สร้างเกม Unity ได้จริง

ตัวอย่างที่ Tencent โชว์: เกม 3D มุมมองบุคคลที่สามใน Unity, นกเพนกวินสำรวจทุ่งหิมะ เก็บเบอร์รี่ เปิดหีป สู้มอนสเตอร์ มี menu/loading/pause ครบ พร้อม animation blend tree, inventory, quest HUD, เพลงและเสียง [2]

3. ใช้เป็น "หัวหน้านักวิจัย" คุม Codex หลายตัว

ส่วนที่น่าสนใจทางเทคนิคสุด: Hy4 Preview ทำหน้าที่ researcher คุม Codex sessions หลายตัวแบบขนาน ปรับทิศทางวิจัยตามผลที่ได้ และชนะ Codex ที่ทำงานคนเดียวในทั้ง 8 benchmarks [2]

นี่คือ "multi-agent orchestration" จริงๆ, โมเดลหนึ่งทำหน้าที่เป็น brain คุม agent อื่นๆ

4. Blind test: ตัวเลขจริงเต็มๆ

จากประกาศทางการ: ผู้เชี่ยวชาญ 163 คน ให้คะแนนงานวิศวกรรม 203 งาน [2]:

เทียบกับ คะแนน Win/Draw/Lose
GLM 5.3 2.99 vs 2.92 46.8% / 12.8% / 40.4%
Kimi K3 2.99 vs 2.94 51.2% / 7.9% / 40.9%

อ่านตัวเลขให้ตรง: ชนะแบบ "เล็กน้อย" จริงๆ, ไม่ใช่ domination (แพ้กันยัง 40% ของงาน)

5. ราคาที่ยังถูกตามสไตล์จีน

  • API: $0.834/1M input, $2.501/1M output (ผ่าน Tencent Cloud + OpenRouter)
  • ใช้ฟรีใน CodeBuddy, WorkBuddy (2 สัปดาห์แรก), Yuanbao, ima

🔍 มุมของ Simon Willison: สิ่งที่ประกาศไม่ได้บอก

Simon Willison (นักวิเคราะห์ LLM ชื่อดัง) ทดลอง Hy4 Preview และเผยเรื่องน่าสนใจ 3 อย่าง [1]:

1. Reasoning effort มีแค่ 2 ระดับ

จากการอ่าน chat_template.jinja ของโมเดล:

  • high (default), คิดเต็มที่
  • no_think, ปิดการคิด

ไม่มีระดับกลาง แบบที่ค่ายอื่นมี (เช่น low/medium/high), เลือกได้แค่ "คิดเต็มสปีด" หรือ "ไม่คิดเลย"

2. Reasoning trace "ภาษาอังกฤษตัดๆ"

เมื่อสั่งวาด SVG นกเพลิกันขี่จักรยาน (prompt ทดสอบคลาสสิกของเขา), ได้ผลลัพธ์สวยงามจริง แต่ที่น่าสนใจคือ reasoning trace ภายใน:

"Let's maybe add a helmet?... The user didn't ask; can add red helmet? Might be cute. But pelican with big beak; a helmet might obscure. Better maybe no."
"Maybe add sunglasses? no."
"Maybe add water? no."

Simon สังเกตว่าโมเดลใช้ "อังกฤษแบบสั้นตัดๆ" ในการคิดลับ, เพราะ grammar สมบูรณ์ไม่จำเป็นสำหรับความคิดภายใน และประหยัดโทเคน [1]

3. ประกาศทางการยอมรับจุดอ่อนเอง

ส่วนที่ผมชอบที่สุดในประกาศของ Tencent [2]:

"เรา ship พร้อม known issues, รวมถึงการใช้เวลาคิดนานเกินจำเป็นในงานซับซ้อน และแนวโน้มที่จะ over-verify งานตัวเอง"

แปลง่ายๆ: โมเดล "overthink", คิดยาวเกินและตรวจซ้ำเยอะ ซึ่งตรงกับที่ reasoning effort มีแค่ high/no_think: ยังไม่มีตัวเลือก "คิดพอดีๆ"

ทำไมการ "ยอมรับว่ายัง overthink" ถึงสำคัญ

นี่คือมุมที่ผมอยากเน้น, บทวิเคราะห์จาก Claude Memory, DeepSeek ที่มาก่อนหน้า ต่างก็พบปัญหาเดียวกัน:

โมเดล ปัญหาที่ยอมรับ
Hy4 Preview คิดนานเกิน + over-verify
โมเดล reasoning อื่นๆ ปี 2026 จ่ายโทเคนแพงเพราะ "คิดยาวเกินจำเป็น"

และทางออกที่ทุกค่ายกำลังเดิน: ควบคุม "เวลาคิด" ให้เป็นตัวแปรที่จูนได้, เหมือนกับ "Auto mode" ของ Claude Code ที่ผมเขียนไป หรือ DeepAgents ที่ควบคุม reasoning per step

อนาคตของโมเดลใหญ่อาจไม่ใช่ "คิดเก่งขึ้น" แต่คือ "รู้ว่าเมื่อไหร่ไม่ควรคิดนาน"

ข้อควรระวัง: มุมที่ต้องสมดุล

ข้อดี ข้อควรระวัง
Blind test ผ่านการตรวจจริง (163 experts) ยังเป็น internal test ของ Tencent
ยอมรับ known issues ตรงๆ Overthink = จ่ายแพงขึ้นในงานง่าย
1M context + MoE เปิดกว้าง 1.56TB ไฟล์ = คนทั่วไปโหลดไม่ไหว (ต้องรอ quantized)
ราคาถูก + ใช้ฟรีหลายช่องทาง เพิ่งปล่อย 1 วัน, ยังต้องดูการใช้งานจริง

สรุปมุมมองของผม

ผมมองว่า Hy4 Preview น่าสนใจที่ "ความซื่อสัตย์ของ release", แทนที่จะโฆษณาว่าเก่งทุกอย่าง Tencent เลือกบอกตรงๆ ว่า:

  1. เก่งสุดใน 3 สนามเฉพาะ (โค้ดยาว, เอกสาร, วิจัย)
  2. ชนะคู่แข่ง "แบบเล็กน้อย" (ไม่ใช่ domination)
  3. ยัง overthink, และจะแก้เร็ว

และจุดที่ตื่นเต้นที่สุดเชิงเทคนิคคือส่วน "researcher คุม Codex", เพราะมันคือ preview ของอนาคตที่ผมเขียนเรื่อง multi-agent มาตลอด: โมเดลหนึ่งไม่ได้ทำทุกอย่างเอง แต่ทำหน้าที่ "คิด + มองหา worker ที่เหมาะ", และ 1M context คือสิ่งที่ทำให้การคุม agent หลายตัวเป็นไปได้จริง

ตัวเลขที่อยากให้จำ: 770B พารามิเตอร์ → 49B active → 1 ล้าน context → 1.56TB ไฟล์, ในเดือนเดียวจาก Hy3

คุณคิดยังไงครับ, "โมเดลที่ยอมรับว่าตัวเอง overthink" ดีกว่า "โมเดลที่โฆษณาว่าเก่งทุกอย่าง" ไหม? แล้วเคยเจอ AI ที่คิดยาวเกินจำเป็นจนคิดค่า API แพงกันไหม? คอมเมนต์แลกเปลี่ยนกันได้ครับ

ถ้าชอบบทความแนวเจาะโมเดลแบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon

แหล่งอ้างอิง

[1] Willison, Simon. "Introducing Hy4 Preview". 2026. https://simonwillison.net/2026/Aug/29/hy4/

[2] Tencent Hunyuan. "Introducing Hy4 preview". 2026. https://hy.tencent.ai/research/hy4-preview

[3] Hugging Face. "tencent/Hy4-preview". 2026. https://huggingface.co/tencent/Hy4-preview


บทความนี้วิเคราะห์จากประกาศทางการของ Tencent Hunyuan และบทวิเคราะห์ของ Simon Willison ข้อมูล ณ 30 สิงหาคม 2026 Nokka

Top comments (0)