AMD เปิดตัว Instella-MoE-16B-A3B — โมเดล AI ที่เทรนด้วย GPU ของตัวเอง ไม่พึ่ง Nvidia
โดย Nokka (นก-กา) | 5 สิงหาคม 2569
AMD เพิ่งปล่อยโมเดล AI ตัวใหม่ที่สร้างความฮือฮาในวงการ เพราะไม่ได้เป็นเพียง "โมเดลฟรีอีกตัว" แต่มันคือการพิสูจน์ว่า GPU ของ AMD ก็เทรน AI ระดับท็อปได้จริง โดยไม่ต้องพึ่ง Nvidia [1][2]
โมเดลชื่อ Instella-MoE-16B-A3B มีขนาด 16 พันล้านพารามิเตอร์ แต่จุดเด่นคือไม่ได้ใช้ทั้งหมดพร้อมกันทุกครั้งที่ประมวลผล ใช้จริงแค่ 2.8 พันล้านตัวต่อคำ [1][2]
นี่คือหัวใจของสถาปัตยกรรมแบบ Mixture-of-Experts (MoE) เปรียบง่ายๆ เหมือนบริษัทที่มีผู้เชี่ยวชาญหลายแผนก แต่ละงานจะถูกส่งไปให้แผนกที่เกี่ยวข้องเท่านั้น ไม่ต้องเรียกทุกแผนกมาประชุมทุกครั้ง ทำให้ประมวลผลเร็วขึ้นโดยที่โมเดลยังมีความรู้กว้างเหมือนเดิม [2]
ในบทความนี้ผมจะพาคุณไปทำความเข้าใจว่าโมเดลนี้คืออะไร ทำไม AMD ถึงต้องทำแบบนี้ และถ้าคุณเป็นนักวิจัยหรือคนสนใจ AI ควรรู้เรื่องอะไรบ้าง
ทำไมเรื่องนี้ถึงเป็นข่าวใหญ่
ประเด็นหลักไม่ได้อยู่ที่ตัวเลขสเปก แต่อยู่ที่ AMD เทรนโมเดลนี้ตั้งแต่ต้นจนจบด้วย GPU ของตัวเอง (Instinct MI300X และ MI325X) โดยไม่ใช้ Nvidia เลย [1][2]
ปกติงานระดับนี้ต้องพึ่ง CUDA ของ Nvidia แทบทั้งหมด การที่ AMD ทำได้สำเร็จจึงเป็นสัญญาณว่าทางเลือกที่ไม่ใช่ Nvidia เริ่มเป็นไปได้จริง
แถม AMD ยังเปิดให้ดาวน์โหลด weight ของทุกขั้นตอนการเทรน พร้อมโค้ดเทรน และสูตรผสมข้อมูลแบบเปิดหมด [1][2] นี่คือสิ่งที่ทำให้เรื่องนี้กลายเป็นข่าวใหญ่ เพราะเป็นการ "เปิดไพ่ทั้งหมด" ให้วงการตรวจสอบและต่อยอดได้
สถาปัตยกรรมของ Instella-MoE
โมเดลนี้ใช้การออกแบบแบบ decoder-only MoE ที่มีส่วนผสมของนวัตกรรมทางสถาปัตยกรรมและระบบ [1]
| รายละเอียด | ค่า |
|---|---|
| Parameters รวม | 16B |
| Parameters active ต่อ token | 2.8B |
| Decoder layers | 27 |
| Hidden size | 2048 |
| Shared experts | 2 |
| Routed experts (เลือก 6 จาก 64) | 6/64 ต่อ token |
| Pre-training tokens | 7.1T |
| Context window | 4K → 64K |
จุดเด่นทางสถาปัตยกรรม 2 อย่าง [1]
Gated Multi-head Latent Attention (Gated MLA) — เพิ่ม output gate แบบเรียนรู้ได้ให้กับ attention ทำให้โมเดลเลือก "ลดทอน" คำตอบของ attention ที่มีประโยชน์ต่ำสำหรับแต่ละ token ได้ เพิ่มความสามารถในการแสดงออกของโมเดลด้วยต้นทุนต่ำ
FarSkip-Collective — ปรับการเชื่อมต่อของ MoE ให้ซ้อนทับการสื่อสารกับการคำนวณระหว่างการเทรนแบบ expert-parallel ส่งผลให้ [1]:
- Pre-training เร็วขึ้น 12.7% — ลดช่องว่างการสื่อสาร
- Inference TTFT ลดลง 39.2% — เมื่อ serve ด้วย SGLang แบบ expert parallelism
Multi-Token Prediction (MTP)
โมเดลใช้เทคนิคสอนให้ทำนายคำหลายคำพร้อมกัน แทนที่จะทีละคำ ช่วยให้เรียนรู้รูปแบบภาษาได้ดีขึ้น [1][2]
ขั้นตอนการเทรน 6 สเตจ
AMD ปล่อย checkpoint ของทุกขั้นตอนการเทรน เพื่อให้คนอื่นเห็นภาพและทำซ้ำได้ [1]
| Checkpoint | ขั้นตอน | คำอธิบาย |
|---|---|---|
| Pretrain | Pre-training | เทรนจากศูนย์บนคลังข้อมูลขนาดใหญ่ |
| Midtrain | Mid-training | เทรนต่อด้วยข้อมูลคุณภาพสูง |
| Base | Long-context | ขยายความสามารถประมวลผลข้อความยาว (เป็น base หลัก) |
| SFT | Supervised fine-tuning | สอนให้ทำตามคำสั่ง + ให้เหตุผลแบบ chain-of-thought |
| DPO | Direct preference optimization | ปรับปรุงด้วยข้อมูล preference |
| Think | RL (final) | ปรับปรุงรอบสุดท้ายด้วย reinforcement learning |
การเปิดทุก checkpoint แบบนี้ช่วยให้ทีมวิจัยสามารถทำซ้ำ (reproduce) และศึกษาการพัฒนาความสามารถในแต่ละช่วงได้ [1]
ต้นทุนการใช้งาน
ในแง่ต้นทุน โมเดล 16B พารามิเตอร์แบบ BF16 ใช้หน่วยความจำประมาณ 32GB เท่านั้น [2] การ์ดจอระดับสูงตัวเดียวก็รันได้ ไม่จำเป็นต้องกระจายข้าม GPU หลายตัวเสมอไป
ลองนึกภาพทีมวิจัยในมหาวิทยาลัยที่ไม่มีงบซื้อ GPU คลัสเตอร์แพงๆ แต่มีเครื่องเดียวที่มี VRAM 32GB พวกเขาก็ยังพอจะโหลดโมเดลนี้มาศึกษาโครงสร้างและทดลองได้ ซึ่งเป็นจุดที่ทำให้ทีมวิจัยขนาดเล็กเข้าถึงได้ มากกว่าที่จะเป็นของบริษัทใหญ่เท่านั้น
เรื่อง License ที่ต้องรู้ก่อนใช้
สำหรับคนที่อยากลองเอาไปรันหรือศึกษาโค้ด ต้องรู้ข้อจำกัดเรื่องลิขสิทธิ์ก่อน [2][3]
ResearchRAIL License (ใช้กับ weight ของโมเดล):
- ใช้ได้เฉพาะงานวิจัยและการศึกษา
- เอาไปทำโปรดักต์เชิงพาณิชย์ตรงๆ ไม่ได้
MIT License (ใช้กับโค้ดฝั่ง training):
- เปิดกว้างกว่ามาก
- เอาไปดัดแปลงต่อยอดได้เต็มที่
ข้อกำหนดในการรันจริง:
- ต้องใช้ Docker image เฉพาะของ AMD
- ต้องมี GPU ที่รองรับ ROCm (สถาปัตยกรรมซอฟต์แวร์คู่แข่ง CUDA) [2]
ภาพใหญ่: ไม่ใช่แค่การแข่ง "ชิปแรงกว่า"
เรื่องนี้สะท้อนภาพใหญ่กว่าตัวโมเดลเดียว ตอนนี้การแข่งขันชิป AI ไม่ได้อยู่แค่ว่าใครผลิตชิปแรงกว่า แต่อยู่ที่ว่าใครมี "ระบบนิเวศซอฟต์แวร์" ที่นักพัฒนาอยากใช้จริง [2]
ลองดูตัวอย่างง่ายๆ ถ้านักพัฒนาคนหนึ่งชินกับการเขียนโค้ดด้วย CUDA อยู่แล้ว เขาจะลังเลที่จะย้ายไป ROCm เพราะต้องเรียนรู้ใหม่ทั้งหมด นี่คือสิ่งที่ Nvidia ชนะมาหลายปี AMD จึงต้องเอาชนะด้วยการปล่อยทั้งโมเดลและเครื่องมือเปิดให้คนมาทดลองใช้ ROCm จริงๆ เพื่อพิสูจน์ว่าทำได้จริง และค่อยๆ สร้างความมั่นใจให้วงการหันมาใช้ทางเลือกที่ไม่ใช่ Nvidia มากขึ้น [2]
คำศัพท์ที่ควรรู้
ผู้เชี่ยวชาญร่วม (Shared Expert) — ผู้เชี่ยวชาญที่ทำงานทุกครั้งไม่ว่าคำถามจะเป็นเรื่องอะไร ต่างจากผู้เชี่ยวชาญที่ถูกเลือกมาเฉพาะเรื่อง [2]
Multi-Token Prediction — เทคนิคสอนโมเดลให้ทำนายคำหลายคำพร้อมกัน แทนที่จะทีละคำ ช่วยให้เรียนรู้รูปแบบภาษาได้ดีขึ้น [2]
สัญญาอนุญาต (License) — กฎการใช้งานชิ้นงาน MIT อนุญาตใช้ทุกอย่างรวมถึงเชิงพาณิชย์ ส่วน ResearchRAIL จำกัดเฉพาะงานวิจัย [2]
สรุป
AMD Instella-MoE-16B-A3B เป็นก้าวสำคัญของวงการ เพราะมันพิสูจน์ว่า GPU ของ AMD เทรน AI ระดับท็อปได้จริง ไม่ต้องพึ่ง Nvidia ด้วยการเปิดทุกอย่างแบบถ้วนหน้า ทั้ง weight ทุกขั้นตอน โค้ดเทรน และสูตรข้อมูล
แม้ weight จะจำกัดไว้เฉพาะงานวิจัย (ResearchRAIL) แต่โค้ด training เปิดแบบ MIT และเรื่องนี้สะท้อนทิศทางใหญ่ที่ว่า การแข่ง AI กำลังย้ายไปสู่การแข่ง "ระบบนิเวศซอฟต์แวร์" ใครมี ecosystem ที่นักพัฒนาอยากใช้ ยิ่งได้เปรียบในระยะยาว
ถ้าคุณเป็นนักวิจัยหรือทีมที่อยากศึกษาโมเดล MoE แบบเปิดๆ นี่คือโอกาสดีที่จะได้เรียนรู้โครงสร้างและเทคนิคการเทรนจริงจากค่ายที่ต้องการพิสูจน์ตัวเองที่สุดตอนนี้ ลองแวะไปดูโค้ดและ checkpoint บน Hugging Face ดูได้ เริ่มจากศึกษาสถาปัตยกรรม Gated MLA แล้วค่อยลองรันดูกับเครื่องที่มี ROCm
แหล่งอ้างอิง
[1] AMD ROCm Blogs. "Introducing Instella-MoE: A State-of-the-Art Fully Open Mixture-of-Experts Language Model". 24 กรกฎาคม 2026. https://rocm.blogs.amd.com/artificial-intelligence/instella-moe/README.html
[2] MarkTechPost. "AMD Releases Instella-MoE-16B-A3B: A Fully Open Mixture-of-Experts LLM With 2.8B Active Parameters Trained On Instinct GPUs". 1 สิงหาคม 2026. https://www.marktechpost.com/2026/08/01/amd-instella-moe-16b-a3b-fully-open-mixture-of-experts-llm/
[3] Hugging Face. "amd/Instella-MoE-16B-A3B-Think". 23 กรกฎาคม 2026. https://huggingface.co/amd/Instella-MoE-16B-A3B-Think
คุณมองว่า AMD จะท้าทาย Nvidia ได้แค่ไหนในระยะยาว? หรือคิดว่า CUDA ยังได้เปรียบเกินกว่าจะตามทัน? แชร์มุมมองใต้บทความได้เลยครับ — Nokka ยินดีแลกเปลี่ยนความคิด
Top comments (0)