DEV Community

Cover image for GLM-5.3-Flash คืออะไร? โมเดล Open-Weights มัลติโมดอลโดยกำเนิดตัวแรกจาก Z.ai
Thanawat Wongchai
Thanawat Wongchai

Posted on Originally published at apidog.com

GLM-5.3-Flash คืออะไร? โมเดล Open-Weights มัลติโมดอลโดยกำเนิดตัวแรกจาก Z.ai

GLM-5.3-Flash: โมเดล 320B-A18B แบบ Open-Weight ที่เน้นต้นทุนและ Multimodal

Z.ai เปิดตัว GLM-5.3-Flash เมื่อวันที่ 26 สิงหาคม 2026 เป็นโมเดล mixture-of-experts ขนาด 320B-A18B (พารามิเตอร์รวม 320 พันล้านตัว และพารามิเตอร์ที่ทำงานอยู่ 18 พันล้านตัว) ภายใต้ใบอนุญาต MIT โดยเป็นโมเดลแรกในซีรีส์ GLM-5 ที่รองรับรูปภาพในตัวโดยไม่ต้องติดตั้ง vision adapter เพิ่มเติม

ลองใช้ Apidog วันนี้

นักพัฒนาหลายคนอาจใช้งานโมเดลนี้มาแล้วหนึ่งสัปดาห์โดยไม่รู้ตัว ผ่านชื่อ ox-alpha บนแพลตฟอร์ม inference ของบุคคลที่สาม

แม้ชื่อจะมีคำว่า “Flash” แต่ไม่ได้หมายถึงการสร้างผลลัพธ์เร็ว โมเดลนี้เด่นเรื่องต้นทุน หน่วยความจำ และความสามารถ multimodal มากกว่าความเร็วในการสตรีมโทเค็น

สรุป

  • โมเดล: Open-weight (MIT) แบบ mixture-of-experts จาก Z.ai
  • ขนาด: 320B พารามิเตอร์รวม / 18B พารามิเตอร์ที่ทำงานอยู่
  • Multimodal ในตัว: รับข้อความ รูปภาพ วิดีโอ และไฟล์ผ่านคำขอเดียว
  • Context window: 1,048,576 โทเค็น
  • ราคา: ประมาณหนึ่งในสิบของ GLM-5.2 — $0.15 ต่อ 1 ล้านโทเค็นอินพุต และ $0.50 ต่อ 1 ล้านโทเค็นเอาต์พุต
  • ความเร็ว: 48.7 โทเค็นเอาต์พุตต่อวินาที และใช้เวลา 1.52 วินาทีก่อนเริ่มแสดงโทเค็นแรก
  • Model ID: glm-5.3-flash
  • ใช้งานได้ผ่าน: Z.ai API, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway และผู้ให้บริการรายอื่น
  • น้ำหนักโมเดล: zai-org/GLM-5.3-Flash บน Hugging Face

ข้อมูลจำเพาะ

คุณสมบัติ ค่า
พารามิเตอร์รวม 320B
พารามิเตอร์ที่ทำงานอยู่ 18B
สถาปัตยกรรม Mixture of experts, hybrid linear และ sparse attention
ใบอนุญาต MIT
หน้าต่างบริบท 1,048,576 โทเค็น
รูปแบบอินพุต ข้อความ, รูปภาพ, วิดีโอ, ไฟล์
เอาต์พุต ข้อความ
โหมดการให้เหตุผล low, high, max (ค่าเริ่มต้น max)
API model ID glm-5.3-flash
Hugging Face zai-org/GLM-5.3-Flash

มีข้อมูลขัดแย้งเรื่องจำนวนโทเค็นเอาต์พุตสูงสุด: OpenRouter ระบุ 131,072 ขณะที่การ์ดโมเดลบน Hugging Face ระบุ 163,840 และ Z.ai ยังไม่ได้ยืนยันตัวเลขที่ชัดเจน หากงานของคุณต้องสร้างผลลัพธ์ยาวมากในการเรียกครั้งเดียว ให้ตรวจสอบขีดจำกัดกับผู้ให้บริการที่ใช้งานจริงก่อน

Multimodal ในตัวคือจุดเปลี่ยนสำคัญ

ก่อนหน้านี้ ความสามารถด้านวิชันของ GLM มาเป็นโมเดลหรือเส้นทางแยก เช่น GLM-5V-Turbo และ GLM-4.6V หากต้องการให้โมเดลวิเคราะห์ภาพหน้าจอ คุณต้องเรียก endpoint คนละตัวกับงานข้อความ

GLM-5.3-Flash รวมงานเหล่านี้ไว้ในคำขอ chat completion เดียว:

  • รูปภาพ วิดีโอ และไฟล์ส่งเป็น content block ร่วมกับข้อความได้
  • ใช้ model ID เดียวและการเรียกเก็บเงินชุดเดียว
  • เก็บรูปภาพและบริบทข้อความได้พร้อมกันในหน้าต่าง 1M โทเค็น

จึงเหมาะกับงาน เช่น ส่งเอกสาร specification ขนาดใหญ่พร้อมภาพหน้าจอผลลัพธ์ แล้วให้โมเดลตรวจสอบความสอดคล้องระหว่าง requirement, UI ที่ render แล้ว และ feedback จากผู้ใช้ ซึ่ง Z.ai อธิบายว่าโมเดลสามารถสังเกต “อินเทอร์เฟซ ผลลัพธ์การเรนเดอร์ และข้อเสนอแนะการโต้ตอบ” ได้

สำหรับโมเดลวิชันเฉพาะทาง ดูคู่มือ API ของ GLM-5V-Turbo และ GLM-OCR สำหรับการทำความเข้าใจเอกสาร

สถาปัตยกรรม: ลดต้นทุนและหน่วยความจำ

GLM-5.3-Flash สร้างบนโมเดลพื้นฐานใหม่ ไม่ใช่การฝึกต่อจาก GLM-5.2 โดยมีสองแนวคิดหลัก

กราฟแสดงโครงสร้าง hybrid linear และ sparse attention

Hybrid attention

โมเดลรวม linear attention และ sparse attention:

  • Linear attention จัดการการพึ่งพากันภายในพื้นที่อย่างประหยัด
  • Sparse attention เข้าถึงโทเค็นที่เกี่ยวข้องในระดับสากล

Z.ai ระบุว่าส่งผลให้ใช้การคำนวณ attention น้อยกว่า GLM-5.3 ประมาณสามเท่า และใช้ KV cache น้อยลงประมาณ 4.4 เท่า

Manifold-Constrained Hyper-Connections

นี่คือคำเรียกของ Z.ai สำหรับแนวทางเพิ่มประสิทธิภาพการปรับขนาดของโมเดล ยังไม่มีรายละเอียดสาธารณะเพียงพอให้ตรวจสอบอย่างอิสระ จึงควรมองเป็นคำอธิบายจากผู้ให้บริการมากกว่าข้อได้เปรียบที่พิสูจน์แล้ว

ผลกระทบเชิงปฏิบัติที่ชัดเจนคือ KV cache ที่เล็กลง เพราะ KV cache เป็นสาเหตุหลักที่ทำให้ inference บริบทยาวใช้หน่วยความจำสูง การลดลง 4.4 เท่าช่วยให้โมเดลรองรับ context 1M โทเค็นได้ในราคาประมาณหนึ่งในสิบของ GLM-5.2

การฝึกโมเดลใช้คลังข้อมูล multimodal ราว 30 ล้านล้านโทเค็นตามที่ Z.ai ระบุ

“Flash” ไม่ได้หมายถึงเร็ว

Artificial Analysis วัด GLM-5.3-Flash ได้ที่ 48.7 โทเค็นเอาต์พุตต่อวินาที ขณะที่ GLM-5.3 ทำได้ประมาณ 86 โทเค็นต่อวินาที ในการวัดเดียวกัน

กล่าวคือ รุ่น Flash สร้างโทเค็นได้ประมาณครึ่งหนึ่งของรุ่นที่ไม่ใช่ Flash

อย่างไรก็ตาม เวลาเริ่มตอบสนองทำได้ดี: ใช้เวลา 1.52 วินาที ก่อนแสดงโทเค็นแรก เทียบกับค่ามัธยฐานของโมเดล open-weight ที่ 2.14 วินาที

เลือก GLM-5.3-Flash หากคุณมีงานโต้ตอบสั้นจำนวนมาก ต้องการลดต้นทุน หรือจำเป็นต้องใช้ multimodal input แต่หากคุณสร้างเอกสารหรือผลลัพธ์ยาว ๆ ความเร็วในการสร้างของ GLM-5.3 อาจเหมาะกว่า

ผลการทดสอบ

ตัวเลขต่อไปนี้เป็นข้อมูลที่ Z.ai เผยแพร่ในวันเปิดตัว จึงควรอ่านเป็นคำกล่าวอ้างของผู้ให้บริการจนกว่าจะมีการทดสอบซ้ำโดยบุคคลที่สาม

กราฟเปรียบเทียบผลการทดสอบของโมเดลต่างๆ

Artificial Analysis จัด GLM-5.3-Flash ไว้ที่ 57 คะแนนใน Intelligence Index v4.1.1:

  • GLM-5.3: 60 คะแนน
  • GLM-5.3-Flash: 57 คะแนน
  • ค่ามัธยฐานของโมเดล open-weight ขนาดใกล้เคียงกัน: 27 คะแนน

ดังนั้น 57 ถือว่าเป็นผลลัพธ์ที่ดีสำหรับโมเดล open-weight แม้ยังต่ำกว่า GLM-5.3

Z.ai ระบุว่าโมเดลมีความใกล้เคียง Claude Opus 4.8 สำหรับงานเขียนโค้ดและงาน agentic แต่เป็นผลจากการประเมินภายในของผู้ให้บริการ ไม่ใช่ผลการวัดจากบุคคลที่สาม หากต้องการดูพัฒนาการของ benchmark ก่อนหน้านี้ อ่าน การวิเคราะห์เกณฑ์มาตรฐาน GLM-5.2

Ox Alpha: การทดสอบปริมาณงานก่อนเปิดตัว

วันที่ 20 สิงหาคม 2026 โมเดลนิรนามชื่อ ox-alpha ปรากฏบนแพลตฟอร์ม inference ของบุคคลที่สาม พร้อม context window 1M โทเค็นและราคาเป็นศูนย์ มันกลายเป็นหนึ่งในโมเดลที่ถูกใช้งานมากที่สุดบนแพลตฟอร์มเหล่านั้นภายในไม่กี่วัน

ชุมชนระบุว่าโมเดลน่าจะมาจาก Zhipu ภายในราว 48 ชั่วโมงจากลักษณะผลลัพธ์ และวันที่ 26 สิงหาคม Z.ai ยืนยันว่า Ox Alpha คือ GLM-5.3-Flash โดยสัปดาห์ฟรีเป็นการทดสอบปริมาณงานโดยเจตนา

ภาพแสดงหน้าจอการใช้งานโมเดล ox-alpha

Z.ai ยังระบุว่าปริมาณงานทั้งหมดในช่วงนั้นทำงานบนตัวเร่งความเร็วของจีนด้วยสแตกที่ใช้ SGLang และมีต้นทุนต่อโทเค็นใกล้เคียงฮาร์ดแวร์ NVIDIA ทั่วไป ข้อมูลนี้ยังไม่มีการตรวจสอบโดยอิสระ

รูปแบบการเปิดตัวแบบไม่เปิดเผยชื่อกำลังพบได้บ่อยขึ้น ดูตัวอย่างจากกรณี Pony Alpha กลายเป็นโมเดล DeepSeek หรือ GLM

วิธีใช้งาน

Hosted API

API ของ Z.ai เข้ากันได้กับ OpenAI API:

Base URL: https://api.z.ai/api/paas/v4/
Model: glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

ดูขั้นตอนยืนยันตัวตน การส่งรูปภาพ และพารามิเตอร์ reasoning effort ได้จาก คู่มือ API ของ GLM-5.3-Flash

ผู้ให้บริการบุคคลที่สาม

OpenRouter ใช้ model ID นี้:

z-ai/glm-5.3-flash
Enter fullscreen mode Exit fullscreen mode

โมเดลยังมีบน Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten และ io.net โดยราคาอาจต่างกันมากระหว่างผู้ให้บริการ

เอเจนต์เขียนโค้ด

GLM-5.3-Flash รวมอยู่ใน GLM Coding Plan และมีโควตาใช้งานมากกว่า GLM-5.3 ถึงสามเท่า เอกสารของ Z.ai ระบุว่าการเรียกใช้นอกเวลาทำการใช้คะแนนมาตรฐานเพียงครึ่งหนึ่ง

Self-hosted

น้ำหนักโมเดลอยู่ภายใต้ MIT และเผยแพร่บน Hugging Face โดยรองรับ:

  • vLLM
  • SGLang
  • TokenSpeed
  • KTransformers
  • GGUF quantization สำหรับเครื่องขนาดเล็กกว่า

ควรเลือกใช้รุ่นใด?

ใช้ GLM-5.3-Flash หากคุณต้องการ:

  • วิเคราะห์รูปภาพหรือวิดีโอร่วมกับข้อความ
  • ลดต้นทุนต่อโทเค็น
  • ใช้โมเดล open-weight ที่โฮสต์เองได้ภายใต้ใบอนุญาตที่อนุญาต
  • ตอบสนองเริ่มต้นเร็วสำหรับงานโต้ตอบสั้น

เลือก GLM-5.3 หากคุณต้องการ:

  • คุณภาพการให้เหตุผลสูงสุด
  • ความเร็วในการสร้างผลลัพธ์ยาว
  • ประสิทธิภาพ throughput สูงกว่า

ดูรายละเอียดเพิ่มใน การเปรียบเทียบ GLM-5.3-Flash กับ GLM-5.3 และบทความ GLM-5.3 คืออะไร

เนื่องจากทั้งสองรุ่นใช้ endpoint ที่เข้ากันได้กับ OpenAI คุณสามารถทดสอบได้ด้วยการเปลี่ยน model ID เพียงบรรทัดเดียว ควรทดสอบกับคำขอจริงของคุณ โดยเฉพาะงาน multimodal

Apidog ช่วยบันทึกคำขอเหล่านี้เป็นคอลเลกชันที่นำกลับมาใช้ซ้ำได้พร้อม assertion เพื่อยืนยันว่าโครงสร้างการตอบสนองยังเหมือนเดิมหลังสลับจาก GLM-5.3 ไปเป็น Flash

คำถามที่พบบ่อย

GLM-5.3-Flash ฟรีหรือไม่?

ไม่ฟรีอีกต่อไป สัปดาห์ฟรีของ Ox Alpha สิ้นสุดลงพร้อมการประกาศอย่างเป็นทางการ มีส่วนลดเปิดตัว 50% ถึงวันที่ 9 กันยายน 2026 หลังจากนั้นใช้อัตราปกติ

มันเร็วกว่า GLM-5.3 หรือไม่?

ไม่ รุ่น Flash สร้างได้ประมาณ 49 โทเค็นต่อวินาที ขณะที่ GLM-5.3 สร้างได้ประมาณ 86 โทเค็นต่อวินาที แต่ Flash เริ่มตอบสนองเร็วกว่า โดยใช้เวลา 1.52 วินาทีก่อนแสดงโทเค็นแรก

รองรับ context หนึ่งล้านโทเค็นจริงหรือไม่?

ใช่ การกำหนดค่าของโมเดลและ Artificial Analysis ยืนยัน context window ที่ 1,048,576 โทเค็น อย่างไรก็ตาม OpenRouter ระบุ 1,310,720 โทเค็น จึงควรมองเป็นข้อมูลจากผู้ให้บริการมากกว่าจะเป็น specification หลักของโมเดล

รับวิดีโอได้หรือไม่?

เอกสารของ Z.ai ระบุว่ารองรับข้อความ รูปภาพ วิดีโอ และไฟล์ การรองรับวิดีโอเป็นความสามารถใหม่และยังไม่ได้รับการใช้งานแพร่หลายเท่ารูปภาพ ดังนั้นควรทดสอบกับสื่อจริงของคุณก่อนใช้งานจริง

น้ำหนักโมเดลใช้ใบอนุญาตใด?

MIT โดยน้ำหนักโมเดลเผยแพร่เป็น zai-org/GLM-5.3-Flash บน Hugging Face

Top comments (0)