Alibaba เปิดตัว Qwen 3.8-Max ในช่วงต้นเดือนสิงหาคม 2026 หากคุณใช้ qwen3.7-max ในระบบจริงอยู่ คำถามไม่ใช่แค่ว่าโมเดลใหม่ดีกว่าหรือไม่ แต่คือควรสลับตอนนี้ รอให้โปรโมชันหมด หรือปรับลดไปใช้รุ่น Plus เพื่อควบคุมต้นทุน Qwen 3.8-Max เพิ่มความสามารถด้าน agentic workflow, งานวิจัย และอินพุตภาพ พร้อมราคาปลีกที่ต่ำกว่าเดิม ขณะที่ Qwen 3.7-Max ยังมีส่วนลด 50% ซึ่งทำให้ราคาปัจจุบันต่ำกว่า 3.8-Max
หากต้องการภาพรวมของโมเดลใหม่ ดู คำอธิบาย Qwen 3.8-Max ของเรา และดูพื้นหลังของรุ่นเดิมได้ที่ สิ่งที่ Qwen 3.7 นำเสนอ
ตัวเลข benchmark ในบทความนี้มาจากตารางของ Alibaba ใน โพสต์เปิดตัว Qwen 3.8 อย่างเป็นทางการ โมเดลทั้งสองถูกประเมินโดยผู้ขายรายเดียวกัน จึงเปรียบเทียบความต่างภายในตารางได้ค่อนข้างสอดคล้องกัน แต่ผลทดสอบอิสระยังรอการยืนยัน หลายงาน coding ใช้ Claude Code harness และบาง benchmark เป็นการทดสอบภายในของ Qwen
เวอร์ชันย่อ: เลือกอย่างไร
| สิ่งที่เปลี่ยนไป | Qwen 3.7-Max | Qwen 3.8-Max |
|---|---|---|
| Terminal Bench 2.1 | 74.5 | 86.6 |
| SWE-bench Pro | 60.6 | 67.7 |
| PaperBench | 64.8 | 93.0 |
| IFBench | 79.1 | 82.8 |
| GPQA Diamond | 92.4 | 92.6 |
| HLE | 41.4 | 43.6 |
| ราคาปลีกต่อ 1M โทเค็น | $2.5 รับ / $7.5 ส่ง | $2 รับ / $6 ส่ง |
| ราคาปัจจุบัน | $1.25 รับ / $3.75 ส่ง | $2 รับ / $6 ส่ง |
| อินพุตภาพ | ไม่รองรับ | รองรับ |
| สถาปัตยกรรมที่เปิดเผย | ไม่เปิดเผย | 2.4T รวม, 95B active MoE |
| น้ำหนักโมเดลแบบเปิด | ไม่เคยประกาศ | สัญญาว่าจะเปิดตัว “สัปดาห์หน้า” |
| Context window | 1M โทเค็น | 1M โทเค็น |
สรุปสำหรับทีมที่ต้องตัดสินใจเร็ว
- เลือก Qwen 3.8-Max หากงานหลักคือ coding agent, terminal workflow, งานวิจัยหลายขั้นตอน หรือวิเคราะห์ภาพหน้าจอ
- ใช้ Qwen 3.7-Max ต่อ หากงานส่วนใหญ่เป็น Q&A, สรุปข้อความ และงานทั่วไปที่คุณภาพเดิมเพียงพอ โดยต้องการใช้โปรโมชัน 50%
- พิจารณา
qwen3.7-plusหากเป็นงาน routine เช่น classification, extraction หรือสร้างข้อความตามเทมเพลต และต้นทุนสำคัญที่สุด
ความแตกต่างของ benchmark: จุดที่ควรทดสอบกับงานจริง
การเพิ่มประสิทธิภาพของ Qwen 3.8-Max กระจุกตัวในงานแบบ agentic: โมเดลต้องวางแผน ใช้เครื่องมือ ดำเนินการ และแก้ปัญหาด้วยตัวเองในหลายขั้นตอน
Terminal Bench 2.1: 74.5 → 86.6
เพิ่มขึ้น 12 คะแนนในงาน agent ที่ทำงานผ่านเทอร์มินัล Alibaba ระบุคะแนน Claude Opus 4.8 และ Fable 5 ที่ 84.6 ในตารางเดียวกัน ขณะที่ GPT-5.6 Sol อยู่ที่ 88.8
เหมาะกับการอัปเกรดเมื่อคุณทำงานแบบนี้
- Agent เรียก shell commands
- Workflow ที่ต้องแก้ไฟล์และตรวจผลลัพธ์ซ้ำ
- Automation ที่ใช้เครื่องมือหลายตัวต่อเนื่องกัน
SWE-bench Pro: 60.6 → 67.7
เพิ่มขึ้น 7 คะแนนในงานวิศวกรรมซอฟต์แวร์จริง แต่ยังตาม Fable 5 ที่ 80.0 ตามตารางเดียวกัน
ข้อสรุปเชิงปฏิบัติ: หากคุณใช้โมเดลเพื่อแก้ issue, เขียน patch หรือทำ PR automation การอัปเกรดน่าจะช่วยได้ แต่ไม่ควรตัดสินใจจาก benchmark เพียงอย่างเดียว ให้รันชุด issue และ repository จริงของทีมคุณก่อน
PaperBench: 64.8 → 93.0
เพิ่มขึ้น 28 คะแนน เป็นความต่างที่ใหญ่ที่สุดในตาราง สำหรับงานทำซ้ำการวิจัย AI และเหตุผลเชิงเทคนิคหลายขั้นตอน
ควรทดสอบ 3.8-Max ทันที หากคุณมีงานต่อไปนี้
- สรุปและวิเคราะห์เอกสารเทคนิคขนาดยาว
- สร้างแผนทดลอง
- เปรียบเทียบงานวิจัยหลายฉบับ
- สร้าง reasoning chain สำหรับปัญหาวิทยาศาสตร์หรือวิศวกรรม
IFBench: 79.1 → 82.8
เพิ่มขึ้นเกือบ 4 คะแนนด้านการทำตามคำสั่ง โดย 3.7-Max ก็มีผลลัพธ์ที่แข็งแรงอยู่แล้วในชุดทดสอบนี้
GPQA Diamond: 92.4 → 92.6
แทบไม่เปลี่ยนแปลง หาก workload ของคุณเป็นคำถามเชิงความรู้หรือ reasoning ทางวิทยาศาสตร์ระดับบัณฑิตศึกษาเป็นหลัก การอัปเกรดอาจไม่ให้ผลต่างด้านคุณภาพที่ชัดเจน
HLE: 41.4 → 43.6
เพิ่มขึ้น 2 คะแนน แต่ยังตาม Fable 5 ที่ 53.3 และ GPT-5.6 Sol ที่ 47.2 ในตารางเดียวกัน
สำหรับรายละเอียด benchmark, harness และข้อจำกัดของการทดสอบ ดู การวิเคราะห์ผลการทดสอบ Qwen 3.8
สถาปัตยกรรม: Qwen 3.8-Max เปิดเผยข้อมูลมากขึ้น
Qwen 3.8-Max เป็นโมเดล mixture-of-experts (MoE) ที่มีพารามิเตอร์รวม 2.4T และมีพารามิเตอร์ active 95B ต่อ forward pass โดยสร้างบนสถาปัตยกรรม Qwen 3.5
อัตรา active อยู่ราว 4% ซึ่งสำคัญต่อการประเมินต้นทุนการให้บริการ: การคำนวณหลักอิงกับ 95B active parameters ไม่ใช่ 2.4T ทั้งหมด
Qwen 3.7-Max ไม่เคยเปิดเผยข้อมูลขนาดโมเดล, อัตรา active หรือการกำหนดค่า expert ในระดับเดียวกัน แต่สำหรับ 3.8-Max ข้อมูลระบุไว้ใน เอกสารโมเดล Model Studio และโพสต์เปิดตัว
สำหรับบริบทของโมเดล open-weight:
- Kimi K3: 2.8T total parameters, 104B active parameters
- Qwen 3.8-Max: 2.4T total parameters, 95B active parameters
Multimodal: ความสามารถใหม่ที่ 3.7-Max ไม่มี
Qwen 3.7-Max เป็นโมเดลข้อความเท่านั้น ขณะที่ Qwen 3.8-Max รับอินพุตภาพได้โดยตรง
Alibaba รายงานคะแนน multimodal ที่โดดเด่น ได้แก่:
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
ไม่มีคอลัมน์ Qwen 3.7-Max สำหรับตารางนี้ เพราะรุ่นเดิมไม่รองรับภาพ
ผลกระทบต่อ implementation
ก่อนหน้านี้คุณอาจต้องเรียก vision model แยกต่างหากสำหรับงาน เช่น:
- วิเคราะห์ screenshot จากระบบ
- อ่านเอกสารในรูปภาพ
- ดึงข้อมูลจากกราฟและแผนภูมิ
- UI automation ที่ต้องเข้าใจหน้าจอ
ด้วย Qwen 3.8-Max คุณสามารถรวมงานข้อความและภาพไว้ภายใต้ model ID เดียวได้ อย่างไรก็ตาม ความสามารถด้านวิดีโอและเอกสารยาวที่แสดงในโพสต์เปิดตัวไม่ควรถูกตีความว่าเป็นรูปแบบ API ใหม่โดยอัตโนมัติ ควรตรวจสอบเอกสาร API สำหรับ input type ที่ระบบของคุณต้องใช้
ราคา: 3.8-Max ถูกกว่าที่ราคาปลีก แต่ไม่ใช่ราคาปัจจุบัน
Qwen 3.8-Max เปิดตัวที่ $2 รับ / $6 ส่ง ต่อ 1M โทเค็น และเป็นอัตราคงที่ตลอด context window 1M
เทียบกับ Qwen 3.7-Max ที่ราคาปลีก $2.5 รับ / $7.5 ส่ง โมเดลใหม่จึงถูกกว่า 20%
แต่ Qwen 3.7-Max มีโปรโมชันลด 50% แบบจำกัดเวลา ทำให้ราคาปัจจุบันเป็น:
| โมเดล | Input ต่อ 1M tokens | Output ต่อ 1M tokens |
|---|---|---|
| Qwen 3.7-Max ช่วงโปรโมชัน | $1.25 | $3.75 |
| Qwen 3.8-Max | $2.00 | $6.00 |
ดังนั้น ณ ราคาปัจจุบัน Qwen 3.7-Max ถูกกว่า Qwen 3.8-Max ราว 38% รายละเอียดอัตราค่าบริการอยู่ที่ หน้า Model Studio pricing
วิธีประเมินต้นทุนก่อนสลับ
- รวบรวมจำนวน input และ output tokens จากคำขอจริงในช่วง 7–30 วัน
- แยก workload ตามประเภท เช่น Q&A, extraction, coding agent และ vision
- รัน workload เดิมกับทั้งสองโมเดล
- วัดคุณภาพ, latency และ token usage
- คำนวณต้นทุนจาก output จริง ไม่ใช่แค่ prompt token
ระวังว่า Qwen 3.8-Max ตั้งค่าเริ่มต้นเป็น reasoning_effort: xhigh และคิดค่าโทเค็น “ความคิด” เป็น output tokens ต้นทุนต่อ request จึงอาจสูงกว่าที่คาดจาก prompt เพียงอย่างเดียว
ดูรายละเอียดเรื่อง cache และต้นทุนต่องานใน คู่มือราคา Qwen 3.8
หากรุ่น Max แพงเกินงบ qwen3.7-plus ที่ราคา $0.4 / $1.6 และมีส่วนลด 20% ในขณะนั้น อาจเพียงพอสำหรับงานทั่วไป ดูเกณฑ์เลือกได้จาก การเปรียบเทียบ Plus กับ Max
น้ำหนักโมเดลแบบเปิด: ปัจจัยสำหรับ procurement และ compliance
Qwen-Max รุ่นก่อนหน้าไม่เคยเปิดตัวน้ำหนักโมเดลแบบเปิด รวมถึง Qwen 3.7-Max
Qwen 3.8-Max แตกต่างออกไป โดยโพสต์เปิดตัวระบุว่าจะปล่อย weights บน Hugging Face และ ModelScope “สัปดาห์หน้า” หรือราววันที่ 10 สิงหาคม 2026
ณ วันที่เขียนต้นฉบับคือ 3 สิงหาคม 2026 weights ยังดาวน์โหลดไม่ได้ ดังนั้นให้ถือว่าเป็นคำมั่นสัญญา ไม่ใช่ความสามารถที่พร้อมใช้งานแล้ว
แม้น้ำหนักโมเดลจะเปิดเผย การโฮสต์โมเดล 2.4T parameters ด้วยตัวเองยังเป็นงานหลายโหนดและใช้ทรัพยากรสูง แม้ผ่านการ quantize แล้ว สำหรับทีมส่วนใหญ่ ผลกระทบที่เป็นจริงน่าจะเป็นตัวเลือกจากผู้ให้บริการโฮสต์ภายนอก มากกว่าการติดตั้งใน infrastructure ของทีมเอง
หาก open weights เป็นข้อกำหนดด้าน procurement, data governance หรือ compliance นี่อาจเป็นตัวตัดสินระหว่าง 3.7-Max และ 3.8-Max ได้โดยตรง
สิ่งที่ไม่เปลี่ยนแปลง
- Context window: ทั้งคู่รองรับ 1M โทเค็น
- ช่องทางเข้าถึง: ทั้งคู่ให้บริการผ่าน Alibaba Cloud Model Studio และ OpenAI-compatible endpoint
-
การย้ายระบบพื้นฐาน: เปลี่ยน model ID จาก
qwen3.7-maxเป็นqwen3.8-max -
การควบคุม reasoning: Qwen 3.8-Max รองรับ
reasoning_effortอย่างเป็นทางการ โดยมีxhigh,mediumและlowรวมถึงenable_thinkingและpreserve_thinking - Anthropic-compatible API: 3.8-Max เพิ่ม API surface ที่เข้ากันได้กับ Anthropic ซึ่งสามารถทดลองได้ผ่านเครื่องมืออย่าง Apidog หาก toolchain ของคุณรองรับ protocol นี้
วิธีทดสอบการสลับโมเดลก่อน deploy
อย่าตัดสินใจจาก benchmark ของผู้ขายเพียงอย่างเดียว ให้ทดสอบกับ prompts, tools และข้อมูลจริงของระบบคุณ
1. ทำให้ model ID เป็น environment variable
สำหรับ OpenAI-compatible endpoint ให้ย้ายชื่อโมเดลไปเป็นตัวแปร เช่น:
{
"model": "{{model_id}}",
"messages": [
{
"role": "user",
"content": "{{prompt}}"
}
]
}
จากนั้นสร้างสอง environment:
Environment: qwen-3.7
model_id=qwen3.7-max
Environment: qwen-3.8
model_id=qwen3.8-max
2. ระบุ reasoning ให้ชัดเจนสำหรับ 3.8-Max
เนื่องจาก 3.8-Max ใช้ xhigh เป็นค่าเริ่มต้น ให้ควบคุมพฤติกรรมและต้นทุนอย่างชัดเจน:
{
"model": "qwen3.8-max",
"reasoning_effort": "medium",
"messages": [
{
"role": "user",
"content": "วิเคราะห์ข้อผิดพลาดและเสนอ patch ที่เล็กที่สุด"
}
]
}
เริ่มจาก medium หรือ low สำหรับงาน routine แล้วเปรียบเทียบกับ xhigh ในงานที่ต้องใช้ reasoning หนัก
3. สร้างชุดทดสอบจาก production prompts
เลือกตัวอย่างที่แทน workload จริง เช่น:
- 20 คำขอ Q&A หรือสรุปข้อความ
- 20 งาน extraction ที่มี expected schema
- 10 งาน coding หรือ debugging
- 10 งาน agent ที่เรียกใช้เครื่องมือ
- งานภาพหน้าจอหรือเอกสาร หากคุณต้องการใช้ multimodal
เก็บผลลัพธ์ในรูปแบบที่ reviewer เปรียบเทียบได้โดยไม่รู้ว่า output มาจากโมเดลใด
4. วัดมากกว่าคุณภาพคำตอบ
สำหรับแต่ละ request ให้บันทึก:
| Metric | เหตุผล |
|---|---|
| ความถูกต้อง | วัดผลตาม acceptance criteria ของระบบ |
| Format compliance | ตรวจ JSON, schema หรือคำสั่งที่ต้องทำตาม |
| Latency | สำคัญกับ API ที่ผู้ใช้รอผล |
| Input/output tokens | ใช้คำนวณต้นทุนจริง |
| Tool-call success rate | สำคัญกับ agentic workflow |
| Retry rate | บอกต้นทุนและความเสถียรที่ซ่อนอยู่ |
5. สลับ environment และรัน collection เดิม
ใน Apidog คุณสามารถชี้ collection เดียวไปยัง Model Studio endpoint แล้วสลับ environment ระหว่าง qwen3.7-max กับ qwen3.8-max ได้โดยไม่ต้องแก้ request ซ้ำ
แนวทางนี้ช่วยให้คุณเปรียบเทียบ output, latency และ token usage จาก workload เดียวกัน และนำ scenarios เดิมกลับมารันซ้ำได้เมื่อ Alibaba เปลี่ยนราคา ออกโมเดลอัปเดต หรือเมื่อโปรโมชันสิ้นสุดลง
ข้อแนะนำสุดท้าย
อัปเกรดเป็น Qwen 3.8-Max ตอนนี้ หากคุณต้องการ:
- Agent ที่ทำงานกับ terminal หรือ tool calls
- งานวิจัยและการวิเคราะห์หลายขั้นตอน
- อินพุตภาพ เช่น screenshot, เอกสาร หรือกราฟ
- ข้อมูลสถาปัตยกรรมที่ชัดเจนขึ้น
- ทางเลือก open weights เมื่อเปิดตัวจริง
ใช้ Qwen 3.7-Max ต่อในช่วงโปรโมชัน หาก:
- งานเป็น Q&A, summarization หรือ chat ทั่วไป
- คุณภาพของ 3.7-Max เพียงพออยู่แล้ว
- ต้นทุนต่อ token สำคัญกว่าความสามารถ multimodal และ agentic ที่เพิ่มขึ้น
- คุณยอมรับความเสี่ยงที่โปรโมชันไม่มีวันสิ้นสุดประกาศชัดเจน
ลดระดับไปใช้ qwen3.7-plus หาก:
- งานเป็น classification, extraction หรือ template generation
- ไม่ต้องการ reasoning ระดับ Max
- ต้องการลดต้นทุนให้มากที่สุด
ดูรายละเอียดของรุ่น Plus ได้ที่ Qwen 3.7-Plus
คำถามที่พบบ่อย
Qwen 3.8-Max ถูกกว่า Qwen 3.7-Max หรือไม่?
ที่ราคาปลีก ถูกกว่า: $2 / $6 เทียบกับ $2.5 / $7.5 ต่อ 1M โทเค็น
แต่ราคาปัจจุบันของ Qwen 3.7-Max ช่วงโปรโมชันคือ $1.25 / $3.75 ซึ่งถูกกว่า Qwen 3.8-Max ราว 38% โปรโมชันไม่มีวันสิ้นสุดที่เผยแพร่ไว้ ดูรายละเอียดได้ใน คู่มือราคา Qwen 3.8
ต้องเปลี่ยนโค้ดเพื่อสลับจาก qwen3.7-max เป็น qwen3.8-max หรือไม่?
สำหรับการใช้งานพื้นฐาน ไม่จำเป็น ทั้งคู่ใช้ OpenAI-compatible endpoint ของ Model Studio จึงเปลี่ยน model ID ได้โดยตรง
อย่างไรก็ตาม ควรตั้งค่า reasoning_effort อย่างชัดเจนสำหรับ 3.8-Max เพื่อควบคุมคุณภาพและต้นทุน และหากส่งรูปภาพ คุณต้องใช้รูปแบบ input สำหรับ image content ที่ API รองรับ
Qwen 3.7-Max มีน้ำหนักโมเดลแบบเปิดหรือไม่?
ไม่มี และ Alibaba ไม่เคยประกาศว่าจะเปิด weights ของ Qwen 3.7-Max
Qwen 3.8-Max เป็นรุ่น Max แรกที่มีคำมั่นว่าจะเปิด weights บน Hugging Face และ ModelScope ราววันที่ 10 สิงหาคม 2026 แต่ ณ วันที่ 3 สิงหาคม 2026 ยังดาวน์โหลดไม่ได้
Qwen 3.8-Max ดีกว่า Claude หรือ GPT แล้วหรือยัง?
ขึ้นอยู่กับประเภทงาน และผลที่อ้างอิงเป็นตัวเลขจาก Alibaba เอง
ในตารางของ Alibaba นั้น Qwen 3.8-Max นำ Claude Opus 4.8 และ Fable 5 บน Terminal Bench 2.1 และนำใน PaperBench กับ IFBench แต่ยังตาม Fable 5 บน SWE-bench Pro และตามโมเดลแนวหน้าบน HLE
ควรรอผลประเมินจากบุคคลที่สาม และทดสอบกับ workload ของคุณเองก่อนตัดสินใจย้าย production configuration

Top comments (0)