DEV Community

Cover image for Qwen 3.8 ผลทดสอบ: ตาราง Alibaba เผยอะไร และอะไรที่ไม่ได้บอก
Thanawat Wongchai
Thanawat Wongchai

Posted on • Originally published at apidog.com

Qwen 3.8 ผลทดสอบ: ตาราง Alibaba เผยอะไร และอะไรที่ไม่ได้บอก

เป็นเวลาสองสัปดาห์แล้วที่เรื่องราวของ Qwen 3.8 ยังไม่สมบูรณ์ การพรีวิวสำหรับสื่อในเดือนกรกฎาคมสัญญาว่าจะเป็นโมเดลระดับแนวหน้า แต่ยังไม่มีคะแนนเผยแพร่ จึงมีบทความช่วงแรกจำนวนมากอิงตามความรู้สึก จนวันที่ 3 สิงหาคม 2026 โพสต์ประกาศอย่างเป็นทางการ ของ Alibaba สำหรับ Qwen 3.8-Max ได้เผยตารางเปรียบเทียบเกณฑ์มาตรฐานฉบับเต็มกับ Claude Opus 4.8, Fable 5, GPT-5.6 Sol และ Qwen3.7-Max รวมถึงตารางมัลติโมดัลแยกที่เทียบกับ Gemini 3.1 Pro และ GPT-5.6 Sol

ลองใช้ Apidog วันนี้

ตารางนี้มีทั้งชัยชนะ ความพ่ายแพ้ และรายละเอียดเชิงวิธีการที่มักหายไปจากพาดหัวข่าว บทความนี้จะสรุปตัวเลขที่ควรรู้ พร้อมขั้นตอนสำหรับทดสอบโมเดลด้วย API ของคุณเอง แทนการตัดสินจากตารางของผู้ผลิตเพียงอย่างเดียว หากต้องการดูพารามิเตอร์ ราคา และช่องทางเข้าถึงโมเดลก่อน อ่าน คำอธิบาย Qwen 3.8-Max ได้ก่อน

ข้อควรระวัง: คะแนนทั้งหมดด้านล่างมาจากตารางที่ Alibaba เผยแพร่เอง โดยเชิงอ้างอิงของกระดานผู้นำระบุวันที่ 3 สิงหาคม 2026 ขณะเขียนบทความนี้ยังไม่มีการประเมินอิสระ จึงควรอ่านทุกตัวเลขในฐานะ “ข้ออ้างของผู้ผลิต”

ตารางแบบสรุป

นี่คือคะแนนโมเดลข้อความหลักตามที่ Alibaba เผยแพร่ โดยทุกแถวมีหลักการว่า คะแนนสูงกว่าดีกว่า

เกณฑ์มาตรฐาน Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol Qwen3.7-Max
Terminal Bench 2.1 86.6 84.6 84.6 88.8 74.5
SWE-bench Pro 67.7 69.2 80.0 64.6 60.6
PaperBench 93.0 80.3 88.8 90.5 64.8
GPQA Diamond 92.6 92.0 92.6 94.1 92.4
IFBench 82.8 62.2 63.5 72.7 79.1
HLE (Humanity’s Last Exam) 43.6 45.7 53.3 47.2 41.4

ที่มา: ตารางที่จัดทำโดยผู้ผลิตของ Alibaba คำว่า “จัดทำโดยผู้ผลิต” มีผลต่อการตีความมาก เพราะผู้ผลิตควบคุมเวอร์ชันของเกณฑ์มาตรฐาน วิธีพร้อมท์ การสุ่มตัวอย่าง และนโยบายการลองใหม่

ตารางเกณฑ์มาตรฐาน Qwen 3.8-Max

Qwen 3.8-Max ชนะที่ไหนบ้าง

PaperBench: ผลลัพธ์เรือธงที่ดีที่สุด

PaperBench ทดสอบความสามารถในการสร้างผลลัพธ์จากเอกสารงานวิจัย และเป็นแถวที่ Qwen 3.8-Max แข็งแกร่งที่สุดในตาราง:

  • Qwen 3.8-Max: 93.0
  • GPT-5.6 Sol: 90.5
  • Fable 5: 88.8
  • Claude Opus 4.8: 80.3
  • Qwen3.7-Max: 64.8

จุดที่ควรจับตาคือการเพิ่มขึ้นจาก Qwen3.7-Max ถึง 28.2 คะแนน หากตัวเลขนี้ได้รับการยืนยันจากการทดสอบอิสระ จะเป็นสัญญาณสำคัญสำหรับงานที่เกี่ยวข้องกับการวิจัย เอกสาร และการทำงานหลายขั้นตอนระยะยาว

IFBench: การทำตามคำสั่ง

Qwen 3.8-Max ได้ 82.8 ใน IFBench ซึ่งสูงกว่าคู่แข่งที่ไม่ใช่ Qwen ในตารางนี้อย่างชัดเจน:

  • GPT-5.6 Sol: 72.7
  • Fable 5: 63.5
  • Claude Opus 4.8: 62.2

แม้ Qwen3.7-Max จะได้ 79.1 อยู่แล้ว แต่ Qwen 3.8-Max ยังเพิ่มขึ้นได้อีก แถวนี้จึงอาจสะท้อนว่าการทำตามคำสั่งเป็นจุดแข็งต่อเนื่องของตระกูล Qwen ไม่ใช่ผลลัพธ์ครั้งเดียว

Terminal Bench 2.1: แซง Claude แต่ยังไม่ใช่อันดับหนึ่ง

บน Terminal Bench 2.1:

  • GPT-5.6 Sol: 88.8
  • Qwen 3.8-Max: 86.6
  • Claude Opus 4.8: 84.6
  • Fable 5: 84.6

Qwen 3.8-Max อยู่อันดับสอง และนำ Opus 4.8 อยู่ 2 คะแนน ผลลัพธ์นี้น่าสนใจสำหรับงาน agentic ที่ใช้เทอร์มินัล แต่ไม่ควรตีความว่าโมเดลชนะทุกงานด้านการเขียนโค้ด เพราะผล SWE-bench Pro ให้ภาพที่ต่างออกไป

ผลลัพธ์ด้านมัลติโมดัล

ตารางมัลติโมดัลของ Alibaba เป็นส่วนที่ Qwen 3.8-Max ดูแข็งแกร่งที่สุดโดยรวม โดยรายงานว่า:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • นำหลายแถวในกลุ่ม OCR

อย่างไรก็ตาม Opus 4.8 และ Fable 5 ไม่ได้ถูกนำมาเปรียบเทียบโดยตรงในตารางมัลติโมดัลนี้ จึงควรระวังการสรุปว่าเป็นชัยชนะเหนือทุกโมเดล

หากกำลังเปรียบเทียบกับโมเดล open-weight อีกตัวที่เปิดตัวในช่วงเดียวกัน ความต่างหลักคือมัลติโมดัล: Kimi K3 เน้นข้อความเป็นหลัก อ่านรายละเอียดได้ใน การเปรียบเทียบ Qwen 3.8 กับ Kimi K3

จุดที่แพ้: อ่านผลลัพธ์ให้ครบ

Alibaba แสดงแถวที่โมเดลตามหลังไว้ในตารางด้วย ซึ่งเป็นข้อมูลสำคัญสำหรับการเลือกโมเดลใช้งานจริง

HLE: ตามหลัง Fable 5 อย่างมาก

บน Humanity’s Last Exam (HLE):

  • Fable 5: 53.3
  • GPT-5.6 Sol: 47.2
  • Claude Opus 4.8: 45.7
  • Qwen 3.8-Max: 43.6
  • Qwen3.7-Max: 41.4

Qwen 3.8-Max อยู่ท้ายกลุ่มโมเดลเรือธงทั้งสี่ และตามหลังผู้นำเกือบ 10 คะแนน แม้จะดีขึ้นจาก Qwen3.7-Max เล็กน้อย แต่ผลลัพธ์แถวนี้ไม่ได้สนับสนุนข้อสรุปว่า Qwen 3.8-Max เป็นผู้นำทุกมิติ

SWE-bench Pro: ตามหลัง Fable 5 ชัดเจน

บน SWE-bench Pro:

  • Fable 5: 80.0
  • Claude Opus 4.8: 69.2
  • Qwen 3.8-Max: 67.7
  • GPT-5.6 Sol: 64.6
  • Qwen3.7-Max: 60.6

Qwen 3.8-Max ดีขึ้นจากรุ่นก่อนหน้า 7.1 คะแนน และนำ GPT-5.6 Sol ในตารางนี้ แต่ยังตามหลัง Fable 5 อยู่ 12.3 คะแนน

ดังนั้นทั้งสองข้อความต่อไปนี้เป็นจริงพร้อมกัน:

  1. Qwen 3.8-Max นำ Claude Opus 4.8 บน Terminal Bench 2.1
  2. Qwen 3.8-Max ตามหลัง Fable 5 มากบน SWE-bench Pro

สำหรับทีมพัฒนาซอฟต์แวร์ ความต่างนี้หมายความว่าควรทดสอบกับ repository, issue และ workflow ของทีมเองก่อนตัดสินใจย้ายโมเดล

DeepSWE และงาน agentic ที่ซับซ้อน

DeepSWE เป็นอีกแถวที่ Qwen 3.8-Max ตามหลังโมเดลแนวหน้าในตารางของ Alibaba เอง รูปแบบโดยรวมของงานเขียนโค้ดจึงค่อนข้างชัด:

  • แข่งขันได้ดีในงาน agentic ที่ขับเคลื่อนด้วยเทอร์มินัล
  • ตามหลังในงานวิศวกรรมซอฟต์แวร์เชิงลึกและการประเมินที่ยากกว่า

สรุปตามตารางของ Alibaba คือ Qwen 3.8-Max นำ Opus 4.8 ในหลายแถวของงาน agentic, ตามหลัง Fable 5 ในงานเขียนโค้ดหลักหลายรายการ และเด่นมากในด้านมัลติโมดัลและเอกสาร ทั้งหมดนี้มาพร้อมราคาที่รายงานว่าอยู่ที่ $2 สำหรับอินพุต และ $6 สำหรับเอาต์พุตต่อหนึ่งล้านโทเค็น ตามหน้าการกำหนดราคาอย่างเป็นทางการ

รายละเอียดเชิงวิธีการที่ไม่ควรมองข้าม

การอ่านตาราง benchmark ให้ถูกต้องต้องดูมากกว่าคะแนน มีรายละเอียดสี่ข้อจากการเผยแพร่ของ Alibaba ที่ส่งผลต่อการตีความโดยตรง

1. ทุกตัวเลขเป็นการทดสอบโดยผู้ผลิต

Alibaba เป็นผู้ประเมินทั้งโมเดลของตัวเองและของคู่แข่ง นี่เป็นแนวปฏิบัติปกติสำหรับตารางเปิดตัว แต่ยังหมายความว่าผู้เผยแพร่เป็นผู้เลือก:

  • เวอร์ชันของ benchmark
  • กลยุทธ์การพร้อมท์
  • การตั้งค่า sampling
  • จำนวนครั้งและเงื่อนไขการ retry
  • โมเดลหรือ endpoint ที่ใช้กับคู่แข่ง

สิ่งเหล่านี้ไม่ใช่หลักฐานของการฉ้อโกง แต่เป็นตัวแปรที่มีผลต่อคะแนนอย่างมีนัยสำคัญ

2. แถวการเขียนโค้ดส่วนใหญ่รันด้วย Claude Code harness

Alibaba ระบุว่า benchmark การเขียนโค้ดส่วนใหญ่รันผ่าน Claude Code ซึ่งเป็น agent harness ของ Anthropic และเรียก Qwen 3.8-Max ผ่าน API ที่เข้ากันได้กับ Anthropic

ข้อดีคือทุกโมเดลถูกทดสอบใน harness เดียวกัน แต่สิ่งที่คะแนนสะท้อนจริงคือ:

ความสามารถของ Qwen ภายใน agent harness ของ Anthropic

Harness มีผลต่อคะแนน agentic ได้หลายจุด ทั้งรูปแบบ tool call, prompt template, retry policy และการจัดการ context ดังนั้นหากระบบโปรดักชันของคุณใช้ SDK หรือ agent framework อื่น ผลลัพธ์อาจต่างออกไป

3. Benchmark หลายรายการสร้างโดยทีม Qwen

QwenSWEBench, QwenQoderBench, CoWorkBench และ RecreationBench ถูกสร้างโดยทีม Qwen เอง

Benchmark ภายในไม่ได้ไร้ประโยชน์ เพราะอาจวัดความสามารถที่การประเมินสาธารณะยังไม่ครอบคลุม แต่ควรแยกน้ำหนักของผลลัพธ์ออกจาก benchmark สาธารณะอย่าง SWE-bench Pro เสมอ โดยเฉพาะเมื่ออ้างอิงคะแนนเพื่อเลือกโมเดลสำหรับ production

4. เชิงอรรถของ Fable 5

ในตารางของ Alibaba มีเชิงอรรถว่า:

“ผลลัพธ์ Fable5 อาจเกี่ยวข้องกับการสำรองข้อมูล (fallbacks)”

เชิงอรรถนี้หมายความว่าคอลัมน์ Fable 5 อาจไม่ได้สะท้อนพฤติกรรมของโมเดลอย่างบริสุทธิ์ในทุกกรณี ไม่ว่ารายละเอียดเชิงเทคนิคจะเป็นอย่างไร ก็เป็นเหตุผลให้ไม่ควรนำคะแนนไปสรุปโดยไม่มีบริบท

แนวคิดนี้ไม่ได้ใช้เฉพาะกับ Alibaba ผู้ผลิตรายใหญ่ทั้งหมด—including Anthropic, OpenAI และ Google—เผยแพร่ตารางที่รันด้วยวิธีการของตัวเองเช่นกัน เราเคยอธิบายรูปแบบเดียวกันในการวิเคราะห์เกณฑ์มาตรฐาน Kimi K3

เช็กลิสต์ก่อนเชื่อตาราง benchmark ของผู้ผลิต

เมื่ออ่านตาราง benchmark ของผู้ผลิต ไม่ว่าจะเป็น Alibaba หรือรายอื่น ให้ตรวจสอบตามลำดับนี้:

  1. ใครดำเนินการประเมิน?

    คะแนนที่ผู้ผลิตรายงานเองควรถูกมองเป็นข้อมูลเบื้องต้น ไม่ใช่ข้อสรุปสุดท้าย

  2. ใช้ harness และการตั้งค่าอะไร?

    งาน agentic มีความไวต่อ harness, prompt และ retry policy มาก

  3. benchmark ใดที่ผู้ผลิตสร้างเอง?

    การประเมินภายในวัดบางอย่างได้ดี แต่ไม่เหมือนการประเมินสาธารณะ

  4. อ่านเชิงอรรถเสมอ

    ข้อความสั้น ๆ เรื่อง fallback หรือการกำหนดค่าโมเดลอาจเปลี่ยนความหมายของคอลัมน์ทั้งหมด

  5. ดูสิ่งที่ไม่ได้เผยแพร่

    แถวที่หายไปอาจให้ข้อมูลพอ ๆ กับแถวที่ถูกเลือกมาแสดง เปรียบเทียบกับการเปรียบเทียบรุ่นก่อนหน้าของผู้ผลิตต่าง ๆ เพื่อดูว่า benchmark ใดปรากฏหรือหายไป

  6. รอแหล่งข้อมูลที่สอง

    โดยทั่วไป การรอผลจากชุมชนหรือผู้ประเมินอิสระประมาณหนึ่งสัปดาห์จะให้ภาพที่น่าเชื่อถือกว่า

ทดสอบ Qwen 3.8-Max กับ workload ของคุณเอง

เช็กลิสต์ช่วยให้คุณอ่านตารางได้ดีขึ้น แต่แนวทางที่ใช้งานได้จริงที่สุดคือสร้าง evaluation ของตัวเอง

Qwen 3.8-Max พร้อมใช้งานบน Alibaba Cloud Model Studio โดยใช้รหัสโมเดล qwen3.8-max ตามหน้ารายการโมเดลอย่างเป็นทางการ และรองรับ API ที่เข้ากันได้กับ OpenAI และ Anthropic

ขั้นตอนที่แนะนำ

  1. เลือกโมเดล baseline ที่ทีมใช้อยู่

    ตัวอย่างเช่น Qwen3.7-Max, Kimi K3, Claude หรือ GPT

  2. สร้างคำขอ API สองชุด

    • ชุดแรกเรียก qwen3.8-max
    • ชุดที่สองเรียก baseline ให้ใช้ prompt, temperature, max tokens และเงื่อนไขเดียวกัน
  3. รวบรวม prompt จริง 20–30 รายการ

    ใช้ prompt จาก workload ที่ไม่ใช่ข้อมูลอ่อนไหว เช่น:

    • สร้าง JSON สำหรับ API integration
    • วิเคราะห์ error log
    • สร้าง unit test
    • สรุปเอกสารเทคนิค
    • แก้ไขโค้ดตาม issue จริง
  4. กำหนด assertion ที่วัดได้

    ตัวอย่างเช่น:

    • JSON parse ได้หรือไม่
    • มีฟิลด์บังคับครบหรือไม่
    • มี tool call ตาม schema หรือไม่
    • latency ต่ำกว่าเกณฑ์ที่กำหนดหรือไม่
    • ผ่าน test suite หรือไม่
  5. รันทั้งสองโมเดลในเงื่อนไขเดียวกัน

    เก็บ pass rate, latency, token usage และข้อผิดพลาดที่พบ

ตัวอย่าง payload สำหรับ chat-completions:

{
  "model": "qwen3.8-max",
  "messages": [
    {
      "role": "system",
      "content": "ตอบกลับเป็น JSON ที่ถูกต้องเท่านั้น"
    },
    {
      "role": "user",
      "content": "สร้าง object สำหรับ API response ที่มี id, title และ status"
    }
  ],
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

สำหรับการตรวจ JSON สามารถเพิ่ม assertion ใน test script ตามเครื่องมือที่ใช้ เช่น:

const body = pm.response.json();

pm.test("response มีฟิลด์ที่ต้องการ", () => {
  pm.expect(body).to.have.property("id");
  pm.expect(body).to.have.property("title");
  pm.expect(body).to.have.property("status");
});
Enter fullscreen mode Exit fullscreen mode

ตั้งค่าใน Apidog เพื่อเปรียบเทียบโมเดล

คุณสามารถใช้ Apidog เพื่อสร้าง request และ environment แยกสำหรับแต่ละโมเดลได้:

  • Environment qwen-3-8-max
  • Environment current-baseline
  • ชุด test case ที่ใช้ prompt เดียวกัน
  • Assertion สำหรับ schema, latency และข้อมูลที่ต้องมี
  • รายงาน pass rate และ response time แบบเทียบกัน

มีรายละเอียดเฉพาะของ Qwen สองข้อที่ควรทดสอบเพิ่ม:

  1. โมเดลตั้งค่าเริ่มต้นเป็น reasoning_effort: xhigh

    ควรวัดต้นทุนและเวลาแฝงที่ระดับความพยายามเดียวกับที่ตั้งใจใช้ใน production

  2. หากใช้ Anthropic-compatible endpoint

    ควรทดสอบ endpoint นี้แยกจาก OpenAI-compatible endpoint เพราะ benchmark ด้านการเขียนโค้ดของ Alibaba ส่วนใหญ่รันผ่านโปรโตคอล Anthropic-compatible

ดาวน์โหลด Apidog แล้วตั้งค่า endpoint ทั้งสองเป็น environment จากนั้นรันชุด prompt เดียวกัน คุณจะได้ตัวเลขที่สัมพันธ์กับระบบของคุณโดยตรง ก่อนที่ผลจากกระดานผู้นำอิสระจะออกมา

คำถามที่พบบ่อย

ตัวเลขเกณฑ์มาตรฐานของ Qwen 3.8 ได้รับการยืนยันอย่างเป็นอิสระหรือไม่?

ไม่ ณ วันที่ 3 สิงหาคม 2026 ตัวเลขที่เผยแพร่ทั้งหมดมาจากตารางของ Alibaba เอง Artificial Analysis และกระดานผู้นำชุมชนยังไม่ได้ให้คะแนน Qwen 3.8-Max ในขณะที่เขียนบทความนี้ จึงควรมองตารางนี้เป็นข้ออ้างของผู้ผลิตจนกว่าจะมีผลทดสอบอิสระ

ผลลัพธ์เกณฑ์มาตรฐานที่ดีที่สุดของ Qwen 3.8-Max คืออะไร?

ในตารางโมเดลข้อความ PaperBench คือผลลัพธ์ที่ดีที่สุด ด้วยคะแนน 93.0 นำ GPT-5.6 Sol ที่ 90.5, Fable 5 ที่ 88.8 และ Opus 4.8 ที่ 80.3 สำหรับตารางมัลติโมดัล MathVision ที่ 95.2 และผลลัพธ์ในกลุ่ม OCR คือจุดที่แข็งแกร่งที่สุดโดยรวม

Qwen 3.8-Max แพ้ในส่วนใดอย่างชัดเจน?

Qwen 3.8-Max ได้ 43.6 บน HLE ซึ่งเป็นอันดับท้ายสุดในบรรดาสี่โมเดลเรือธง และตามหลัง Fable 5 ที่ 53.3 มาก บน SWE-bench Pro ได้ 67.7 เทียบกับ Fable 5 ที่ 80.0 รวมถึงตามหลังบน DeepSWE งานวิศวกรรมซอฟต์แวร์เชิงลึกและการสอบความรู้ทั่วไปจึงเป็นจุดอ่อนหลักในตารางของ Alibaba

Qwen 3.8 ดีกว่า Qwen 3.7-Max มากน้อยแค่ไหน?

ตามตารางของ Alibaba การเพิ่มขึ้นระหว่างรุ่นมีขนาดใหญ่:

  • Terminal Bench 2.1: 74.5 → 86.6
  • SWE-bench Pro: 60.6 → 67.7
  • PaperBench: 64.8 → 93.0

อย่างไรก็ตาม การอัปเกรดคุ้มค่าหรือไม่ขึ้นอยู่กับราคา latency รูปแบบ API และ workload ของคุณด้วย อ่านรายละเอียดได้ในการเปรียบเทียบ Qwen 3.8 กับ Qwen 3.7

Top comments (0)