DEV Community

Cover image for Qwen 3.8 vs Kimi K3: สองยักษ์ใหญ่ AI โอเพนเวทจากจีน ประชันกัน
Thanawat Wongchai
Thanawat Wongchai

Posted on • Originally published at apidog.com

Qwen 3.8 vs Kimi K3: สองยักษ์ใหญ่ AI โอเพนเวทจากจีน ประชันกัน

เดือนกรกฎาคม 2026 เป็นเดือนที่การแข่งขันของโมเดลแนวหน้าแบบเปิดน้ำหนักจากจีนเข้มข้นขึ้น: Moonshot AI เปิดตัว Kimi K3 เมื่อ 16 กรกฎาคม และ Alibaba เปิดตัว Qwen 3.8-Max รุ่นพรีวิวในอีก 3 วันต่อมา ก่อนเปิดใช้งานทั่วไปช่วงต้นเดือนสิงหาคม ทั้งคู่เป็นโมเดล mixture-of-experts (MoE) ระดับล้านล้านพารามิเตอร์ รองรับการเชื่อมต่อกับระบบควบคุมเอเจนต์สไตล์ Claude Code และมีราคา API ต่ำกว่าโมเดลแนวหน้าหลายรุ่นจากสหรัฐฯ อย่างไรก็ตาม ความต่างที่ต้องพิจารณาจริงคือความพร้อมของน้ำหนักโมเดล, ความสามารถด้านภาพ และต้นทุนสำหรับงานใช้งานหนัก

ลองใช้ Apidog วันนี้

บทความนี้เปรียบเทียบข้อมูลที่ตรวจสอบได้ ณ วันที่ 3 สิงหาคม 2026 หากต้องการดูสเปก Qwen โดยละเอียดก่อน อ่านคำอธิบาย Qwen 3.8-Max

ข้อควรระวัง: ยังไม่มีผลทดสอบอิสระแบบตัวต่อตัวที่วาง Qwen 3.8-Max และ Kimi K3 ไว้ภายใต้เงื่อนไขเดียวกัน ตัวเลขเกณฑ์มาตรฐานในบทความนี้มาจากผู้ให้บริการแต่ละราย จึงใช้เป็นข้อมูลประกอบ ไม่ใช่ข้อสรุปสุดท้าย

ไทม์ไลน์: น้ำหนักโมเดลใดพร้อมใช้แล้ว

ลำดับการเปิดตัวสำคัญ เพราะคำว่า “open-weight” มีสถานะต่างกันสำหรับทั้งสองโมเดล

  • Kimi K3 เปิดตัววันที่ 16 กรกฎาคม 2026 และเผยแพร่น้ำหนักบน Hugging Face วันที่ 27 กรกฎาคม หรือ 11 วันหลังเปิดตัว

    • รูปแบบ: MXFP4
    • ขนาด: 594 GB
    • สถานะ: ดาวน์โหลด, ควอนไทซ์ และโฮสต์เองได้แล้ว
  • Qwen 3.8-Max เปิดตัวพรีวิววันที่ 19 กรกฎาคม และเปิดใช้งานทั่วไปผ่าน Alibaba Cloud Model Studio ช่วงต้นเดือนสิงหาคม

    • ตามโพสต์เปิดตัว Qwen อย่างเป็นทางการ Alibaba ระบุว่าจะปล่อยน้ำหนักบน Hugging Face และ ModelScope “ในสัปดาห์หน้า”
    • ณ วันที่ 3 สิงหาคม 2026: ยังดาวน์โหลดน้ำหนักไม่ได้
    • วันที่คาดหมาย: ประมาณ 10 สิงหาคม

หากข้อกำหนดของคุณคือ ต้องโฮสต์โมเดลเองทันที Kimi K3 คือทางเลือกเดียวที่ใช้งานได้ในวันที่เปรียบเทียบนี้

พารามิเตอร์: MoE ระดับล้านล้านตัว

โมเดล MoE มีจำนวนพารามิเตอร์รวมสูง แต่จะเปิดใช้พารามิเตอร์เพียงบางส่วนต่อโทเค็น ดังนั้นให้แยกดูทั้ง “พารามิเตอร์รวม” และ “พารามิเตอร์ที่ใช้งานจริง”

รายละเอียด Qwen 3.8-Max Kimi K3
จำนวนพารามิเตอร์ทั้งหมด 2.4 ล้านล้าน 2.8 ล้านล้าน
พารามิเตอร์ที่ใช้งานต่อโทเค็น 95 พันล้าน 104 พันล้าน
อัตราส่วนการเปิดใช้งาน ~4% ~3.7%
สถาปัตยกรรมพื้นฐาน Qwen 3.5, MoE MoE
น้ำหนักแบบเปิด สัญญาว่าจะปล่อยราว 10 ส.ค. MXFP4, 594 GB บน Hugging Face

Qwen 3.8-Max ใช้พารามิเตอร์รวมน้อยกว่า K3 400 พันล้าน และใช้พารามิเตอร์ต่อโทเค็นน้อยกว่า 9 พันล้าน ตัวเลขนี้ไม่ได้แปลว่าความสามารถดีกว่าหรือแย่กว่าโดยตรง แต่ส่งผลต่อต้นทุนการให้บริการเมื่อปัจจัยอื่นเท่ากัน

สำหรับการโฮสต์เอง K3 ขนาด 594 GB ในรูปแบบ MXFP4 ต้องใช้โครงสร้างพื้นฐานหลายโหนดอยู่แล้ว และยังไม่รวม KV cache สำหรับบริบทยาว Qwen 3.8-Max ซึ่งมีพารามิเตอร์รวม 2.4 ล้านล้าน ก็น่าจะต้องใช้ทรัพยากรระดับใกล้เคียงกันเมื่อเปิดให้นำไปติดตั้งเอง

ในทางปฏิบัติ ทีมส่วนใหญ่ควรเริ่มจาก hosted endpoint ก่อน แล้วพิจารณา self-hosting เมื่อมีเหตุผลด้าน compliance, การวิจัย หรือการควบคุมเวอร์ชันโมเดล

ความเปิดเผย: ใช้ได้จริงตอนนี้ vs คำมั่นว่าจะปล่อย

Kimi K3 มีน้ำหนักโมเดลเป็นสาธารณะแล้ว คุณจึงสามารถ:

  1. ตรวจสอบ repository และเงื่อนไขใบอนุญาต
  2. ดาวน์โหลดไฟล์น้ำหนัก
  3. ใช้ quantization จากชุมชน
  4. ทำ fine-tuning
  5. ตรึงเวอร์ชันโมเดลที่ใช้งานในการทดสอบหรือ production

Qwen 3.8-Max เป็นโมเดลคลาส Qwen-Max รุ่นแรกที่ Alibaba ระบุว่าจะปล่อยน้ำหนักแบบเปิด ซึ่งต่างจากรุ่น Max ก่อนหน้าที่เป็น API-only แต่จนกว่า repository จะเปิดใช้งาน โมเดลนี้ยังคงเป็น API model ที่มีแผนจะเผยแพร่น้ำหนัก

ข้อสรุปสำหรับวันนี้: Kimi K3 นำในด้านความเปิดเผย เพราะดาวน์โหลดและโฮสต์เองได้จริง ควรตรวจสอบสถานะ Qwen อีกครั้งราววันที่ 10 สิงหาคม และเมื่อมีน้ำหนักแล้วให้เปรียบเทียบต่อเรื่องใบอนุญาตและคุณภาพของ quantization

รูปแบบอินพุต: Qwen รองรับภาพ, K3 เน้นข้อความ

Qwen 3.8-Max รองรับข้อความและรูปภาพตามการกำหนดค่าโมเดล:

{
  "input_modalities": ["text", "image"]
}
Enter fullscreen mode Exit fullscreen mode

Alibaba ยังสาธิตความเข้าใจเอกสาร PDF กว่า 200 หน้า และวิดีโอ 100 ชั่วโมงผ่าน memory graph ในโพสต์เปิดตัว แต่ควรถือว่าสิ่งเหล่านี้เป็นการสาธิต ไม่ใช่ประเภทอินพุต API ที่มีเอกสารรับรองอย่างชัดเจน

ข้อมูลจาก Alibaba ชี้ว่า Qwen ทำคะแนนเด่นในงานมัลติโมดัล เช่น:

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1
  • งาน OCR หลายรายการ

Kimi K3 เป็นโมเดลข้อความ หากระบบของคุณต้องอ่านภาพหน้าจอ, เอกสารสแกน, UI หรือทำงานกับ computer-use agent คุณต้องเพิ่ม vision model อื่นเข้ามาใน pipeline ซึ่งเพิ่มทั้งโค้ดและเวลาแฝง

เลือกตามประเภทงาน:

  • ข้อความล้วน, โค้ด, agent loop: ทั้งสองรุ่นเป็นตัวเลือกที่พิจารณาได้
  • ภาพ, OCR, เอกสาร, UI automation: Qwen 3.8-Max ได้เปรียบจากการรับภาพโดยตรง

Context window และ API

Qwen 3.8-Max มี context window ระดับเดียวที่ 1,000,000 โทเค็น และสร้างเอาต์พุตได้สูงสุด 65,536 โทเค็น

การให้เหตุผลควบคุมผ่านพารามิเตอร์ reasoning_effort:

{
  "reasoning_effort": "xhigh"
}
Enter fullscreen mode Exit fullscreen mode

ตัวเลือกที่ระบุคือ:

  • low
  • medium
  • xhigh — ค่าเริ่มต้น

Qwen มี endpoint ทั้งรูปแบบ OpenAI-compatible และ Anthropic-compatible บน Alibaba Cloud Model Studio คุณจึงเชื่อมต่อกับ workflow สไตล์ Claude Code ได้ผ่านตัวแปรสภาพแวดล้อม เช่น:

export ANTHROPIC_BASE_URL="https://<dashscope-anthropic-endpoint>"
export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Model Studio มี base URL แยกตามภูมิภาค เช่น ปักกิ่ง, สิงคโปร์ และสหรัฐอเมริกา-เวอร์จิเนีย ดูรายชื่อโมเดลและภูมิภาคได้ที่หน้าโมเดลของ Model Studio

หากต้องทดสอบข้ามภูมิภาค ให้สร้าง environment แยกสำหรับแต่ละ base URL ในApidog เพื่อสลับ endpoint โดยไม่ต้องแก้ไข request

Kimi K3 รองรับโปรโตคอล Anthropic เช่นกัน จึงใช้กับระบบควบคุมสไตล์ Claude Code ได้ สำหรับ endpoint และข้อจำกัดล่าสุด ดูคำอธิบาย Kimi K3

ราคา: Qwen ถูกกว่า โดยเฉพาะงานที่สร้างเอาต์พุตมาก

อัตราราคาที่เผยแพร่ต่อ 1 ล้านโทเค็น:

อัตรา Qwen 3.8-Max Kimi K3
อินพุต $2.00 $3.00
เอาต์พุต $6.00 $15.00
อินพุตจากแคช $0.20 $0.30
รูปแบบราคา คงที่ตลอด context 1 ล้านโทเค็น ตามตารางราคาที่ Moonshot เผยแพร่

Qwen 3.8-Max คิดค่าบริการ $2 สำหรับอินพุตและ $6 สำหรับเอาต์พุต โดยคงที่ตลอด context 1 ล้านโทเค็น ตามหน้าราคาอย่างเป็นทางการของ Model Studio:

  • การสร้าง cache แบบ explicit คิดที่ 125% ของราคาอินพุต
  • cache read คิดที่ 10% ของราคาอินพุต
  • มีโควต้าฟรี 1 ล้านโทเค็นสำหรับภูมิภาคสิงคโปร์ และมีอายุ 90 วัน

Kimi K3 คิดค่าใช้จ่าย:

  • อินพุต: $3 ต่อ 1 ล้านโทเค็น
  • เอาต์พุต: $15 ต่อ 1 ล้านโทเค็น
  • cache read: $0.30 ต่อ 1 ล้านโทเค็น

คิดต้นทุนตามลักษณะ workload

  • งาน input-heavy และใช้ cache ดี

    เช่น system prompt ยาว หรือบริบทเอกสารซ้ำ: ส่วนต่าง cache read คือ $0.20 กับ $0.30 จึงไม่ห่างมาก

  • งาน output-heavy

    เช่น agent loop, reasoning และ code generation: Qwen มีราคาเอาต์พุต $6 เทียบกับ K3 ที่ $15 หรือถูกกว่าราว 2.5 เท่า

ข้อควรระวังคือ Qwen ตั้งค่า reasoning_effort เป็น xhigh โดยค่าเริ่มต้น และ reasoning tokens ถูกคิดเป็นเอาต์พุต ดังนั้นค่าใช้จ่ายจริงอาจสูงกว่าการคำนวณ input/output แบบพื้นฐาน ดูตัวอย่างการคำนวณต้นทุนได้ในการวิเคราะห์ราคา Qwen 3.8

เกณฑ์มาตรฐาน: อย่าเปรียบเทียบข้ามตารางโดยไม่ระวัง

ข้อมูลที่มี:

  • Alibaba เผยแพร่ตาราง Qwen 3.8-Max เทียบกับ Claude Opus 4.8, Fable 5, GPT-5.6 Sol และ Qwen 3.7-Max
  • Moonshot เผยแพร่ตาราง Kimi K3 เทียบกับโมเดลแนวหน้าในลักษณะเดียวกัน
  • ทั้งสองชุดเป็นการทดสอบโดยผู้ให้บริการเอง

ข้อมูลที่ยังไม่มี:

  • การประเมินอิสระที่ทดสอบ Qwen 3.8-Max และ Kimi K3 ภายใต้ harness, prompt และการตั้งค่า sampling เดียวกัน
  • ตัวเลขจาก Artificial Analysis สำหรับ Qwen 3.8-Max ณ เวลาที่เขียน

ตารางจาก Alibaba ระบุว่าการทดสอบส่วนใหญ่ใช้ Claude Code harness:

เกณฑ์มาตรฐาน Qwen 3.8-Max Claude Opus 4.8 Fable 5 GPT-5.6 Sol
Terminal Bench 2.1 86.6 84.6 84.6 88.8
SWE-bench Pro 67.7 69.2 80.0 64.6
PaperBench 93.0 80.3 88.8 90.5
GPQA Diamond 92.6 92.0 92.6 94.1
HLE 43.6 45.7 53.3 47.2

จากตารางของ Alibaba เอง Qwen 3.8-Max ตามหลัง Fable 5 ใน SWE-bench Pro และตามหลังโมเดลทั้งหมดใน HLE แต่ทำคะแนนเด่นใน PaperBench, instruction following เช่น IFBench 82.8 และงานมัลติโมดัล

Moonshot ระบุว่า K3 เหนือกว่า Claude Opus 4.8 ในหลายแถวที่บริษัททดสอบเอง แต่ยังตามหลัง Fable 5 และ GPT-5.6 Sol โดยรวม อ่านรายละเอียดข้ออ้างและข้อควรระวังได้ในการเปรียบเทียบ Kimi K3 vs Claude Opus 4.8

สรุปคือ ตารางของผู้ให้บริการช่วยยืนยันว่าโมเดลทั้งสองแข่งขันได้ในงานเอเจนต์ แต่ยังไม่ยืนยันว่าโมเดลใดแข็งแกร่งกว่าอีกโมเดลหนึ่ง ดูรายละเอียดเพิ่มเติมของตัวเลข Qwen ได้ในการวิเคราะห์เกณฑ์มาตรฐาน Qwen 3.8

ทดสอบ Qwen 3.8-Max และ Kimi K3 กับ workload ของคุณเอง

เมื่อไม่มีกรรมการอิสระ การทดสอบกับ prompt และข้อมูลจริงของคุณเป็นวิธีตัดสินใจที่มีประโยชน์ที่สุด ทั้งสองรุ่นรองรับ chat-completions ที่เข้ากันได้กับ OpenAI จึงสร้าง A/B test ได้ง่ายในApidog

ขั้นตอนแนะนำ

  1. สร้าง environment สำหรับ Qwen

    • เก็บ DashScope base URL
    • กำหนด model เป็น qwen3.8-max
    • เก็บ API key เป็นตัวแปรลับ
  2. สร้าง environment สำหรับ Kimi

    • เก็บ Moonshot endpoint
    • กำหนด model ID ของ K3
    • เก็บ API key แยกจาก Qwen
  3. สร้าง request เดียวด้วย prompt จากงานจริง

    ใช้ ticket จริง, โค้ดจริง, schema จริง หรือเอกสารจริง แทนปริศนาทั่วไป

  4. สลับ environment โดยไม่แก้ payload

  5. เปรียบเทียบผลลัพธ์อย่างน้อย 10 รอบต่อโมเดล

    บันทึก:

    • HTTP status
    • เวลาแฝง
    • จำนวนโทเค็น
    • คุณภาพคำตอบ
    • ความถูกต้องของ schema
    • อัตราความสำเร็จของ agent task
  6. เพิ่ม assertions เช่น:

    • response ต้องตรง JSON schema
    • latency ต้องไม่เกินค่าที่กำหนด
    • เอาต์พุตต้องมี keyword หรือ field ที่จำเป็น
    • การเรียกใช้เครื่องมือมีรูปแบบถูกต้อง

ตัวอย่าง assertion เชิงแนวคิด:

status == 200
response.body.result != null
response.time < 30000
response.body.code contains "function"
Enter fullscreen mode Exit fullscreen mode

การดีบัก SSE ยังช่วยตรวจสอบพฤติกรรมการสตรีม reasoning ได้ โดยเฉพาะหาก UI ของคุณแสดงโทเค็นการคิด ดาวน์โหลดApidogฟรีเพื่อสร้างชุดทดสอบที่รันซ้ำได้เมื่อผู้ให้บริการออกรุ่นอัปเดต

ตารางสรุป

แง่มุม ผู้ชนะวันนี้ ข้อควรระวัง
พารามิเตอร์รวม/ที่ใช้งาน Qwen 3.8-Max: 2.4T/95B เทียบกับ 2.8T/104B ขนาดเล็กกว่าไม่ได้หมายถึงดีกว่าหรือแย่กว่าโดยตรง
น้ำหนักแบบเปิดวันนี้ Kimi K3 Qwen คาดว่าจะปล่อยราว 10 ส.ค.
รูปแบบข้อมูล Qwen 3.8-Max รองรับข้อความและภาพ; การอ้างถึงวิดีโอ/เอกสารยาวเป็นการสาธิต
Context window Qwen 3.8-Max 1 ล้านโทเค็น, เอาต์พุตสูงสุด 65,536
ราคา Qwen 3.8-Max $2/$6 เทียบกับ K3 $3/$15; Qwen มี reasoning token เพิ่ม
เกณฑ์มาตรฐาน ตัดสินไม่ได้ ไม่มีการทดสอบ head-to-head แบบอิสระ
Harness ecosystem เสมอ ทั้งคู่รองรับ Anthropic-compatible endpoint
ประวัติการส่งมอบน้ำหนัก Kimi K3 K3 ปล่อยน้ำหนัก 11 วันหลังเปิดตัว; Qwen ยังเป็นคำมั่น

ควรเลือกโมเดลใด

เลือก Kimi K3 หาก:

  • ต้องโฮสต์โมเดลบนฮาร์ดแวร์ของคุณเองทันที
  • ต้องการตรึงและตรวจสอบน้ำหนักโมเดลเพื่อ compliance
  • งานเป็นข้อความล้วน
  • workload เน้นอินพุตและใช้ cache ได้มีประสิทธิภาพ

เลือก Qwen 3.8-Max หาก:

  • ต้องรับภาพหรือทำงานกับเอกสาร
  • สร้างเอาต์พุตจำนวนมาก เช่น agent loop หรือ code generation
  • ต้องการ context 1 ล้านโทเค็นด้วยราคาแบบคงที่
  • ต้องการใช้ endpoint ที่เข้ากันได้ทั้ง OpenAI และ Anthropic

รออีกหนึ่งสัปดาห์หากน้ำหนักแบบเปิดคือปัจจัยสำคัญที่สุด หาก Qwen ปล่อยน้ำหนักตามที่ระบุราววันที่ 10 สิงหาคม การตัดสินใจควรเปลี่ยนไปดูใบอนุญาต, รูปแบบอินพุต, ราคา และผลทดสอบ workload ของคุณเอง

ท้ายที่สุด ทั้งสองรุ่นเป็นตัวเลือกโมเดลแนวหน้าที่มีราคาน่าสนใจและเชื่อมต่อกับ harness เดิมได้ง่าย อย่าตัดสินจากตาราง benchmark เพียงอย่างเดียว—ทดสอบกับ repository, prompt และข้อจำกัดของ production จริงก่อนเลือกใช้ระยะยาว

คำถามที่พบบ่อย

Kimi K3 เปิดกว้างกว่า Qwen 3.8-Max หรือไม่?

ณ วันที่ 3 สิงหาคม 2026 ใช่ เพราะน้ำหนัก Kimi K3 อยู่บน Hugging Face ตั้งแต่ 27 กรกฎาคม 2026 ในรูปแบบ MXFP4 ขนาด 594 GB ขณะที่น้ำหนัก Qwen 3.8-Max ยังเป็นสิ่งที่ Alibaba ระบุว่าจะปล่อยราววันที่ 10 สิงหาคม

หาก Qwen เผยแพร่น้ำหนักตามแผน ทั้งสองจะเป็นโมเดลแนวหน้าแบบเปิดน้ำหนัก และจุดเปรียบเทียบสำคัญจะเปลี่ยนเป็นใบอนุญาต, community support และตัวเลือก quantization สำหรับตอนนี้ K3 เป็นรุ่นเดียวที่ self-host ได้ ดูขั้นตอนติดตั้งได้ในคู่มือการติดตั้ง K3 บนเครื่องของคุณ

โมเดลใดดีกว่าสำหรับการเขียนโค้ด?

ยังไม่มีคำตอบที่ยืนยันได้อย่างซื่อสัตย์ ผู้ให้บริการทั้งสองรายงานผล coding benchmark ที่แข็งแกร่ง แต่ใช้เงื่อนไขการทดสอบต่างกัน และไม่มีการเปรียบเทียบอิสระแบบ head-to-head

ควรใช้ task จาก repository ของคุณ เช่น:

  • แก้บั๊กจาก issue จริง
  • เพิ่ม test ที่ขาด
  • refactor โมดูลที่กำหนด
  • สร้าง migration
  • อธิบาย failure จาก CI log

แล้ววัดความถูกต้อง, เวลาแฝง, token usage และจำนวนรอบแก้ไขที่ agent ต้องใช้

ใช้ทั้งสองโมเดลกับ Claude Code ได้หรือไม่?

ได้ ทั้งคู่มี endpoint ที่เข้ากันได้กับ Anthropic

สำหรับ Qwen 3.8-Max ให้กำหนด ANTHROPIC_BASE_URL เป็น DashScope Anthropic endpoint และตั้ง:

export ANTHROPIC_MODEL="qwen3.8-max"
Enter fullscreen mode Exit fullscreen mode

Kimi K3 รองรับรูปแบบเดียวกันผ่าน endpoint ของ Moonshot ความเข้ากันได้นี้ทำให้การทดสอบ A/B ระหว่างสองโมเดลง่ายและต้นทุนต่ำ

สำหรับ workload เอเจนต์ทั่วไป โมเดลใดถูกกว่า?

ตามราคาที่เผยแพร่ Qwen 3.8-Max ถูกกว่า:

  • Qwen: $2 input / $6 output ต่อ 1 ล้านโทเค็น
  • Kimi K3: $3 input / $15 output ต่อ 1 ล้านโทเค็น

สำหรับ agent loop ที่สร้าง reasoning และโค้ดมาก Qwen ได้เปรียบชัดเจนจากราคาเอาต์พุตที่ต่ำกว่า อย่างไรก็ตาม K3 มี cache read ที่ $0.30 ขณะที่ Qwen อยู่ที่ $0.20 และ Qwen คิด reasoning token เป็นเอาต์พุต จึงควรสร้างแบบจำลองจาก token profile จริงของระบบคุณก่อนสรุปต้นทุน

Top comments (0)