การเปิดตัวโมเดลส่วนใหญ่มักนำเสนอความสามารถด้านโค้ดด้วยรูปแบบเดิม: คะแนน HumanEval และตัวอย่างฟังก์ชันเล็ก ๆ เช่น binary search แต่ Alibaba เลือกนำเสนอ Qwen 3.8-Max ในอีกมุมหนึ่ง ข้ออ้างไม่ใช่แค่ว่า “เขียนฟังก์ชันได้ดี” แต่คือโมเดลสามารถดำเนินโครงการซอฟต์แวร์ต่อเนื่องหลายสัปดาห์ เปิด issue, รวม pull request และส่งมอบฟีเจอร์ได้โดยไม่ต้องมีมนุษย์เข้ามาควบคุมตลอดเวลา
ข้ออ้างนี้ควรได้รับการตรวจสอบ บทความนี้สรุปการสาธิตการเขียนโค้ด 3 รายการที่ Alibaba เผยแพร่ พร้อมตัวเลข benchmark และขั้นตอนใช้งานจริงกับ qwen3.8-max ผ่าน Claude Code, Codex, Qoder, Qwen Code และ OpenClaw รวมถึงวิธีทดสอบ API ที่โค้ดซึ่งโมเดลสร้างขึ้นเรียกใช้งาน
หากต้องการภาพรวมของโมเดล โปรดอ่าน Qwen 3.8 คืออะไร: พารามิเตอร์รวม 2.4 ล้านล้าน, พารามิเตอร์ที่ใช้งาน 95 พันล้าน, context window 1 ล้านโทเค็น และน้ำหนักโมเดลแบบเปิดที่มีแผนเผยแพร่หลังเปิดตัว บทความนี้เน้นเรื่องการเขียนโค้ดโดยเฉพาะ และข้อมูลทั้งหมดสะท้อนสถานะ ณ วันที่ 3 สิงหาคม 2026
สิ่งที่ Alibaba อ้างจริง ๆ
ในโพสต์เปิดตัว Qwen 3.8 อย่างเป็นทางการ Alibaba วางตำแหน่ง Qwen 3.8-Max เป็นโมเดลที่ทำงานวิศวกรรมระยะยาวได้ ไม่ใช่เพียงตอบคำถามหรือสร้างโค้ดสั้น ๆ โดยอ้างว่าสามารถ:
- วางแผนงาน
- ทำงานต่อเนื่องหลายวัน
- ตรวจจับและแก้ข้อผิดพลาดของตัวเอง
- ส่งมอบผลลัพธ์ที่ตรวจสอบได้
มี 3 จุดที่ทำให้ข้ออ้างนี้น่าสนใจกว่าการตลาดวันเปิดตัวทั่วไป:
ระยะเวลาการสาธิตยาวนาน
การทำงานต่อเนื่อง 16 วันแตกต่างจาก benchmark แบบเอเจนต์ที่ใช้เวลา 20 นาทีมาก เพราะการกู้คืนจากข้อผิดพลาด การจัดการ context และการหลุดจากแผนเดิมมีความสำคัญมากขึ้นหนึ่งในเดโมตรวจสอบได้สาธารณะ
คุณสามารถเปิด repo อ่าน commit ตรวจสอบ PR และประเมินคุณภาพโค้ดได้เองใช้ชุดทดสอบที่เกี่ยวข้องกับเครื่องมือจริง
Alibaba ระบุว่า benchmark ด้านโค้ดส่วนใหญ่รันผ่านชุดทดสอบ Claude Code และเผยแพร่การตั้งค่าอย่างเป็นทางการให้ทำซ้ำได้
ข้อควรระวัง: ตัวเลขทั้งหมดในบทความนี้มาจากเอกสารเปิดตัวของ Alibaba และยังไม่มีการตรวจสอบอิสระ ณ ต้นเดือนสิงหาคม 2026 ดังนั้นให้มองเดโมเป็นหลักฐานประกอบ ไม่ใช่ข้อสรุปสุดท้าย
การสาธิตการเขียนโค้ดทั้งสาม
oh-my-cli: การพัฒนาอิสระ 16 วัน
เดโมหลักคือการให้ Qwen 3.8-Max สร้างเครื่องมือ command-line แล้วปล่อยให้ทำงานแบบไม่ต้องดูแลต่อเนื่อง จนถึงวันที่ 30 กรกฎาคม การรันดำเนินมา 16 วัน และสร้าง:
- 265 commits
- 127 pull requests
- 151 issues
Alibaba อ้างว่า issue ทั้งหมดถูกสร้าง ดำเนินการ และปิดโดยโมเดลเอง
repo เปิดให้ตรวจสอบได้ที่ qwen-code-dev-bot/oh-my-cli ซึ่งเป็นส่วนที่มีประโยชน์ที่สุดของเดโมนี้ เพราะคุณไม่จำเป็นต้องเชื่อตัวเลขเพียงอย่างเดียว
เมื่อตรวจสอบ repo ให้ดูประเด็นต่อไปนี้:
- PR แก้ปัญหาตาม issue ที่อ้างถึงจริงหรือไม่
- issue เป็นบั๊กหรือฟีเจอร์ที่มีความหมาย หรือเป็นงานเทียมเพื่อเพิ่มจำนวนงาน
- มี test ครอบคลุมพฤติกรรมใหม่หรือไม่
- มี regression หลัง merge หรือไม่
- โมเดลรับมือกับความผิดพลาดที่ตัวเองสร้างขึ้นอย่างไร
- commit มีขนาดและขอบเขตเหมาะสมหรือไม่
รูปแบบเหล่านี้สะท้อนความน่าเชื่อถือของเอเจนต์ระยะยาวได้มากกว่าคะแนน benchmark เพียงค่าเดียว
การจำลองงานวิจัย: โค้ดวิจัย ไม่ใช่โค้ดแอปพลิเคชัน
เดโมที่สองคือการจำลองงานวิจัย machine learning ตั้งแต่ต้น ตามตัวเลขของ Alibaba การรันนี้ใช้เวลาประมาณ 125 ชั่วโมง สร้างโค้ดราว 7,600 บรรทัด และรันการฝึก GPU ทั้งหมด 33 รอบ
ผลลัพธ์ที่ Alibaba รายงานคือ โมเดลจำลองผลการวิจัยได้ 6 รายการ และได้คะแนน AIME24 สูงกว่าผลที่รายงานในงานวิจัย 2.7 คะแนน
งานลักษณะนี้ยากกว่าเพียงสร้างแอปพลิเคชัน เพราะต้องจัดการกับ:
- environment ที่พังหรือ dependency ไม่ตรงกัน
- hyperparameter ที่ไม่ได้ระบุชัด
- รายละเอียดที่ซ่อนอยู่ในภาคผนวกหรือเชิงอรรถ
- บั๊กเงียบที่ทำให้ผลการฝึกผิด แต่จะรู้ตัวหลังผ่านไปหลายชั่วโมง
- ความแตกต่างระหว่างผลการทดลองที่ทำซ้ำได้กับผลที่เกิดจากความบังเอิญ
เดโมนี้สอดคล้องกับคะแนน PaperBench ของ Qwen 3.8-Max ซึ่งเป็น benchmark ที่โมเดลทำคะแนนได้เด่นที่สุด
การแข่งขัน Tianchi: 24 ชั่วโมงต่อสู้กับทีมมนุษย์
เดโมที่สามนำโมเดลเข้าสู่การแข่งขัน data science จริงบนแพลตฟอร์ม Tianchi ของ Alibaba ภายใต้เวลาจำกัด 24 ชั่วโมง
ในช่วงเวลาดังกล่าว โมเดลส่งผลงาน 45 ครั้ง ปรับปรุงแนวทางตามผลลัพธ์ของแต่ละ submission และทำคะแนนสุดท้ายได้ 0.853 ซึ่งสูงกว่า 458 จาก 526 ทีมมนุษย์
ข้อสรุปที่ตรงไปตรงมาคือ โมเดลไม่ได้ชนะการแข่งขัน แต่ทำผลงานเหนือกว่า 87% ของผู้เข้าร่วม ซึ่งยังถือว่าน่าสนใจ
เดโมนี้แสดงความสามารถอีกแบบหนึ่ง: การวนซ้ำอย่างรวดเร็วภายใต้กำหนดเวลา โดยใช้คะแนนจาก submission ก่อนหน้าเป็นข้อมูลสำหรับปรับปรุงครั้งถัดไป
อย่างไรก็ตาม Tianchi เป็นแพลตฟอร์มของ Alibaba เอง ดังนั้นแม้เดโมจะเกิดขึ้นจริง แต่ผู้ขายยังควบคุมสภาพแวดล้อมของการแข่งขัน
เกณฑ์มาตรฐานการเขียนโค้ดที่อยู่เบื้องหลังการสาธิต
Alibaba เผยแพร่ตาราง benchmark ฉบับเต็ม โดยแถวที่เกี่ยวข้องกับงานเขียนโค้ดมีดังนี้
| เกณฑ์มาตรฐาน | Qwen 3.8-Max | คู่แข่งที่ดีที่สุดตามตารางของ Alibaba |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
ประเด็นสำคัญมีดังนี้
Terminal Bench 2.1: 86.6
Qwen 3.8-Max ทำคะแนนเหนือ Claude Opus 4.8 และ Fable 5 ซึ่งทั้งคู่ได้ 84.6 ตามตารางของ Alibaba คะแนนนี้สอดคล้องกับเดโมoh-my-cliที่เน้นงานผ่าน terminalSWE-bench Pro: 67.7
นี่คือจุดที่โมเดลตามหลังคู่แข่งชัดเจน Fable 5 ได้ 80.0 ในตารางเดียวกัน หากงานของคุณคือแก้ bug ใน repository ขนาดใหญ่ Qwen 3.8-Max ยังไม่ใช่ผู้นำตามตัวเลขที่ Alibaba เผยแพร่เองPaperBench: 93.0
นี่คือ benchmark ที่เด่นที่สุดของโมเดล โดยชนะทุกโมเดลในชุดเปรียบเทียบ และสนับสนุนเดโมการจำลองงานวิจัยโดยตรง
อีกจุดที่ไม่ควรมองข้ามคือ Alibaba ระบุว่าการทดสอบด้านโค้ดส่วนใหญ่รันบนชุดทดสอบ Claude Code รวมถึงการทดสอบโมเดลคู่แข่ง และมีหมายเหตุว่าผลของ Fable 5 อาจเกี่ยวข้องกับ fallback
การเลือก harness ส่งผลต่อ benchmark ของเอเจนต์อย่างมาก ดังนั้นอย่าตีความคะแนนเป็นคำตัดสินสุดท้าย ควรใช้เป็นข้อมูลจุดหนึ่ง แล้วทดสอบกับ repository, test suite และ workflow ของคุณเอง
วิธีเขียนโค้ดกับ Qwen 3.8 วันนี้
Qwen 3.8-Max ให้บริการผ่าน Alibaba Cloud Model Studio และ Alibaba เผยแพร่การตั้งค่าอย่างเป็นทางการสำหรับเครื่องมือเขียนโค้ดหลายตัว
สิ่งที่ต้องมีสำหรับทุกทางเลือกคือ DashScope API key จาก home.qwencloud.com
ตามหน้าราคา Model Studio ราคาอยู่ที่:
- Input: 2 ดอลลาร์ต่อ 1 ล้านโทเค็น
- Output: 6 ดอลลาร์ต่อ 1 ล้านโทเค็น
- ใช้ราคาเดียวกันตลอด context window ขนาด 1 ล้านโทเค็น
Claude Code
Qwen 3.8-Max มี endpoint ที่เข้ากันได้กับ Anthropic API ดังนั้นคุณสามารถชี้ Claude Code ไปยัง Qwen ได้ด้วย environment variables เหล่านี้:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
จากนั้นเริ่ม Claude Code ตามปกติ
ตัวอย่าง workflow สำหรับทดสอบใน repository:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN="$DASHSCOPE_API_KEY"
export ANTHROPIC_MODEL=qwen3.8-max
claude
ก่อนให้โมเดลแก้โค้ด ให้กำหนดขอบเขตงานชัดเจน เช่น:
อ่าน CONTRIBUTING.md และ test suite ก่อน
แก้เฉพาะ issue #123
ห้ามแก้ไฟล์นอก src/auth และ tests/auth
รัน test ที่เกี่ยวข้องก่อนเสนอ patch
สรุปไฟล์ที่แก้และความเสี่ยงที่เหลือ
การกำหนดขอบเขตแบบนี้ช่วยลดการแก้ไขที่กระทบส่วนอื่นของ codebase โดยไม่จำเป็น
Codex
Codex ต้องเพิ่ม provider ลงในไฟล์กำหนดค่า ตัวอย่างจากเอกสารอย่างเป็นทางการ:
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
ตั้งค่า API key ก่อนเริ่มใช้งาน:
export DASHSCOPE_API_KEY=your-dashscope-api-key
การตั้งค่านี้ใช้ endpoint ที่เข้ากันได้กับ OpenAI API แทน Anthropic API แม้จะใช้โมเดลและ API key เดียวกัน
Qoder, Qwen Code และ OpenClaw
สำหรับเครื่องมืออื่น การตั้งค่าโดยสรุปมีดังนี้:
Qoder CLI
เลือกqwen3.8-maxเป็นโมเดลจากการตั้งค่าของเครื่องมือQwen Code
ตั้งค่าDASHSCOPE_API_KEYแล้วเลือกโมเดลqwen3.8-maxหากเคยใช้ Qwen Code กับ Qwen Coder รุ่นก่อนหน้า workflow หลักจะเหมือนเดิมOpenClaw
ตั้งค่า model ID เป็นqwen3.8-maxและกำหนดmaxTokensเป็น65536ซึ่งเป็นความยาว output สูงสุดของโมเดลตามเอกสาร
สำหรับการตั้งค่าล่าสุด ควรตรวจสอบจากโพสต์เปิดตัวของ Alibaba โดยตรงก่อนใช้งานจริง
กำหนด reasoning effort ให้เหมาะกับงาน
Qwen 3.8-Max รองรับ reasoning_effort 3 ระดับ:
-
xhigh— ค่าเริ่มต้น mediumlow
เลือกตามประเภทของงาน ไม่ใช่เปิด xhigh เสมอไป
| ประเภทงาน | ค่าที่เหมาะสม |
|---|---|
| แก้ไขหลายไฟล์ | xhigh |
| วิเคราะห์ root cause ของ bug | xhigh |
| refactor ที่มี dependency ซับซ้อน | xhigh |
| เปลี่ยนชื่อ symbol | low |
| อัปเดต docstring | low |
| แก้ formatting หรือ import | low |
| สร้าง utility เล็ก ๆ |
medium หรือ low
|
ตัวอย่างแนวทางสำหรับงานที่ต้องการความรอบคอบ:
ใช้ reasoning_effort=xhigh
1. สำรวจโครงสร้าง repository
2. อ่าน test ที่เกี่ยวข้องก่อนแก้โค้ด
3. อธิบาย root cause แบบสั้น
4. เสนอแผนแก้ไขก่อนแก้ไฟล์
5. แก้เฉพาะไฟล์ที่จำเป็น
6. รัน test และรายงานผล
7. ระบุสิ่งที่ยังไม่ได้ตรวจสอบ
โทเค็น reasoning ถูกคิดราคาเป็น output token ที่ 6 ดอลลาร์ต่อ 1 ล้านโทเค็น ดังนั้น session แบบเอเจนต์ที่ใช้ xhigh ต่อเนื่องอาจมีค่าใช้จ่ายสูงกว่าที่คาดไว้
หาก Qwen 3.8-Max ใหญ่เกินไปสำหรับงานของคุณ ยังมี Qwen3 Coder สำหรับงานเขียนโค้ดโดยเฉพาะ และ Qwen3 Coder Flash สำหรับงานที่ต้องการความเร็วและต้นทุนต่ำกว่า นอกจากนี้ยังสามารถดูว่า Kimi K3 จัดการงานเขียนโค้ดอย่างไร
การทดสอบสิ่งที่โมเดลสร้าง: ขั้นตอน Apidog
ช่องว่างสำคัญของเดโมเขียนโค้ดอัตโนมัติคือ โมเดลอาจสร้างโค้ดที่ compile ผ่านและ test ภายในผ่าน แต่ยังเรียก API ผิด endpoint ส่ง request body ไม่ถูกต้อง จัดการ 429 Too Many Requests ผิด หรือไม่รองรับ error response ที่เกิดขึ้นจริง
มี 2 แนวทางที่ควรใช้กับโค้ดจากเอเจนต์
1. ทดสอบ endpoint ที่โค้ดสร้างขึ้นเรียกใช้
เมื่อ Qwen 3.8-Max สร้าง backend service หรือ API client ให้นำ OpenAPI specification ที่เกี่ยวข้องเข้า Apidog แล้วทดสอบ endpoint โดยตรง
ควรครอบคลุมอย่างน้อย:
- authentication flow
- request body ที่ถูกต้องและไม่ถูกต้อง
- validation errors
401 Unauthorized403 Forbidden404 Not Found429 Too Many Requests500 Internal Server Error- edge cases ของ pagination, filter และ null values
ตัวอย่าง checklist ที่ส่งให้เอเจนต์ก่อนสร้าง API client:
สร้าง API client สำหรับ endpoint นี้โดยต้องรองรับ:
- timeout
- retry เฉพาะกรณี 429 และ 5xx
- ไม่ retry สำหรับ 4xx อื่น
- ตรวจสอบ response schema
- ส่ง error message ที่ debug ได้
- มี unit test สำหรับ success, 401, 429 และ 500
หากกำลังประเมิน API ของโมเดลก่อนใช้งานจริง คู่มือ Qwen 3.8 API ครอบคลุมการตั้งค่า endpoint แบบ OpenAI-compatible และ Anthropic-compatible รวมถึง streaming responses และ reasoning output
2. จำลอง API ก่อนให้เอเจนต์แตะระบบจริง
ยิ่ง session ของเอเจนต์ยาว ความเสี่ยงที่จะเรียก production API ผิดพลาดยิ่งสูงขึ้น
การให้เอเจนต์ทำงานต่อเนื่องหลายวันโดยเรียก production API โดยตรงอาจทำให้เกิดปัญหา เช่น:
- เกิน rate limit
- สร้างหรือแก้ไขข้อมูลจริงโดยไม่ตั้งใจ
- เพิ่มค่าใช้จ่าย API
- ส่ง request ซ้ำจาก retry ที่ผิดพลาด
- กระทบระบบ downstream
- ทำให้ข้อมูลทดสอบปะปนกับข้อมูลจริง
ใช้ mock server ใน Apidog เพื่อให้เอเจนต์ได้รับ response ที่สมจริงโดยไม่ต้องเชื่อมต่อระบบจริง
แนวทางที่ใช้งานได้จริง:
- นำเข้า OpenAPI spec เข้า Apidog
- สร้าง mock response สำหรับ success และ error cases
- ตั้งค่า environment สำหรับ agent เป็น mock base URL
- ให้ agent สร้างและทดสอบโค้ดกับ mock server
- ตรวจสอบ diff, test output และ request log โดยมนุษย์
- เปลี่ยนไปใช้ staging environment
- เปลี่ยนเป็น production URL หลังผ่านการตรวจสอบ
คุณสามารถดาวน์โหลด Apidogเพื่อเริ่มสร้าง mock API ได้อย่างรวดเร็ว
หลักการสำคัญคือ ยิ่งคุณให้โมเดลมีอิสระในการแก้โค้ดมากขึ้น API layer ยิ่งต้องทำหน้าที่เป็น control surface คุณอาจตรวจทุก commit แบบเรียลไทม์ไม่ได้ แต่ยังควบคุมได้ว่าโค้ดที่เอเจนต์สร้างได้รับอนุญาตให้สื่อสารกับระบบใดบ้าง
คำถามที่พบบ่อย
Qwen 3.8 ดีสำหรับการเขียนโค้ดหรือไม่?
ตามตัวเลขของ Alibaba โมเดลแข็งแกร่งในงาน coding agent และงานวิจัย:
- Terminal Bench 2.1: 86.6
- PaperBench: 93.0
แต่ทำคะแนนระดับกลางในงานแก้ bug ขนาด repository:
- SWE-bench Pro: 67.7
- Fable 5 ในตารางเดียวกัน: 80.0
ตัวเลขเหล่านี้ยังเป็นผลจากผู้ขายและไม่มีการยืนยันอิสระ ข้อสรุปที่ระมัดระวังคือ Qwen 3.8-Max ดูเหมาะกับงานอัตโนมัติระยะยาวและงานวิจัยมากกว่างานแก้ bug แบบคลาสสิกใน repository ขนาดใหญ่
ฉันสามารถใช้ Qwen 3.8 ใน Claude Code ได้หรือไม่?
ได้ ตั้งค่า:
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
จากนั้นเรียกใช้ Claude Code ตามปกติ Alibaba เผยแพร่การตั้งค่านี้อย่างเป็นทางการ และระบุว่าใช้ Claude Code harness กับ benchmark ด้านโค้ดส่วนใหญ่
การเขียนโค้ดกับ Qwen 3.8 มีค่าใช้จ่ายเท่าไหร่?
ราคาที่ระบุคือ:
- 2 ดอลลาร์ต่อ 1 ล้าน input tokens
- 6 ดอลลาร์ต่อ 1 ล้าน output tokens
reasoning tokens ถูกคิดเป็น output tokens และค่าเริ่มต้น xhigh อาจสร้าง reasoning output จำนวนมาก สำหรับ session แบบเอเจนต์ ควรกำหนด budget และติดตาม token usage แยกจากการดูราคา input/output เพียงอย่างเดียว
ดูการเปรียบเทียบเพิ่มเติมได้ที่ การวิเคราะห์เกณฑ์มาตรฐาน Qwen 3.8
การรัน oh-my-cli 16 วันเป็นอิสระจริงหรือ?
นั่นคือสิ่งที่ Alibaba อ้าง และ repo เปิดให้ตรวจสอบได้ที่ qwen-code-dev-bot/oh-my-cli
ณ วันที่ 30 กรกฎาคม 2026 Alibaba รายงานว่า repo มี 265 commits, 127 PRs และ 151 issues สิ่งที่ควรตรวจสอบต่อคือคุณภาพของโค้ด ความสมเหตุสมผลของ issue ความครอบคลุมของ test และการจัดการ regression ไม่ใช่ดูเพียงจำนวน commit หรือ PR



Top comments (0)