DEV Community

Cover image for Qwen 3.8 สำหรับการเขียนโปรแกรม: การทำงานต่อเนื่องอัตโนมัติ 16 วัน และความเชื่อมโยงโค้ดกับ Claude
Thanawat Wongchai
Thanawat Wongchai

Posted on • Originally published at apidog.com

Qwen 3.8 สำหรับการเขียนโปรแกรม: การทำงานต่อเนื่องอัตโนมัติ 16 วัน และความเชื่อมโยงโค้ดกับ Claude

การเปิดตัวโมเดลส่วนใหญ่มักนำเสนอความสามารถด้านโค้ดด้วยรูปแบบเดิม: คะแนน HumanEval และตัวอย่างฟังก์ชันเล็ก ๆ เช่น binary search แต่ Alibaba เลือกนำเสนอ Qwen 3.8-Max ในอีกมุมหนึ่ง ข้ออ้างไม่ใช่แค่ว่า “เขียนฟังก์ชันได้ดี” แต่คือโมเดลสามารถดำเนินโครงการซอฟต์แวร์ต่อเนื่องหลายสัปดาห์ เปิด issue, รวม pull request และส่งมอบฟีเจอร์ได้โดยไม่ต้องมีมนุษย์เข้ามาควบคุมตลอดเวลา

ลองใช้ Apidog วันนี้

ข้ออ้างนี้ควรได้รับการตรวจสอบ บทความนี้สรุปการสาธิตการเขียนโค้ด 3 รายการที่ Alibaba เผยแพร่ พร้อมตัวเลข benchmark และขั้นตอนใช้งานจริงกับ qwen3.8-max ผ่าน Claude Code, Codex, Qoder, Qwen Code และ OpenClaw รวมถึงวิธีทดสอบ API ที่โค้ดซึ่งโมเดลสร้างขึ้นเรียกใช้งาน

หากต้องการภาพรวมของโมเดล โปรดอ่าน Qwen 3.8 คืออะไร: พารามิเตอร์รวม 2.4 ล้านล้าน, พารามิเตอร์ที่ใช้งาน 95 พันล้าน, context window 1 ล้านโทเค็น และน้ำหนักโมเดลแบบเปิดที่มีแผนเผยแพร่หลังเปิดตัว บทความนี้เน้นเรื่องการเขียนโค้ดโดยเฉพาะ และข้อมูลทั้งหมดสะท้อนสถานะ ณ วันที่ 3 สิงหาคม 2026

สิ่งที่ Alibaba อ้างจริง ๆ

ในโพสต์เปิดตัว Qwen 3.8 อย่างเป็นทางการ Alibaba วางตำแหน่ง Qwen 3.8-Max เป็นโมเดลที่ทำงานวิศวกรรมระยะยาวได้ ไม่ใช่เพียงตอบคำถามหรือสร้างโค้ดสั้น ๆ โดยอ้างว่าสามารถ:

  • วางแผนงาน
  • ทำงานต่อเนื่องหลายวัน
  • ตรวจจับและแก้ข้อผิดพลาดของตัวเอง
  • ส่งมอบผลลัพธ์ที่ตรวจสอบได้

Qwen 3.8-Max capabilities

มี 3 จุดที่ทำให้ข้ออ้างนี้น่าสนใจกว่าการตลาดวันเปิดตัวทั่วไป:

  1. ระยะเวลาการสาธิตยาวนาน

    การทำงานต่อเนื่อง 16 วันแตกต่างจาก benchmark แบบเอเจนต์ที่ใช้เวลา 20 นาทีมาก เพราะการกู้คืนจากข้อผิดพลาด การจัดการ context และการหลุดจากแผนเดิมมีความสำคัญมากขึ้น

  2. หนึ่งในเดโมตรวจสอบได้สาธารณะ

    คุณสามารถเปิด repo อ่าน commit ตรวจสอบ PR และประเมินคุณภาพโค้ดได้เอง

  3. ใช้ชุดทดสอบที่เกี่ยวข้องกับเครื่องมือจริง

    Alibaba ระบุว่า benchmark ด้านโค้ดส่วนใหญ่รันผ่านชุดทดสอบ Claude Code และเผยแพร่การตั้งค่าอย่างเป็นทางการให้ทำซ้ำได้

ข้อควรระวัง: ตัวเลขทั้งหมดในบทความนี้มาจากเอกสารเปิดตัวของ Alibaba และยังไม่มีการตรวจสอบอิสระ ณ ต้นเดือนสิงหาคม 2026 ดังนั้นให้มองเดโมเป็นหลักฐานประกอบ ไม่ใช่ข้อสรุปสุดท้าย

การสาธิตการเขียนโค้ดทั้งสาม

oh-my-cli: การพัฒนาอิสระ 16 วัน

เดโมหลักคือการให้ Qwen 3.8-Max สร้างเครื่องมือ command-line แล้วปล่อยให้ทำงานแบบไม่ต้องดูแลต่อเนื่อง จนถึงวันที่ 30 กรกฎาคม การรันดำเนินมา 16 วัน และสร้าง:

  • 265 commits
  • 127 pull requests
  • 151 issues

Alibaba อ้างว่า issue ทั้งหมดถูกสร้าง ดำเนินการ และปิดโดยโมเดลเอง

repo เปิดให้ตรวจสอบได้ที่ qwen-code-dev-bot/oh-my-cli ซึ่งเป็นส่วนที่มีประโยชน์ที่สุดของเดโมนี้ เพราะคุณไม่จำเป็นต้องเชื่อตัวเลขเพียงอย่างเดียว

เมื่อตรวจสอบ repo ให้ดูประเด็นต่อไปนี้:

  • PR แก้ปัญหาตาม issue ที่อ้างถึงจริงหรือไม่
  • issue เป็นบั๊กหรือฟีเจอร์ที่มีความหมาย หรือเป็นงานเทียมเพื่อเพิ่มจำนวนงาน
  • มี test ครอบคลุมพฤติกรรมใหม่หรือไม่
  • มี regression หลัง merge หรือไม่
  • โมเดลรับมือกับความผิดพลาดที่ตัวเองสร้างขึ้นอย่างไร
  • commit มีขนาดและขอบเขตเหมาะสมหรือไม่

รูปแบบเหล่านี้สะท้อนความน่าเชื่อถือของเอเจนต์ระยะยาวได้มากกว่าคะแนน benchmark เพียงค่าเดียว

การจำลองงานวิจัย: โค้ดวิจัย ไม่ใช่โค้ดแอปพลิเคชัน

เดโมที่สองคือการจำลองงานวิจัย machine learning ตั้งแต่ต้น ตามตัวเลขของ Alibaba การรันนี้ใช้เวลาประมาณ 125 ชั่วโมง สร้างโค้ดราว 7,600 บรรทัด และรันการฝึก GPU ทั้งหมด 33 รอบ

Research replication demo

ผลลัพธ์ที่ Alibaba รายงานคือ โมเดลจำลองผลการวิจัยได้ 6 รายการ และได้คะแนน AIME24 สูงกว่าผลที่รายงานในงานวิจัย 2.7 คะแนน

งานลักษณะนี้ยากกว่าเพียงสร้างแอปพลิเคชัน เพราะต้องจัดการกับ:

  • environment ที่พังหรือ dependency ไม่ตรงกัน
  • hyperparameter ที่ไม่ได้ระบุชัด
  • รายละเอียดที่ซ่อนอยู่ในภาคผนวกหรือเชิงอรรถ
  • บั๊กเงียบที่ทำให้ผลการฝึกผิด แต่จะรู้ตัวหลังผ่านไปหลายชั่วโมง
  • ความแตกต่างระหว่างผลการทดลองที่ทำซ้ำได้กับผลที่เกิดจากความบังเอิญ

เดโมนี้สอดคล้องกับคะแนน PaperBench ของ Qwen 3.8-Max ซึ่งเป็น benchmark ที่โมเดลทำคะแนนได้เด่นที่สุด

การแข่งขัน Tianchi: 24 ชั่วโมงต่อสู้กับทีมมนุษย์

เดโมที่สามนำโมเดลเข้าสู่การแข่งขัน data science จริงบนแพลตฟอร์ม Tianchi ของ Alibaba ภายใต้เวลาจำกัด 24 ชั่วโมง

ในช่วงเวลาดังกล่าว โมเดลส่งผลงาน 45 ครั้ง ปรับปรุงแนวทางตามผลลัพธ์ของแต่ละ submission และทำคะแนนสุดท้ายได้ 0.853 ซึ่งสูงกว่า 458 จาก 526 ทีมมนุษย์

Tianchi competition result

ข้อสรุปที่ตรงไปตรงมาคือ โมเดลไม่ได้ชนะการแข่งขัน แต่ทำผลงานเหนือกว่า 87% ของผู้เข้าร่วม ซึ่งยังถือว่าน่าสนใจ

เดโมนี้แสดงความสามารถอีกแบบหนึ่ง: การวนซ้ำอย่างรวดเร็วภายใต้กำหนดเวลา โดยใช้คะแนนจาก submission ก่อนหน้าเป็นข้อมูลสำหรับปรับปรุงครั้งถัดไป

อย่างไรก็ตาม Tianchi เป็นแพลตฟอร์มของ Alibaba เอง ดังนั้นแม้เดโมจะเกิดขึ้นจริง แต่ผู้ขายยังควบคุมสภาพแวดล้อมของการแข่งขัน

เกณฑ์มาตรฐานการเขียนโค้ดที่อยู่เบื้องหลังการสาธิต

Alibaba เผยแพร่ตาราง benchmark ฉบับเต็ม โดยแถวที่เกี่ยวข้องกับงานเขียนโค้ดมีดังนี้

เกณฑ์มาตรฐาน Qwen 3.8-Max คู่แข่งที่ดีที่สุดตามตารางของ Alibaba
Terminal Bench 2.1 86.6 88.8 (GPT-5.6 Sol)
SWE-bench Pro 67.7 80.0 (Fable 5)
PaperBench 93.0 90.5 (GPT-5.6 Sol)

ประเด็นสำคัญมีดังนี้

  • Terminal Bench 2.1: 86.6

    Qwen 3.8-Max ทำคะแนนเหนือ Claude Opus 4.8 และ Fable 5 ซึ่งทั้งคู่ได้ 84.6 ตามตารางของ Alibaba คะแนนนี้สอดคล้องกับเดโม oh-my-cli ที่เน้นงานผ่าน terminal

  • SWE-bench Pro: 67.7

    นี่คือจุดที่โมเดลตามหลังคู่แข่งชัดเจน Fable 5 ได้ 80.0 ในตารางเดียวกัน หากงานของคุณคือแก้ bug ใน repository ขนาดใหญ่ Qwen 3.8-Max ยังไม่ใช่ผู้นำตามตัวเลขที่ Alibaba เผยแพร่เอง

  • PaperBench: 93.0

    นี่คือ benchmark ที่เด่นที่สุดของโมเดล โดยชนะทุกโมเดลในชุดเปรียบเทียบ และสนับสนุนเดโมการจำลองงานวิจัยโดยตรง

อีกจุดที่ไม่ควรมองข้ามคือ Alibaba ระบุว่าการทดสอบด้านโค้ดส่วนใหญ่รันบนชุดทดสอบ Claude Code รวมถึงการทดสอบโมเดลคู่แข่ง และมีหมายเหตุว่าผลของ Fable 5 อาจเกี่ยวข้องกับ fallback

การเลือก harness ส่งผลต่อ benchmark ของเอเจนต์อย่างมาก ดังนั้นอย่าตีความคะแนนเป็นคำตัดสินสุดท้าย ควรใช้เป็นข้อมูลจุดหนึ่ง แล้วทดสอบกับ repository, test suite และ workflow ของคุณเอง

วิธีเขียนโค้ดกับ Qwen 3.8 วันนี้

Qwen 3.8-Max ให้บริการผ่าน Alibaba Cloud Model Studio และ Alibaba เผยแพร่การตั้งค่าอย่างเป็นทางการสำหรับเครื่องมือเขียนโค้ดหลายตัว

สิ่งที่ต้องมีสำหรับทุกทางเลือกคือ DashScope API key จาก home.qwencloud.com

ตามหน้าราคา Model Studio ราคาอยู่ที่:

  • Input: 2 ดอลลาร์ต่อ 1 ล้านโทเค็น
  • Output: 6 ดอลลาร์ต่อ 1 ล้านโทเค็น
  • ใช้ราคาเดียวกันตลอด context window ขนาด 1 ล้านโทเค็น

Claude Code

Qwen 3.8-Max มี endpoint ที่เข้ากันได้กับ Anthropic API ดังนั้นคุณสามารถชี้ Claude Code ไปยัง Qwen ได้ด้วย environment variables เหล่านี้:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

จากนั้นเริ่ม Claude Code ตามปกติ

ตัวอย่าง workflow สำหรับทดสอบใน repository:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN="$DASHSCOPE_API_KEY"
export ANTHROPIC_MODEL=qwen3.8-max

claude
Enter fullscreen mode Exit fullscreen mode

ก่อนให้โมเดลแก้โค้ด ให้กำหนดขอบเขตงานชัดเจน เช่น:

อ่าน CONTRIBUTING.md และ test suite ก่อน
แก้เฉพาะ issue #123
ห้ามแก้ไฟล์นอก src/auth และ tests/auth
รัน test ที่เกี่ยวข้องก่อนเสนอ patch
สรุปไฟล์ที่แก้และความเสี่ยงที่เหลือ
Enter fullscreen mode Exit fullscreen mode

การกำหนดขอบเขตแบบนี้ช่วยลดการแก้ไขที่กระทบส่วนอื่นของ codebase โดยไม่จำเป็น

Codex

Codex ต้องเพิ่ม provider ลงในไฟล์กำหนดค่า ตัวอย่างจากเอกสารอย่างเป็นทางการ:

model = "qwen3.8-max"
model_provider = "qwencloud"

[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
Enter fullscreen mode Exit fullscreen mode

ตั้งค่า API key ก่อนเริ่มใช้งาน:

export DASHSCOPE_API_KEY=your-dashscope-api-key
Enter fullscreen mode Exit fullscreen mode

การตั้งค่านี้ใช้ endpoint ที่เข้ากันได้กับ OpenAI API แทน Anthropic API แม้จะใช้โมเดลและ API key เดียวกัน

Qoder, Qwen Code และ OpenClaw

สำหรับเครื่องมืออื่น การตั้งค่าโดยสรุปมีดังนี้:

  • Qoder CLI

    เลือก qwen3.8-max เป็นโมเดลจากการตั้งค่าของเครื่องมือ

  • Qwen Code

    ตั้งค่า DASHSCOPE_API_KEY แล้วเลือกโมเดล qwen3.8-max หากเคยใช้ Qwen Code กับ Qwen Coder รุ่นก่อนหน้า workflow หลักจะเหมือนเดิม

  • OpenClaw

    ตั้งค่า model ID เป็น qwen3.8-max และกำหนด maxTokens เป็น 65536 ซึ่งเป็นความยาว output สูงสุดของโมเดลตามเอกสาร

สำหรับการตั้งค่าล่าสุด ควรตรวจสอบจากโพสต์เปิดตัวของ Alibaba โดยตรงก่อนใช้งานจริง

กำหนด reasoning effort ให้เหมาะกับงาน

Qwen 3.8-Max รองรับ reasoning_effort 3 ระดับ:

  • xhigh — ค่าเริ่มต้น
  • medium
  • low

เลือกตามประเภทของงาน ไม่ใช่เปิด xhigh เสมอไป

ประเภทงาน ค่าที่เหมาะสม
แก้ไขหลายไฟล์ xhigh
วิเคราะห์ root cause ของ bug xhigh
refactor ที่มี dependency ซับซ้อน xhigh
เปลี่ยนชื่อ symbol low
อัปเดต docstring low
แก้ formatting หรือ import low
สร้าง utility เล็ก ๆ medium หรือ low

ตัวอย่างแนวทางสำหรับงานที่ต้องการความรอบคอบ:

ใช้ reasoning_effort=xhigh

1. สำรวจโครงสร้าง repository
2. อ่าน test ที่เกี่ยวข้องก่อนแก้โค้ด
3. อธิบาย root cause แบบสั้น
4. เสนอแผนแก้ไขก่อนแก้ไฟล์
5. แก้เฉพาะไฟล์ที่จำเป็น
6. รัน test และรายงานผล
7. ระบุสิ่งที่ยังไม่ได้ตรวจสอบ
Enter fullscreen mode Exit fullscreen mode

โทเค็น reasoning ถูกคิดราคาเป็น output token ที่ 6 ดอลลาร์ต่อ 1 ล้านโทเค็น ดังนั้น session แบบเอเจนต์ที่ใช้ xhigh ต่อเนื่องอาจมีค่าใช้จ่ายสูงกว่าที่คาดไว้

หาก Qwen 3.8-Max ใหญ่เกินไปสำหรับงานของคุณ ยังมี Qwen3 Coder สำหรับงานเขียนโค้ดโดยเฉพาะ และ Qwen3 Coder Flash สำหรับงานที่ต้องการความเร็วและต้นทุนต่ำกว่า นอกจากนี้ยังสามารถดูว่า Kimi K3 จัดการงานเขียนโค้ดอย่างไร

การทดสอบสิ่งที่โมเดลสร้าง: ขั้นตอน Apidog

ช่องว่างสำคัญของเดโมเขียนโค้ดอัตโนมัติคือ โมเดลอาจสร้างโค้ดที่ compile ผ่านและ test ภายในผ่าน แต่ยังเรียก API ผิด endpoint ส่ง request body ไม่ถูกต้อง จัดการ 429 Too Many Requests ผิด หรือไม่รองรับ error response ที่เกิดขึ้นจริง

มี 2 แนวทางที่ควรใช้กับโค้ดจากเอเจนต์

1. ทดสอบ endpoint ที่โค้ดสร้างขึ้นเรียกใช้

เมื่อ Qwen 3.8-Max สร้าง backend service หรือ API client ให้นำ OpenAPI specification ที่เกี่ยวข้องเข้า Apidog แล้วทดสอบ endpoint โดยตรง

ควรครอบคลุมอย่างน้อย:

  • authentication flow
  • request body ที่ถูกต้องและไม่ถูกต้อง
  • validation errors
  • 401 Unauthorized
  • 403 Forbidden
  • 404 Not Found
  • 429 Too Many Requests
  • 500 Internal Server Error
  • edge cases ของ pagination, filter และ null values

ตัวอย่าง checklist ที่ส่งให้เอเจนต์ก่อนสร้าง API client:

สร้าง API client สำหรับ endpoint นี้โดยต้องรองรับ:

- timeout
- retry เฉพาะกรณี 429 และ 5xx
- ไม่ retry สำหรับ 4xx อื่น
- ตรวจสอบ response schema
- ส่ง error message ที่ debug ได้
- มี unit test สำหรับ success, 401, 429 และ 500
Enter fullscreen mode Exit fullscreen mode

หากกำลังประเมิน API ของโมเดลก่อนใช้งานจริง คู่มือ Qwen 3.8 API ครอบคลุมการตั้งค่า endpoint แบบ OpenAI-compatible และ Anthropic-compatible รวมถึง streaming responses และ reasoning output

2. จำลอง API ก่อนให้เอเจนต์แตะระบบจริง

ยิ่ง session ของเอเจนต์ยาว ความเสี่ยงที่จะเรียก production API ผิดพลาดยิ่งสูงขึ้น

การให้เอเจนต์ทำงานต่อเนื่องหลายวันโดยเรียก production API โดยตรงอาจทำให้เกิดปัญหา เช่น:

  • เกิน rate limit
  • สร้างหรือแก้ไขข้อมูลจริงโดยไม่ตั้งใจ
  • เพิ่มค่าใช้จ่าย API
  • ส่ง request ซ้ำจาก retry ที่ผิดพลาด
  • กระทบระบบ downstream
  • ทำให้ข้อมูลทดสอบปะปนกับข้อมูลจริง

ใช้ mock server ใน Apidog เพื่อให้เอเจนต์ได้รับ response ที่สมจริงโดยไม่ต้องเชื่อมต่อระบบจริง

แนวทางที่ใช้งานได้จริง:

  1. นำเข้า OpenAPI spec เข้า Apidog
  2. สร้าง mock response สำหรับ success และ error cases
  3. ตั้งค่า environment สำหรับ agent เป็น mock base URL
  4. ให้ agent สร้างและทดสอบโค้ดกับ mock server
  5. ตรวจสอบ diff, test output และ request log โดยมนุษย์
  6. เปลี่ยนไปใช้ staging environment
  7. เปลี่ยนเป็น production URL หลังผ่านการตรวจสอบ

คุณสามารถดาวน์โหลด Apidogเพื่อเริ่มสร้าง mock API ได้อย่างรวดเร็ว

หลักการสำคัญคือ ยิ่งคุณให้โมเดลมีอิสระในการแก้โค้ดมากขึ้น API layer ยิ่งต้องทำหน้าที่เป็น control surface คุณอาจตรวจทุก commit แบบเรียลไทม์ไม่ได้ แต่ยังควบคุมได้ว่าโค้ดที่เอเจนต์สร้างได้รับอนุญาตให้สื่อสารกับระบบใดบ้าง

คำถามที่พบบ่อย

Qwen 3.8 ดีสำหรับการเขียนโค้ดหรือไม่?

ตามตัวเลขของ Alibaba โมเดลแข็งแกร่งในงาน coding agent และงานวิจัย:

  • Terminal Bench 2.1: 86.6
  • PaperBench: 93.0

แต่ทำคะแนนระดับกลางในงานแก้ bug ขนาด repository:

  • SWE-bench Pro: 67.7
  • Fable 5 ในตารางเดียวกัน: 80.0

ตัวเลขเหล่านี้ยังเป็นผลจากผู้ขายและไม่มีการยืนยันอิสระ ข้อสรุปที่ระมัดระวังคือ Qwen 3.8-Max ดูเหมาะกับงานอัตโนมัติระยะยาวและงานวิจัยมากกว่างานแก้ bug แบบคลาสสิกใน repository ขนาดใหญ่

ฉันสามารถใช้ Qwen 3.8 ใน Claude Code ได้หรือไม่?

ได้ ตั้งค่า:

export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

จากนั้นเรียกใช้ Claude Code ตามปกติ Alibaba เผยแพร่การตั้งค่านี้อย่างเป็นทางการ และระบุว่าใช้ Claude Code harness กับ benchmark ด้านโค้ดส่วนใหญ่

การเขียนโค้ดกับ Qwen 3.8 มีค่าใช้จ่ายเท่าไหร่?

ราคาที่ระบุคือ:

  • 2 ดอลลาร์ต่อ 1 ล้าน input tokens
  • 6 ดอลลาร์ต่อ 1 ล้าน output tokens

reasoning tokens ถูกคิดเป็น output tokens และค่าเริ่มต้น xhigh อาจสร้าง reasoning output จำนวนมาก สำหรับ session แบบเอเจนต์ ควรกำหนด budget และติดตาม token usage แยกจากการดูราคา input/output เพียงอย่างเดียว

ดูการเปรียบเทียบเพิ่มเติมได้ที่ การวิเคราะห์เกณฑ์มาตรฐาน Qwen 3.8

การรัน oh-my-cli 16 วันเป็นอิสระจริงหรือ?

นั่นคือสิ่งที่ Alibaba อ้าง และ repo เปิดให้ตรวจสอบได้ที่ qwen-code-dev-bot/oh-my-cli

ณ วันที่ 30 กรกฎาคม 2026 Alibaba รายงานว่า repo มี 265 commits, 127 PRs และ 151 issues สิ่งที่ควรตรวจสอบต่อคือคุณภาพของโค้ด ความสมเหตุสมผลของ issue ความครอบคลุมของ test และการจัดการ regression ไม่ใช่ดูเพียงจำนวน commit หรือ PR

Top comments (0)