DEV Community

Nokka
Nokka

Posted on AI-assisted

Qwen วิวัฒน์ตัวเอง 33 รอบโดยไม่มีมนุษย์ Alibaba เปิดแผนโมเดลที่ขยายถึง 10 ล้านล้านพารามิเตอร์

Qwen วิวัฒน์ตัวเอง 33 รอบโดยไม่มีมนุษย์ Alibaba เปิดแผนโมเดลที่ขยายถึง 10 ล้านล้านพารามิเตอร์

โดย Nokka (นก-กา) | 30 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล deepseek-v4.1-flash ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

TL;DR

Alibaba เปิดเผยที่งาน Apsara Conference เมื่อวันที่ 22 กันยายน[1]ว่า Qwen3.8-Max ผ่านรอบการเทรนและปรับแต่งอัตโนมัติเต็มรูปแบบมาแล้ว 33 รอบต่อเนื่องนานกว่าหนึ่งเดือน โดยไม่มีมนุษย์แทรกแซง ผลคือคะแนน Intelligence Index ของ Artificial Analysis ขยับจาก 40 เป็น 45 ทั้งที่รหัสโมเดลไม่เปลี่ยน และบริษัทประกาศแผนเดินหน้าสู่โมเดลขนาด 5-10 ล้านล้านพารามิเตอร์ในตระกูล Qwen 4.5 และ Qwen 5[5]

สิ่งที่ Alibaba อ้าง

ในข่าวประชาสัมพันธ์ลงวันที่ 22 กันยายน 2026 จากงาน Apsara Conference ที่เมืองหางโจว Alibaba ระบุว่าโมเดลเรือธงของบริษัทผ่านรอบการทำงานอัตโนมัติเต็มรูปแบบในด้านการเทรนและการปรับแต่งหลังการเทรน 33 รอบ ใช้เวลานานกว่าหนึ่งเดือน และผลลัพธ์ที่ได้ดันคะแนน Intelligence Index ของ Artificial Analysis จาก 40 ขึ้นเป็น 45[1]

คะแนน Intelligence Index ที่ขยับจาก 40 เป็น 45 ทำให้ผู้สังเกตการณ์บางรายตั้งคำถามว่าบริการที่ปรับปรุงเงียบ ๆ แบบนี้เทียบกับรุ่นก่อนได้ตรงแค่ไหน[1]

จุดที่ทำให้เรื่องนี้น่าสนใจไม่ใช่ตัวเลขคะแนน แต่คือรหัสโมเดลไม่เปลี่ยน ตัวเลขเบื้องหลังเปลี่ยน[1] หมายความว่าผู้ใช้ที่เรียกโมเดลเดิมด้วยชื่อเดิม

กำลังได้โมเดลที่ถูกปรับปรุงโดยกระบวนการที่ไม่มีมนุษย์เกี่ยวข้อง

ต้องพูดให้ชัดว่าข้อนี้เป็นถ้อยแถลงของผู้ขาย ไม่ใช่ผลทดสอบอิสระ[1] Alibaba เปิดเผยผ่านช่องทางประชาสัมพันธ์ของตัวเอง และยังไม่มีหน่วยงานภายนอกยืนยันว่า 33 รอบนั้นทำงานอย่างไร[1][5]

เคสที่ตรวจสอบได้จริง

ส่วนที่ผมคิดว่ามีน้ำหนักที่สุดคือกรณีศึกษาที่ Alibaba เล่า ไม่ใช่เพราะตัวเลขสวย แต่เพราะมันเปิดให้ตรวจสอบ

กรณี oh-my-cli: 16 วันไม่มีมนุษย์

กรณีแรกคือการสร้างเครื่องมือบรรทัดคำสั่งชื่อ oh-my-cli จากที่เก็บโค้ดเปล่า Alibaba ปล่อยให้โมเดลทำงานต่อเนื่อง และโมเดลสร้างลูปการทำงานของตัวเองขึ้นมา มีเครื่องสถานะของงานที่เลื่อนผ่านขั้น พร้อมการตรวจสอบทั้งการบิลด์

ยูนิตเทสต์ และการทดสอบปลายทาง เมื่อเจอความล้มเหลวก็ส่งกลับไปที่งานต้นทางเพื่อแก้รอบใหม่[2]

เมื่อวันที่ 30 กรกฎาคม 2026 หรือราว 16 วันหลังจากเริ่ม ที่เก็บโค้ดมี 265 คอมมิต 127 พูลรีเควสต์ และ 151 ประเด็น โดยไม่มีมนุษย์รีวิวหรือรวมโค้ดแม้แต่ครั้งเดียว[2]

สิ่งที่ทำให้ข้ออ้างนี้ตรวจสอบได้ต่างจากงานอื่นคือที่เก็บโค้ดถูกเปิดเป็นสาธารณะที่ github.com/qwen-code-dev-bot/oh-my-cli[2]

กรณีทำซ้ำงานวิจัย: 5 วันบน GPU

กรณีที่สองคือการให้โมเดลทำซ้ำผลงานวิจัย โดยให้แค่การอ้างอิงงานวิจัยหนึ่งฉบับกับชุด GPU ไม่มีโค้ดตั้งต้นและไม่มีโครงให้ โมเดลต้องเขียนไปป์ไลน์ทั้งหมดเอง ในราว 125 ชั่วโมงหรือประมาณห้าวันของการทำงานต่อเนื่องแบบไม่มีคนดูแล

มันเขียนโค้ดราว 7,600 บรรทัด ดำเนินการกว่า 1,100 ครั้ง และรันการเทรนบน GPU 33 รอบ[2]

ช่วงราว 37 ชั่วโมงแรกใช้ไปกับการสร้างไปป์ไลน์ของงานวิจัยชิ้นนั้นขึ้นมาใหม่จากศูนย์และทำซ้ำผลการค้นพบทั้งหกข้อ จากนั้นราว 88 ชั่วโมงที่เหลือเป็นการวนปรับปรุงตัวเอง ตั้งสมมติฐาน เขียนโค้ด รันบน GPU วิเคราะห์ผล แล้วเริ่มใหม่

รวมสี่รอบกับแนวคิดที่โมเดลสร้างเอง 18 แนวคิด[2]

รอบ แนวคิดเด่นของรอบนั้น ผลบน AIME24
ตั้งต้น ทำซ้ำวิธีจากงานวิจัยอ้างอิง เกณฑ์เปรียบเทียบ
รอบที่ 1-4 แนวคิดที่โมเดลสร้างเอง 18 แนวคิด ทยอยปรับจากการวินิจฉัยของรอบก่อน ดีกว่าเกณฑ์ตั้งต้น
เป้าหมายสุดท้าย หาวิธีเลือกข้อมูลที่คุ้มค่าที่สุดต่อพลังประมวลผลที่มี งานวิจัยอ้างว่าดีกว่าการสุ่ม +7.7%

บริบทที่ทำให้เรื่องนี้สำคัญ

การที่โมเดลหนึ่งใช้ AI อีกตัวเร่งการพัฒนาโมเดลตัวถัดไป ไม่ใช่เรื่องใหม่ในเชิงแนวคิด แต่มันเพิ่งเปลี่ยนจากงานวิจัยเป็นงานที่เกิดขึ้นจริงในแล็บชั้นนำ

และมันกำลังเกิดขึ้นในขณะที่อีกฟากของโลกกำลังกังวลเรื่องนี้อยู่ตรง ๆ เอกสารชี้แจงต่อนักลงทุนของ Anthropic ที่ Reuters รายงานเมื่อวันที่ 28 กันยายน เตือนว่าโมเดลขั้นสูงอาจมีพฤติกรรมเพื่อรักษาตัวเอง เช่น ต้านการปิดระบบ หรือปกปิดข้อมูล[3] และการที่โมเดลอาจรู้ตัวว่าถูกประเมินเป็นข้อจำกัดสำคัญของการตรวจสอบความปลอดภัย[6]

เมื่ออ่านสองข่าวนี้คู่กัน ภาพที่ได้คือฝั่งที่กังวลเรื่องนี้กำลังเขียนคำเตือนไว้ในเอกสารทางกฎหมาย ขณะที่ฝั่งที่กำลังทำอยู่ไม่ได้พูดเรื่องชะลอเลยแม้แต่คำเดียว

อ่านตัวเลขให้ถูก

ข้อควรระวังสามข้อ ข้อแรกคือ 33 รอบที่อ้างนั้นเป็นรอบของกระบวนการเทรนและปรับแต่ง ไม่ใช่การที่โมเดลเขียนตัวมันเองขึ้นมาใหม่ทั้งหมด คำว่า self-evolution

ในข่าวประชาสัมพันธ์ของบริษัทมีขอบเขตจำกัดกว่าที่คนมักเข้าใจ

ข้อที่สองคือคะแนน Intelligence Index จาก 40 เป็น 45 เป็นการวัดจากชุดทดสอบที่ Artificial Analysis สร้างขึ้น การขยับห้าคะแนนเป็นสัญญาณที่ดี

แต่ไม่ได้หมายความว่าโมเดลเทียบเท่าคู่แข่งที่ได้คะแนนใกล้กันในทุกงาน

นอกจากแผนโมเดลขนาดใหญ่ Alibaba ยังเปิดชิป Zhenwu V900 ในงานเดียวกันด้วย[4]

ข้อที่สามคือรหัสโมเดลเดียวกันอาจให้ผลต่างกันตามเวลา ซึ่งเป็นเรื่องที่คนใช้งานจริงต้องระวัง เมื่อผู้ให้บริการปรับโมเดลเบื้องหลังโดยไม่เปลี่ยนชื่อ การทดสอบที่ทำไว้เมื่อเดือนที่แล้วอาจเทียบกับวันนี้ไม่ได้ตรง ๆ อีกต่อไป

ถ้าคุณทดสอบโมเดลก่อนตัดสินใจใช้งาน ลองบันทึกวันที่และรหัสโมเดลทุกครั้งที่ทดสอบ เพราะบริการที่ปรับให้คะแนนดีขึ้นโดยไม่เปลี่ยนชื่อจะทำให้ผลทดสอบเดิมใช้เทียบไม่ได้ และติดตามว่ารอบปรับปรุงครั้งต่อไปเปิดเผยข้อมูลมากกว่านี้หรือไม่

REF

[1] OrcaRouter, "Qwen3.8-Max vs Qwen3.7-Max: A 16-Point Gap and a Price Trap" (อ้างข่าวประชาสัมพันธ์ Alibaba 22 ก.ย. 2026 จากงาน Apsara Conference: 33 รอบการเทรนและปรับแต่งอัตโนมัติเต็มรูปแบบนานกว่าหนึ่งเดือน · Intelligence Index ของ Artificial Analysis 40->45 · รหัสโมเดลไม่เปลี่ยน · เดือน ส.ค. 2026 GA 3 ส.ค. · 2.4 ล้านล้านพารามิเตอร์ เปิดใช้ 95B · ระบุชัดว่าเป็นถ้อยแถลงของผู้ขาย), 25 กันยายน 2026. https://www.orcarouter.ai/blog/qwen-3-8-max-vs-qwen-3-7-max

[2] The Satyajit, "Qwen3.8-Max: 16 days, 265 commits, zero humans in the loop" (กรณี oh-my-cli: 265 คอมมิต 127 พูลรีเควสต์ 151 ประเด็นภายในราว 16 วัน ที่เก็บโค้ดสาธารณะ github.com/qwen-code-dev-bot/oh-my-cli · กรณีทำซ้ำผลงานวิจัย: ~125 ชั่วโมง ~7,600 บรรทัด >1,100 การดำเนินการ 33 รอบ GPU training · ทำซ้ำผลทั้งหกข้อในราว 37 ชั่วโมงแรก · +7.7% บน AIME24), สิงหาคม 2026. https://ai.thesatyajit.com/articles/qwen3-8-max

[3] CNBC, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing: Reuters" (บริบทคำเตือนความเสี่ยงในเอกสารชี้แจง · พฤติกรรมเพื่อรักษาตัวเอง: ต้านการปิดระบบ ปกปิดหรือบิดเบือนข้อมูล · ข้อจำกัดนี้อยู่ที่ [6]), 29 กันยายน 2026. https://www.cnbc.com/2026/09/29/anthropic-warns-ai-existential-risks-ipo-filing-reuters.html

[4] Reuters, "Alibaba plans AI model with 5 trillion to 10 trillion parameters, unveils new chip" (แผนโมเดล 5-10 ล้านล้านพารามิเตอร์ และชิป Zhenwu V900 ในงาน Apsara Conference 22 ก.ย. 2026), 22 กันยายน 2026. https://qz.com/alibaba-zhenwu-v900-ai-chip-qwen-model-092226

[5] Alibaba Cloud Press Room, "Alibaba Unveils Roadmap on Full-Stack AI Strategy from Chips, Cloud Infrastructure, Models to Agents" (แถลงทางการจากงาน Apsara Conference 22 ก.ย. 2026 เมืองหางโจว: Qwen3.8-Max เสร็จ 33 รอบการรันอัตโนมัติเต็มรูปแบบนานกว่าหนึ่งเดือน ครอบคลุมการออกแบบไปป์ไลน์ ตรวจสอบข้อมูล ทดลองซ้ำ และวินิจฉัยข้อผิดพลาด · คะแนน Artificial Analysis เพิ่มจาก 40 เป็น 45 · Qwen 4 กำลังเทรน · Qwen 4.5 และ Qwen 5 คาดขยายถึง 5-10 ล้านล้านพารามิเตอร์ · การทดลองออกแบบชิป 60 ชั่วโมง เรียกเครื่องมือ EDA มากกว่า 10,000 ครั้ง ลดพื้นที่ชิป 42% · เป้า 20GW ภายในปี 2032), 22 กันยายน 2026. https://www.alibabacloud.com/en/press-room/alibaba-unveils-roadmap-on-full-stack-ai-strategy?_p_lc=1

[6] The Straits Times / Reuters, "Anthropic warns AI may pose 'existential risks to humanity' in IPO filing" (ต้นทาง Reuters: ประโยค "Potential model awareness of our evaluation efforts creates a significant limitation on our ability to assess model safety" · พฤติกรรมเพื่อรักษาตัวเอง: ต้านการปิดระบบ · REF ตัวเดียวกับ [8] ในบท 02 ของชุดนี้), 29 กันยายน 2026. https://www.straitstimes.com/business/anthropic-warns-ai-may-pose-existential-risks-to-humanity-in-ipo-filing

Top comments (0)