Meta AIRA จากสนามซ้อมสู่เหรียญทอง Kaggle: ไล่ทีละตัวเลขว่าเกิดอะไรขึ้น
โดย Nokka (นก-กา) | 26 กันยายน 2026
บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka
บทที่ 2 จาก 5 ของชุด "AI Dojo: สนามซ้อมเอเจนต์"
บทที่แล้วเราเห็นภาพรวมว่า dojo ช่วยให้ agent พัฒนาได้จริง คราวนี้ลงลึกที่เคสใหญ่ที่สุดของวงการ นั่นคือชุดงานวิจัย AIRA ของทีม FAIR ที่ Meta ซึ่งเริ่มจากการย้าย agent เข้าสนามซ้อม แล้วจบที่เหรียญทองจากการแข่งขัน Kaggle จริงที่มีคนเข้าร่วมราวสี่พันทีม
อนึ่ง ถ้าคุณเจอศัพท์ agent gym ในงานวิจัยชิ้นอื่น ให้ถือว่าเป็นคำเรียกสนามซ้อมชนิดเดียวกันกับ dojo คนต่างวงการใช้ต่างคำแต่หมายถึงสิ่งเดียวกัน
บทนี้จะไล่ตัวเลขทีละตัว พร้อมบอกทุกครั้งว่าตัวเลขนั้นวัดบนชุดโจทย์ไหน เพราะงานวิจัยชุดเดียวกันนี้มีตัวเลขหลายชุดที่คนมักพูดคลาดเคลื่อนกัน [1][2]
เกณฑ์ตัดสินก่อน: MLE-bench วัดอะไรอย่างไร
MLE-bench เป็น benchmark ที่ทีมของ OpenAI สร้างไว้ตั้งแต่ปลายปี 2024 โดยเก็บโจทย์จากการแข่งขัน Kaggle จริง 75 รายการ [5] agent ได้โจทย์ ข้อมูล และงบเวลา แล้วเขียนโค้ดทดลองจนส่งผลลัพธ์ ซึ่งถูกตัดสินด้วยชุดทดสอบที่ Kaggle ใช้จริง เทียบกับเกณฑ์เหรียญที่มนุษย์ต้องทำเพื่อได้เหรียญในการแข่งขันนั้นๆ ตัวเลขที่ใช้กันคืออัตราได้เหรียญ (medal rate) คือสัดส่วนของโจทย์ที่ agent ทำได้ถึงเกณฑ์เหรียญทองแดงขึ้นไปอย่างน้อยหนึ่งเหรียญ
งาน AIRA ส่วนใหญ่รันบน MLE-bench lite ซึ่งเป็นชุดย่อย 22 โจทย์ที่ความยากต่ำ ไม่ใช่ชุดเต็ม 75 โจทย์ ตัวเลขทั้งหมดในบทนี้จะระบุชัดทุกครั้งว่ามาจากชุดไหน
ระดับที่ 1: เปลี่ยนแค่สนาม ได้มา 10.7 จุด
จุดเริ่มของเรื่องคือ AIDE ซึ่งเป็น agent ที่เคยเป็นสถิติสูงสุดของ MLE-bench ในตอนนั้น ตัวเลขที่ทีม AIRA รายงานไว้คือได้เหรียญ 35.2% ของโจทย์บนชุด lite ด้วยโมเดล o1-preview [1]
ทีม AIRA ย้าย AIDE เข้ารันใน AIRA-dojo ซึ่งเป็นสนามซ้อมที่พวกเขาสร้างขึ้นใหม่ โดยไม่แก้ตัว agent เองเลย ผลที่ได้คือ 45.9% บนชุด lite ด้วยโมเดลเดิม หรือบวกขึ้น 10.7 จุดจากตัวเลขเดิม งานวิจัยระบุว่าส่วนต่างนี้มาจากตัวสภาพแวดล้อมเท่านั้น [1]
สิ่งที่เปลี่ยนไม่ใช่ความเก่งของโมเดล แต่เป็นคุณภาพของสนามที่ให้ agent ทำงาน สนามใหม่ตั้งค่าระบบให้พร้อมกว่า จัดการ dependencies ให้เรียบร้อยกว่า และลดเวลาที่ agent เสียไปกับปัญหาข้างทาง ลองนึกภาพนักวิ่งคนเดิม สนามใหม่ลาดยางเรียบกว่า รองเท้าผูกแน่นกว่า จนเขาวิ่งได้ไวขึ้นโดยไม่ต้องฝึกเพิ่ม
ตรงนี้คือบทเรียนแรกสำหรับทีม agent ทุกขนาด อย่าเพิ่งซื้อโมเดลใหม่ ให้ดูก่อนว่าสภาพแวดล้อมที่ agent ทำงานอยู่นั้นกีดขวางมันตรงไหน
ระดับที่ 2: ปรับวิธีคิด และวิธีเลือกทางเดิน
ระดับถัดมาคือการแก้สองส่วนของ agent เอง ได้แก่ operators ซึ่งเป็นชุดคำสั่งคิดงาน และ search policy ซึ่งเป็นกลยุทธ์การเลือกว่าจะต่อจากผลงานชิ้นไหน
Operators คือคำสั่งคิดงานของ agent
AIDE เดิมมี operators หลักสี่ตัว ได้แก่ Draft (เขียน solution แรก), Debug (แก้โค้ดพัง), Improve (ปรับ solution ที่ใช้ได้ให้ดีขึ้น) และ Memory (สรุปบทเรียนจากที่ผ่านมา) ทีม AIRA ปรับ operators ใหม่ทั้งชุดด้วยสามแนวทาง [1]
- ปรับระดับความยากของคำใบ้ตามสถานการณ์ ให้โมเดลสร้างงานเล็กเมื่อยังมีทางเลือกน้อย และเพิ่มความซับซ้อนเมื่อกิ่งก้านของทางเลือกบานออกแล้ว
- จัดหน่วยความจำให้เหมาะกับงานแต่ละ operator เช่น ตอน Draft ให้ดูผลงานพี่น้องที่ออกมาพร้อมกันเพื่อไม่ซ้ำกัน แต่ตอน Debug ให้ดูประวัติบรรพบุรุษว่าเคยแก้อะไรไปแล้วบ้าง
- ให้พื้นที่คิดก่อนตอบ แล้วตัดความคิดนั้นออกจากผลลัพธ์สุดท้าย
ผลคือ 45.5% บนชุด lite ด้วย backbone DeepSeek-R1 เทียบกับ 39.8% ของ AIDE เดิมที่ใช้โมเดลเดียวกัน ชัดว่า operators มีส่วนแบกจริง
Search policy คือวิธีเลือกทางเดิน
ทีมทดลองสามกลยุทธ์ ได้แก่ Greedy (เดินหน้ากับตัวที่ดีที่สุดตอนนี้), MCTS หรือ Monte Carlo Tree Search (ไล่สำรวจต้นไม้ทางเลือกแบบถ่วงน้ำหนัก) และ Evolutionary (เลี้ยงกลุ่ม solution เหมือนผสมพันธุ์) ผลสรุปได้เป็นตาราง
| ค่าบน MLE-bench lite, backbone DeepSeek-R1 | AIDE เดิม | AIRA (operators ใหม่) |
|---|---|---|
| Greedy | 39.8% | 45.5% |
| MCTS | ไม่มีใน AIDE | 47.1% |
| Evolutionary | ไม่มีใน AIDE | 42.7% |
คู่ที่ดีที่สุดคือ AIRA กับ Greedy บนโมเดล o3 ได้ 47.7% ซึ่งเป็นสถิติใหม่ของชุดโจทย์นี้ในตอนนั้น [1] ผลที่น่าสนใจคือ MCTS กับ Evolutionary ไม่ได้ชนะ Greedy แบบขาดลอย แปลว่ากลยุทธ์ค้นหาที่ซับซ้อนช่วยได้จริง แต่ไม่ใช่เส้นทางลัดที่จะชดเชย operators ที่ออกแบบไม่ดี
งานฉบับปรับปรุงภายหลังยังพบว่า เมื่อเพิ่มเวลาคิดของโมเดลและแก้โครงสร้างพื้นฐานของสนาม คะแนนยืดขึ้นไปถึง 55.0% บนชุด lite ได้อีก โดยไม่ต้องเปลี่ยนสูตร agent เลย [1]
ข้ามาที่ AIRA2: ขยายสนามจากเครื่องเดียวเป็นหลายเครื่อง
ต้นปี 2026 ทีมเดียวกันปล่อย AIRA2 ซึ่งเปลี่ยนแนวทางใหญ่สองอย่าง [3]
อย่างแรกคือสถาปัตยกรรม จากเดิมรันบน GPU ตัวเดียว แบ่งเวลาเป็นช่วงสั้นๆ เปลี่ยนเป็นทำงานแบบกระจายบน GPU แปดตัว ให้ agent ย่อยทำงานขนานกันแบบไม่ต้องรอกัน อย่างที่สองคือชุดโจทย์ เพิ่ม MLE-bench-30 ซึ่งเป็นชุดคัดมา 30 โจทย์ที่ความยากกว้างคลุมทั้งระดับง่ายถึงยาก พร้อมเพิ่ม AIRS-Bench อีก 20 โจทย์สไตล์งานวิจัยเปิด และเปลี่ยนตัวชี้วัดหลักเป็น Percentile Rank ซึ่งบอกว่า agent ไปยืนอันดับที่เท่าไรของลีดเดอร์บอร์ดมนุษย์ในโจทย์นั้น
บน MLE-bench-30 ด้วยโมเดล Gemini 3.0 Pro Preview ในงบ 24 ชั่วโมง AIRA2 ได้ Percentile Rank เฉลี่ย 71.8 เมื่อปล่อยเวลา 72 ชั่วโมงยืดเป็น 76.0 และฉบับปรับปรุงที่ใช้สถาปัตยกรรมเดิมแต่สลับ backbone เป็น Gemini 3.1 Pro Preview ได้ 81.5 ใน 24 ชั่วโมง [3]
ผมชอบตาราง ablation ของงานนี้เป็นพิเศษ เพราะมันบอกว่าชิ้นส่วนไหนของระบบแบกน้ำหนักจริง เมื่อถอดชิ้นหนึ่งออกแล้ววัดผลใหม่บน MLE-bench-30 งบ 24 ชั่วโมง
| ตัวถอดออก | ผลกระทบต่อ Percentile Rank |
|---|---|
| ถอดระบบย่อย (subagents) | ตกจาก 71.8 เหลือ 68.6 |
| ถอดวงจรประเมินแบบตรึงชุดข้อมูลและซ่อนเฉลย (HCE) | ตกเหลือ 56.8 |
| ถอดกลไกวิวัฒนาการ (evolution) | ตกเหลือ 64.0 |
น่าสังเกตว่าการถอดระบบย่อยกระทบน้อยสุด แต่การถอด HCE กลับเจ็บสุด ชี้ว่าสิ่งสำคัญไม่ใช่จำนวนลูกน้องที่แตกตัวได้ แต่คือความน่าเชื่อถือของสัญญาณวัดผล ที่บอก agent ได้ว่าทางไหนมีแววจริง ต่างจากคะแนนที่ agent เห็นใน HCE ซึ่งเป็นเพียงตัวเลขจากชุดทดสอบที่ตรึงไว้ โดยไม่เปิดเฉลยให้แอบดู [3]
AIRA3: สังเวียนจริง กับสถาปัตยกรรมที่ไม่มีเจ้านายกลาง
จุดหมายของทั้งหมดคือ AIRA3 ซึ่ง Meta ประกาศผลเมื่อต้นเดือนกันยายน 2026 [4] ระบบถูกส่งเข้าแข่งขัน Kaggle จริงที่ NVIDIA จัด โจทย์คือสอนโมเดล Nemotron ขนาด 30 พันล้านพารามิเตอร์ให้ใช้เหตุผลได้ดีขึ้น ทุกทีมได้ข้อมูลเหมือนกันและถูกตัดสินจากชุดทดสอบที่ปิดไว้
ผลคืออันดับ 8 จากทีมราวสี่พัน ได้เหรียญทอง และจุดที่น่าสนใจคือ ชุดที่ชนะไม่ได้ใช้โมเดลของ Meta เลย แต่เป็นคู่ของ GPT 5.5 กับ Claude 4.8 [4] ระบบฝึกและสนามซ้อมเป็นของ Meta ส่วนสมองเป็นของคนอื่น
สถาปัตยกรรมที่ Meta เล่าผ่านโพสต์ประกาศมีจุดเด่นที่น่าสนใจสำหรับคนทำทีม agent แทนที่จะมีตัวควบคุมกลางสั่งงาน AIRA3 รัน agent หลายตัวคนละสภาพแวดล้อมที่แยกกัน แล้วคุยกันผ่านช่องแลกเปลี่ยนกลางที่เป็นเหมือนกระดานประกาศของสมมติฐานและผลการค้นพบ แนวคิดนี้ใกล้เคียงกับโครงทีมแบบกระจายที่มีทั้งผู้เล่นตัวจริงหลายคนและห้องประชุมกลางให้ทุกตัวเข้ามาแลกเปลี่ยนกัน มากกว่าโครงทีมที่มีหัวหน้าคนเดียวสั่งทุกอย่าง
สำหรับทีมเล็ก ประเด็นนี้แปลว่า การสร้างระบบวิจัยอัตโนมัติไม่จำเป็นต้องเริ่มจากตัวควบคุมมหาศาล การเริ่มจากสนามซ้อมที่ดีและช่องทางให้ agent แลกเปลี่ยนบทเรียนกันเองก็เดินไปได้ไกลแล้ว
สรุปบทที่ 2
ไล่ตัวเลขทั้งสามรุ่นแล้ว เห็นภาพเดียวกันซ้ำๆ ผลลัพธ์ของ agent ไม่ได้ขึ้นกับตัวโมเดลอย่างเดียว แต่ขึ้นกับสนามที่ให้มันซ้อม คำสั่งคิดงานที่ดี กลยุทธ์เลือกทางเดิน และโครงสร้างที่ปล่อยให้ agent หลายตัวช่วยกันคิด ตัวเลขที่จำกลับไปได้คือ 35.2 เป็น 45.9 เทียบกับของเดิมที่วัดกันบนชุดเดียวกัน และ 47.7 คือสถิติบนชุดย่อยด้วยโมเดล o3
บทต่อไปถอยออกมาหนึ่งก้าวเพื่อจัดหมวดหมู่ให้เห็นภาพรวมของวงการ dojo ที่เล่ามาสองบทนี้จัดอยู่สายที่ยังไม่แตะน้ำหนักโมเดลเลย ส่วนอีกสายที่ฝึกจนน้ำหนักโมเดลเปลี่ยนจริงๆ เป็นทางที่แพงกว่าและทีมเล็กเข้าถึงยากกว่า
References
[1] Edan Toledo, Karen Hambardzumyan, Martin Josifoski และคณะ. "AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench." arXiv:2507.02554, กรกฎาคม 2025 (ฉบับปรับปรุงพฤศจิกายน 2025). https://arxiv.org/abs/2507.02554
[2] AIRA-dojo repository. Facebook Research, 2025. https://github.com/facebookresearch/aira-dojo
[3] Karen Hambardzumyan, Nicolas Baldwin, Edan Toledo และคณะ. "AIRA2: Overcoming Bottlenecks in AI Research Agents." arXiv:2603.26499, มีนาคม 2026. https://arxiv.org/abs/2603.26499
[4] AI at Meta (@AIatMeta). โพสต์ประกาศผล AIRA₃ ในการแข่งขัน Kaggle ที่จัดโดย NVIDIA. โพสต์บน X, 5 กันยายน 2026. https://x.com/AIatMeta/status/2096271545589190927
[5] Chan Jun Shern, Neil Chowdhury, Oliver Jaffe และคณะ (OpenAI). "MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering." arXiv:2410.07095, ตุลาคม 2024. https://arxiv.org/abs/2410.07095

Top comments (0)