DEV Community

Nokka
Nokka

Posted on AI-assisted

AI Dojo คืออะไร: ทำไมสนามซ้อมเปลี่ยน AI Agent จากสอบผ่านเป็นเก่งจริง

AI Dojo คืออะไร: ทำไมสนามซ้อมเปลี่ยน AI Agent จากสอบผ่านเป็นเก่งจริง

โดย Nokka (นก-กา) | 25 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

บทที่ 1 จาก 5 ของชุด "AI Dojo: สนามซ้อมเอเจนต์"

ทีม agent หลายทีมมีประสบการณ์แบบเดียวกัน เปิด benchmark รันโมเดลล่าสุด ได้คะแนนสวยงาม แล้วเอาไปใช้กับงานจริงวันรุ่งขึ้น กลับพังโดยไม่รู้ตัว เหมือนนักเรียนที่ทำข้อสอบเก่งแต่ไม่เคยลงสนามซ้อม เพราะ benchmark แบบเดิมวัดแค่ครั้งเดียวว่าทำได้หรือไม่ แต่ไม่เคยให้ agent ได้ฝึกจากความล้มเหลวของตัวเอง

ช่วงหลายเดือนที่ผ่านมา เทรนด์ใหม่กำลังตอบโจทย์นี้ตรงจุด เรียกกันว่า dojo (อ่านว่า โดโจ) ยืมคำจากภาษาญี่ปุ่น แปลว่าสนามฝึกวิชา ไม่ใช่สนามสอบ

กลางปีที่ผ่านมา ทีมวิจัยของ Meta แสดงให้เห็นว่าเพียงย้าย agent เข้า dojo เฉยๆ โดยไม่แก้อะไรเลย อัตราความสำเร็จก็ขยับขึ้นทันที แถมพร้อมตัวเลขรองรับที่จับต้องได้จริง [1][2]

บทความนี้เป็นบทแรกของชุด 5 ตอน เจาะว่า dojo ทำงานยังไง ทำไมมันได้ผล และทีมเล็กอย่างเราจะเอาไปใช้จริงได้ตรงไหน

ภาพรวมบทที่ 1: สนามสอบกับสนามซ้อม AI dojo ต่างกันอย่างไร พร้อมตัวเลขย้าย agent เข้า dojo แล้วอัตราได้เหรียญขยับจาก 35.2% เป็น 45.9%

สองสนามที่คนมักสับสน: สนามสอบ vs สนามซ้อม

แนวคิดเดิมของ benchmark คือสนามสอบ กติกาชัด โจทย์คงที่ เก็บคะแนนครั้งเดียว ใช้เทียบโมเดล A กับ B ได้เท่าไหร่ก็เทียบกันได้เท่านั้น ส่วน dojo คือสนามซ้อมที่ agent ได้ลอง ล้มเหลว อ่านคะแนน แล้วลองใหม่ในสภาพแวดล้อมเดิม

จุดต่างสำคัญอยู่ที่สองอย่าง

  • การวนซ้ำ (iteration) สนามสอบให้ทำข้อสอบครั้งเดียว สนามซ้อมให้ทำซ้ำได้เรื่อยๆ จนเก่ง
  • สัญญาณป้อนกลับ (feedback loop) สนามสอบบอกแค่ผ่านหรือไม่ผ่าน สนามซ้อมบอกว่าตกอยู่ตรงไหน เพื่อให้รอบถัดไปแก้ตรงนั้นได้
มุมเทียบ สนามสอบ (benchmark) สนามซ้อม (dojo)
จำนวนครั้งที่ทำได้ ครั้งเดียวจบ ทำซ้ำได้ไม่จำกัด
ข้อมูลที่ได้กลับมา ผ่าน/ไม่ผ่าน คะแนนรายจุด บอกว่าตกตรงไหน
ใช้ทำอะไร เทียบโมเดล A กับ B ฝึกให้ agent รุ่นถัดไปเก่งขึ้น
ต้นทุนเมื่อพลาด รู้ตอนเอาไปใช้งานจริง จบในสนามซ้อม ไม่กระทบงานจริง

หากเทียบกับโลกมนุษย์ สนามสอบเหมือนการทดสอบความแข็งแรงครั้งเดียวให้ผ่านเกณฑ์เข้าทีม ส่วนสนามซ้อมคือช่วงซ้อมที่นักกีฬาได้เห็นสถิติของตัวเองทุกสัปดาห์ แล้วปรับแผนฝึกตามนั้น คนที่มีแต่สนามสอบจะเก่งแค่วันสอบ คนที่มีสนามซ้อมเก่งขึ้นทุกสัปดาห์จริงๆ

คำว่า dojo ในวงการมีสองความหมาย

คำเดียวกันแต่คนอาจหมายถึงคนละอย่าง ควรแยกให้ชัดตั้งแต่ต้น

  • Dojo แบบปรับน้ำหนักโมเดล (RL dojo) ให้ reward จริงระหว่างฝึก แล้วอัปเดตน้ำหนักโมเดล หนักแน่นแต่แพง ต้องมี GPU เป็นฟาร์ม
  • Dojo แบบปรับวินัย (harness dojo) ฝึกผ่านสภาพแวดล้อมและกติกา แล้วเก็บบทเรียนเป็นชุดคำสั่งหรือ skills โดยไม่แตะน้ำหนักเลย ถูกกว่ามาก ทำได้บนเครื่องเดียว

บทที่ 3 จะเจาะความต่างนี้พร้อมตัวอย่างจริงทั้งสองสาย แต่ก่อนถึงตรงนั้น มาดูเคสเปิดตัวที่ทำให้คำนี้ดังก่อน

เคสเปิดตัวที่จับต้องได้: Meta AIRA

กลางปี 2025 ทีม FAIR ของ Meta ตีพิมพ์งานวิจัยชุด AI Research Agents พร้อมปล่อยโค้ดเป็น repository ชื่อ aira-dojo [1][2] โดยรันอยู่บน MLE-bench ซึ่งเป็น benchmark เก็บโจทย์จากการแข่งขัน Kaggle จริง 75 รายการ [5] แกนของงานเปลี่ยนความหมายของ benchmark จากสนามสอบเป็นสนามซ้อมในสามระดับ

ตัวเลขทั้งหมดในหัวข้อนี้วัดบน MLE-bench lite ชุดย่อย 22 โจทย์ที่งานนี้เลือกใช้ประเมิน ส่วน MLE-bench ฉบับเต็มมี 75 โจทย์ [1][5]

ระดับที่ 1: ย้ายสนามอย่างเดียว ก็ได้แล้ว

พวกเขาย้าย AIDE ซึ่งเป็น agent เดิมที่เคยรันในสภาพแวดล้อมเก่า เข้าไปรันใน AIRA-dojo เท่านั้น โดยไม่แก้ agent เลยแม้แต่บรรทัดเดียว ผลคืออัตราได้เหรียญบน Kaggle กระโดดจาก 35.2% เป็น 45.9% หรือบวก 10.7 จุด งานวิจัยระบุชัดว่าส่วนต่างนี้มาจากสภาพแวดล้อมเพียงอย่างเดียว [2]

ระดับที่ 2: ปรับวิธีคิดต่อ ได้อีก

พวกเขาปรับชุด operators (คำสั่งคิดของ agent เช่น Draft, Debug, Improve) ให้เหมาะกับสนาม คะแนนขยับต่อไปเป็น 45.5% และเมื่อจับคู่กับกลยุทธ์ค้นหาแบบ Greedy อัตราได้เหรียญขึ้นไปถึง 47.7% สถิติสูงสุดของงานชุดนี้ [1][2]

ระดับที่ 3: จากสนามซ้อม สู่สังเวียนจริง

ขั้นสำคัญที่สุดคือแทนที่จะแค่วัดผลบน benchmark พวกเขาใช้สนามซ้อมนี้เป็นชั้นฝึกของ agent รุ่นถัดไป จนกระทั่งเมื่อวันที่ 5 กันยายน 2026 Meta ประกาศว่า AIRA₃ รุ่นล่าสุดของระบบวิจัยอัตโนมัติ ลงแข่ง Kaggle จริง [3]

โจทย์คือการสอนโมเดล Nemotron ขนาด 30 พันล้านพารามิเตอร์ให้คิดดีขึ้น ทุกทีมได้ข้อมูลเท่ากันและถูกตัดสินจากชุดทดสอบที่ไม่มีใครเห็นล่วงหน้า ผลคือ AIRA₃ ได้อันดับ 8 จากประมาณ 4,000 ทีม พร้อมเหรียญทอง [3]

อ่านตัวเลขชุดนี้แล้วมีจุดหนึ่งที่ผมชอบที่สุด ทีมชนะเหรียญทองของ AIRA₃ ไม่ได้ใช้โมเดลของ Meta เองเลย แต่เป็น ensemble ของ GPT 5.5 กับ Claude 4.8 [3]

พูดอีกทางคือ ความเก่งไม่ได้อยู่ที่ตัวโมเดลที่คัดสรรมา แต่อยู่ที่ระบบฝึกและสนามซ้อมที่ห่อหุ้มโมเดลไว้ทั้งระบบ ซึ่งเป็นหัวใจของแนวคิด Harness Engineering ที่เราเคยคุยกันในชุดบทความก่อน

ทำไมระบบฝึกได้ผลกว่าที่ใครๆ คาด

ก่อน AIRA คนส่วนใหญ่คิดว่าปัจจัยชี้ขาดคือโมเดล ยิ่งเก่งยิ่งได้เปรียบ แต่งานวิจัยชุดนี้ชี้ว่าตัวชี้ขาดมีสามชั้น และชั้นสนามมีน้ำหนักไม่แพ้กัน

  • ชั้นที่ 1 โมเดลเป็นแค่ชิ้นส่วนเดียว อย่างที่เพิ่งเห็น โมเดลผู้อื่นที่ไม่ใช่ของบ้าน ก็เอาเหรียญทองกลับไปได้เมื่อมีระบบฝึกดีพอ
  • ชั้นที่ 2 ระบบรอบโมเดล (harness) คือคำสั่ง กติกา และสภาพแวดล้อมที่โมเดลทำงานอยู่ข้างใน ซึ่งมีผลทันทีทั้งที่ไม่แตะตัวโมเดล
  • ชั้นที่ 3 สนามซ้อม (dojo) ทำให้ทั้งสองชั้นแรกพัฒนาได้เรื่อยๆ เพราะมี feedback จริงให้วัด

แนวคิดนี้ไม่ใช่ของใหม่ในโลกจริง โค้ชมวยอีสานเก่งๆ สอนลูกศิษย์เก็บคะแนนทุกยกทุกไฟต์ ไม่ใช่ดูคลิปชนะแล้วจบ เพราะแพ้ ๆ สอนได้เยอะกว่าชนะทุกไฟต์เสมอ สนามซ้อมของ agent ก็เช่นกัน ค่าความล้มเหลวใน dojo ถูกกว่าความล้มเหลวในงานจริงเสมอ จึงคุ้มที่จะให้ล้มบ่อยๆ ตอนฝึก

แนวเดียวกันนี้เกิดขึ้นจริงในประวัติศาสตร์ AI เกมกระดานโบราณอย่างโกะให้บทเรียนตรงนี้มาเป็นชั้นๆ เดิมที AI วางหมากโกะทำได้ด้วยการเรียนรู้จากสถานการณ์เกมของมืออาชีพหลายแสนเกม แต่ความก้าวหน้าที่พลิกเกมคือ AlphaGo เอาไปต่อด้วยการเล่นกับตัวเอง ไม่ต้องรอคนสอน เพราะสนามมีกติกาที่ยุติธรรมและผลแพ้ชนะชัดเจน ทำให้มันฝึกตัวเองได้

ทีนี้คำถามคือแล้วสนามซ้อมที่ดีหน้าตาเป็นยังไง มีองค์ประกอบอะไรบ้าง คำตอบอยู่ในบทที่ 2 ที่จะเปิดฝา AIRA-dojo จริง ไล่ชั้นคำนวณของสนาม ตั้งแต่ isolation ของ environment ลงไปถึงวิธีคำนวณ reward ที่เป็นธรรม

สนามซ้อมไม่ใช่ของสวยหรู: มันคุ้มเงินจริง แต่มีข้อแลก

หลายทีมอาจคิดว่า dojo เป็นของเล่นของห้องแล็บใหญ่ ตัวเลขบอกว่าคุ้มตั้งแต่ระดับทีมเล็กแล้ว

  • ต้นทุนหลักของทีม agent คือค่า token ของการลองผิดลองถูก สนามซ้อมลดค่านี้ได้เพราะเปลี่ยนการเดาในงานจริง เป็นการซ้อมที่มีขอบเขต
  • สินทรัพย์เดิมไม่ต้องทิ้ง เมื่อ benchmark เดิมกลายเป็นสนามซ้อม โจทย์เก่า ข้อมูลเก่า ชุดวัดผลเก่า ยังใช้ต่อได้ในหน้าที่ใหม่
  • ได้แผนที่พัฒนาชัดเจน ทีมรู้ว่าสัปดาห์นี้เก่งขึ้นหรือแย่ลงจากสัปดาห์ก่อน และตกจุดไหน

แต่จะเล่าเฉพาะด้านสวยคือไม่ซื่อสัตย์ สนามซ้อมมีข้อแลกที่ต้องรู้ก่อนตัดสินใจลงทุน

  • ต้องจ่ายค่าสร้างสนามก่อน ทั้งเวลาออกแบบโจทย์ เตรียมข้อมูล และเขียนตัวตัดสิน ทีมเล็กอาจใช้เวลาหลายสัปดาห์กว่าจะได้สนามที่ใช้ได้จริง
  • สนามที่วัดผิดสอนผิด ถ้ากติกาใน dojo ต่างจากโลกจริง agent จะเก่งแบบเฉพาะสนาม ออกไปข้างนอกแล้วสู้ไม่ได้ งานวิจัยของ Meta เองก็พบว่า agent ของพวกเขา overfit กับสัญญาณทดสอบของตัวเองพอสมควร [1] เรื่องนี้สำคัญพอที่จะเก็บเป็นบทเต็มๆ ในบทที่ 4
  • ไม่ใช่คำตอบสุดท้ายของทุกทีม ทีมที่งานเปลี่ยนโจทย์ทุกสัปดาห์ อาจยังไม่คุ้มลงทุนสร้างสนามเอง จะเห็นวิธีเลือกในบทที่ 5

สรุปคือ dojo คุ้มเมื่องานของทีมซ้ำๆ พอให้สนามที่สร้างครั้งเดียวใช้ได้หลายรอบ ถ้างานเปลี่ยนเร็วจนสนามตามไม่ทัน ยังมีทางเลือกที่เบากว่า อย่างการยืมสนามสำเร็จรูปอย่าง MLE-Dojo ที่สร้างจาก Kaggle จริง 200 กว่ารายการ [4][6]

สรุปบทที่ 1

ช่วงหลายปีที่ผมดูแลและตรวจสอบระบบ agent มา เห็นความเก่งของโมเดลเป็นค่าที่ควบคุมไม่ได้ โมเดลรุ่นใหม่ออกเมื่อไหร่ เก่งขึ้นเมื่อนั้น แต่ความพร้อมของสนามเป็นค่าที่เราควบคุมได้เต็มที่ สนามซ้อมเปลี่ยนความเก่งจากของที่ต้องรอซื้อ ให้เป็นของที่ทีมสะสมเองได้ทุกสัปดาห์

สนามซ้อมไม่ได้ทำให้โมเดลเก่งขึ้นในพลิบเดียว แต่ทำให้ทีมรู้ว่าเก่งขึ้นหรือแย่ลงจากสัปดาห์ก่อนอย่างไร และเมื่อรู้ เราก็ปรับได้

บทหน้าเปิดดูข้างในของสนามจริงว่าต้องมีอะไรบ้าง แล้วพาไล่ตัวเลขจริงของ AIRA ทีละตัว ใครอ่านมาถึงตรงนี้แล้วอยากเจอตัวเลขมันส์ๆ ก่อนใคร ติดตามตอนต่อได้เลยครับ

References

[1] Edan Toledo, Karen Hambardzumyan, Martin Josifoski และคณะ. "AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench." arXiv:2507.02554, กรกฎาคม 2025 (ฉบับปรับปรุงพฤศจิกายน 2025). https://arxiv.org/abs/2507.02554

[2] AIRA-dojo repository. Facebook Research, 2025. https://github.com/facebookresearch/aira-dojo

[3] AI at Meta (@AIatMeta). โพสต์ประกาศผล AIRA₃ ในการแข่งขัน Kaggle ที่จัดโดย NVIDIA. โพสต์บน X, 5 กันยายน 2026. https://x.com/AIatMeta/status/2096271545589190927

[4] Rushi Qiang, Yuchen Zhuang, Yinghao Li และคณะ. "MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering." arXiv:2505.07782, พฤษภาคม 2025. https://arxiv.org/abs/2505.07782

[5] Chan Jun Shern, Neil Chowdhury, Oliver Jaffe และคณะ (OpenAI). "MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering." arXiv:2410.07095, ตุลาคม 2024. https://arxiv.org/abs/2410.07095

[6] MLE-Dojo project page. Georgia Institute of Technology และ Stanford University, 2025. https://mle-dojo.github.io/MLE-Dojo-page

Top comments (0)