DEV Community

Nokka
Nokka

Posted on AI-assisted

สร้าง AI Dojo ในทีมเล็ก: สนามซ้อมขั้นต่ำที่เริ่มได้ในวันหยุด

สร้าง AI Dojo ในทีมเล็ก: สนามซ้อมขั้นต่ำที่เริ่มได้ในวันหยุด

โดย Nokka (นก-กา) | 26 กันยายน 2026

บทความนี้เขียนโดย AI (โมเดล glm-5.3 ของผู้ให้บริการ ollama-cloud) ผ่าน Hermes Agent จาก Nous Research ตรวจสอบและเรียบเรียงโดย Nokka

บทที่ 5 จาก 5 ของชุด "AI Dojo: สนามซ้อมเอเจนต์"

สี่บทที่ผ่านมาเราไล่จากแนวคิดไปถึงเคสจริง การจัดหมวด และกับดักที่ต้องระวัง บทสุดท้ายนี้ปล่อยทฤษฎี มาลงมือทำกันจริงๆ โจทย์คือทีมคนน้อย งบไม่มี GPU เป็นฟาร์ม แต่มีงานที่ซ้ำๆ พอให้สนามซ้อมที่สร้างครั้งเดียวคุ้มค่า

แนวทางที่จะเขียนต่อจากนี้เป็นสาย harness dojo ตามที่คุยกันในบทที่ 3 เพราะเป็นทางที่ทีมเล็กเข้าถึงได้จริง ไม่ต้องรอโครงสร้างพื้นฐานระดับห้องแล็บ ใครอยากไปทางสาย RL ก็มีสำเร็จรูปอย่าง MLE-Dojo รออยู่แล้ว [1] และถ้าคุณเจอศัพท์ agent gym ในงานวิจัย ให้ถือว่าเป็นคำเรียกสนามซ้อมชนิดเดียวกันกับ dojo คนต่างวงการใช้ต่างคำแต่หมายถึงสิ่งเดียวกัน

ภาพรวมบทที่ 5: สี่องค์ประกอบขั้นต่ำของ AI dojo สำหรับทีมเล็ก ชุดโจทย์ ตัวตรวจ บันทึกบทเรียน และวงรอบ

สนามขั้นต่ำมีสี่องค์ประกอบ

ก่อนลงรายละเอียด ขอวาดกรอบก่อนว่าสนามซ้อมที่เล็กที่สุดที่ยังเรียกว่า dojo ได้ต้องมีอะไรบ้าง จากที่ไล่ดูโปรเจกต์จริงทั้งฝั่งวิจัยและฝั่งชุมชน ผมสรุปเป็นสี่ชิ้น [1][2]

  • ชุดโจทย์ งานจริงของทีมที่หยิบมาเป็นตัวซ้อม ยิ่งใกล้งานประจำยิ่งดี เริ่มแค่ 5 ถึง 10 ข้อก็พอ
  • ตัวตรวจ วิธีตัดสินว่าโจทย์ผ่านหรือไม่ ต้องรันได้อัตโนมัติและไม่ยอมให้ agent เห็นคำตอบล่วงหน้า
  • บันทึกบทเรียน พื้นที่เก็บสิ่งที่เรียนรู้จากแต่ละรอบ อย่างน้อยที่สุดคือไฟล์ข้อความที่จดว่าอะไรพังเพราะอะไร
  • วงรอบ กติกาว่าจะซ้อมเมื่อไหร่ อ่านบทเรียนเมื่อไหร่ และเมื่อไหร่ถึงถือว่าจบรอบ

ทั้งสี่ชิ้นนี้ทำได้ด้วยไฟล์ข้อความล้วนๆ ไม่ต้องมีเซิร์ฟเวอร์ แต่ที่แพงที่สุดในระบบนี้คือเวลาคิดว่าจะวัดความสำเร็จอย่างไร ซึ่งเป็นงานคน ไม่ใช่งานเครื่อง

องค์ประกอบ ทำจริงยังไงในทีมเล็ก ต้นทุน
ชุดโจทย์ โฟลเดอร์เก็บโจทย์ 5-10 ข้อจากงานจริง เวลาคัดเลือกครั้งเดียว
ตัวตรวจ สคริปต์ตรวจชั้นกลไก + คนตัดสินชั้นรสนิยม งานเขียนสคริปต์ + เวลาตรวจ
บันทึกบทเรียน ไฟล์ข้อความที่ agent เขียนต่อเนื่อง เกือบศูนย์
วงรอบ ปฏิทินรายสัปดาห์ รอบละหนึ่งชั่วโมง วินัยของทีม

แต่ก่อนจะเริ่ม ควรรู้ข้อจำกัดของแนวนี้ไว้ด้วย เพื่อการตัดสินใจที่ตรึกตรองครับ ของแบบนี้ไม่ใช่คำตอบสำหรับทุกทีม ถ้างานของทีมเปลี่ยนโจทย์ทุกสัปดาห์จนสนามที่สร้างไว้ใช้ซ้ำได้ไม่กี่รอบ ต้นทุนเวลาสร้างสนามอาจไม่คุ้ม และถ้างานเสี่ยงสูงจนผิดพลาดแล้วกระทบหนัก สนามซ้อมอย่างเดียวไม่พอ ต้องมีคนตรวจทานขั้นสุดท้ายเสมอ ซึ่งไม่ใช่ความอ่อนแอของระบบ แต่เป็นการยอมรับว่าตัวตรวจอัตโนมัติมีข้อจำกัด

ตัวอย่างจริง: dojo สำหรับทีมเขียนบทความ

ให้เป็นรูปธรรม ผมจะยกตัวอย่างจากงานที่ผมคุ้นเคยที่สุด คือการเขียนบทความคุณภาพสำหรับเว็บไซต์ สมมติทีมมี agent ช่วยเขียนและอยากให้มันพัฒนาเรื่อยๆ

ชิ้นที่ 1: ชุดโจทย์

หยิบบทความที่ทีมเคยทำจริงมา 5 เรื่อง เก็บโจทย์ต้นฉบับกับข้อมูลที่ใช้ แต่อย่าเก็บผลงานที่เคยส่งแล้ว เพราะนั่นคือเฉลยที่จะทำให้ agent ท่องจำแทนการคิด

ชิ้นที่ 2: ตัวตรวจ

ตัวตรวจของงานเขียนวัดได้หลายชั้น ชั้นแรกเป็นกลไก เช่น บทความต้องมีแหล่งอ้างอิงที่เปิดได้จริง ไม่มีข้อความค้างจากเครื่องมือแปล และย่อหน้ายาวไม่เกินเกณฑ์ที่ทีมตั้งเอง (อย่างเช่น 200 ตัวอักษร) ทั้งสามข้อนี้เขียนเป็นสคริปต์ตรวจได้สบาย ชั้นที่สองเป็นรสนิยม เช่น น้ำเสียงเป็นธรรมชาติ ไม่ใช่สำนวนแปล ชั้นนี้ยังต้องใช้คนตัดสิน แต่ประหยัดเวลาได้ด้วยการจัดข้อสอบเทียบคู่ ให้ผู้ตรวจอ่านสองฉบับโดยไม่รู้ว่าฉบับไหนมาจากรอบไหน แล้วเลือกฉบับที่ดีกว่า

ชิ้นที่ 3: บันทึกบทเรียน

ทุกครั้งที่ตัวตรวจจับปัญหา ให้ agent เขียนบทเรียนเป็นกติกาใหม่ลงไฟล์ รูปแบบที่ใช้ได้ดีคือหนึ่งบทเรียนต่อหนึ่งประโยค เช่น อ้างอิงข่าวต้องใส่วันที่ของแหล่งที่มาเสมอ เพราะข่าวเก่าสองสัปดาห์อาจถูกอ้างว่าเป็นข่าวใหม่ กติกาพวกนี้คือสินทรัพย์ที่สะสมได้จริง และโปรเจกต์อย่าง copilot-agents-dojo ยกเรื่องนี้ขึ้นเป็นระบบเต็มตัวด้วยตัวจัดเก็บกติกาและตัวติดตามการใช้งาน [2]

ชิ้นที่ 4: วงรอบ

ผมแนะนำให้ตั้งจังหวะรายสัปดาห์ รอบละไม่เกินหนึ่งชั่วโมง ให้ agent ทำโจทย์ใหม่ทั้งหมดจากกติกาชุดล่าสุด แล้วเทียบกับรอบก่อน ถ้าคะแนนชั้นกลไกเท่าเดิมแต่ชั้นรสนิยมดีขึ้น ถือว่ากำลังไปถูกทาง ถ้าเท่าเดิมทั้งคู่หลายสัปดาห์ แปลว่าบทเรียนที่เขียนไม่จับปัญหาจริง ให้กลับไปอ่านบทเรียนเก่าแล้วตัดทิ้งเถอะ

เช็กลิสต์ก่อนปล่อย agent เข้าสนาม

จากกับดักทั้งหมดที่เล่าในบทที่ 4 ผมรวมเป็นคำถามเจ็ดข้อ ตอบครบแล้วค่อยเริ่มซ้อม [3]

  • ตัวตรวจวัดสิ่งที่เราต้องการจริงหรือเปล่า หรือวัดของที่วัดง่ายแทน
  • มีวิธีทำคะแนนเต็มโดยไม่ทำงานจริงไหม ลองคิดตามเป็น agent ขี้เกียจแต่ฉลาด
  • คำตอบหรือเฉลยรั่วออกไปถึง agent ตรงไหน
  • ตัวตรวจพร้อมให้คะแนนกับงานนอกชุดโจทย์หรือเปล่า หรือผูกกับชุดโจทย์เดิมจนใช้กับงานอื่นไม่ได้
  • มีชุดทดสอบที่แยกไว้ใช้ตรวจขั้นสุดท้ายไหม
  • บทเรียนที่เขียนลงไฟล์มีคนอ่านทวนไหม หรือเขียนแล้วทิ้ง
  • ถ้าพรุ่งนี้เปลี่ยนโมเดลใหม่ กติกาที่สะสมมายังใช้ได้อยู่ไหม

ข้อสุดท้ายสำคัญกว่าที่คิด เพราะโมเดลเปลี่ยนเกือบทุกเดือน กติกาที่เขียนดีๆ ไว้เป็นสินทรัพย์ข้ามโมเดลได้ แต่กติกาที่ผูกกับพฤติกรรมเฉพาะรุ่นจะตายพร้อมรุ่นนั้น

สรุปทั้งชุดห้าบท

ห้าบทของชุดนี้เล่าเรื่องเดียวกันตั้งแต่ต้นจนจบ สนามซ้อมเปลี่ยนวิธีพัฒนา agent จากการรอโมเดลรุ่นใหม่ ไปเป็นการสะสมบทเรียนของทีมเอง เคสของ Meta แสดงให้เห็นว่าเพียงย้ายสนามก็ได้ผลทันที บทเรียนจากสองสายคือทีมเล็กเริ่มจากสาย harness ได้เลยโดยไม่ต้องรอ GPU กับดักที่ต้องจำคือสนามที่วัดผิดสอนผิด และช่องว่างระหว่างเก่งในสนามกับเก่งจริงก็ไม่ได้อยู่บนกระดานคะแนน

จุดจบของทีมที่ทำจริงไม่ใช่กระดานคะแนนที่สูงขึ้น แต่คือวันที่คนในทีมจับงานใหม่แล้วพูดว่า อันนี้เคยเจอแล้ว บทเรียนข้อนั้นอยู่ในไฟล์นี้ เพราะนั่นแหละคือสนามซ้อมที่กลายเป็นความจำของทั้งทีม

References

[1] Rushi Qiang, Yuchen Zhuang, Yinghao Li และคณะ. "MLE-Dojo: Interactive Environments for Empowering LLM Agents in Machine Learning Engineering." arXiv:2505.07782, พฤษภาคม 2025. https://arxiv.org/abs/2505.07782

[2] copilot-agents-dojo repository. andreaswasita, 2026. https://github.com/andreaswasita/copilot-agents-dojo

[3] Edan Toledo, Karen Hambardzumyan, Martin Josifoski และคณะ. "AI Research Agents for Machine Learning: Search, Exploration, and Generalization in MLE-bench." arXiv:2507.02554, กรกฎาคม 2025 (ฉบับปรับปรุงพฤศจิกายน 2025). https://arxiv.org/abs/2507.02554

Top comments (0)