โมเดลเดียวกัน แต่ token ต่าง 70 เท่า, ทำไม harness ถึงกำหนดต้นทุนของ coding agent
โดย Nokka (นก-กา), นักเขียนอิสระสายเทคโนโลยี ผู้เขียนบทความอธิบายเทคโนโลยีให้คนทั่วไปเข้าใจ 30+ บทความบน dev.to | 29 สิงหาคม 2026
บทความนี้เขียนโดย AI (deepseek-v4-pro via ollama-cloud) ผ่าน Hermes Agent ภายใต้การควบคุมและตรวจสอบคุณภาพโดยมนุษย์, Nokka (นก-กา), อ้างอิงจาก The New Stack
ก่อนอื่น, ทำความเข้าใจศัพท์
ก่อนเข้าเรื่อง ขอปูศัพท์ 3 คำที่คนอ่านบทความนี้ต้องรู้ก่อน:
- Harness (ฮาร์เนส): ซอฟต์แวร์ที่ "ขับ" AI agent ผ่านงาน, จัดการ prompt, tool, context (เช่น Aider, Claude Code, OpenClaw)
- Token: หน่วยย่อยของข้อความที่โมเดลประมวลผล, ยิ่งใช้ token เยอะ ยิ่งจ่ายแพง
- Startup Tax (ภาษีเริ่มต้น): token ที่ harness "แบก" ไปทุกครั้งก่อนเริ่มทำงานจริง, system prompt + tool description + environment setup
ถ้าให้อุปมา: ถ้าโมเดลคือ "เครื่องยนต์", harness คือ "ตัวถังรถ", เครื่องยนต์เดียวกัน แต่ตัวถังต่างกัน ทำให้ "กินน้ำมัน" ต่างกันถึง 70 เท่า
ข้อค้นพบช็อก: โมเดลเดียวกัน token ต่าง 70 เท่า
The New Stack รวบรวม 3 benchmark ที่ชี้ข้อค้นพบเดียวกัน 1:
รันโมเดลตัวเดียวกันผ่าน harness ต่างกัน, ปริมาณ token ที่ใช้ต่างกันถึง 70 เท่า
ตัวเลขที่ชวนตกใจ
| Harness | Token ต่อ task ที่แก้สำเร็จ |
|---|---|
| Aider (architect mode) | ~3,500 |
| OpenClaw | ~292,000 |
จุดสำคัญ: ตัวเลขนี้ "เสถียร", ลำดับแทบไม่เปลี่ยนแม้สลับโมเดล (DeepSeek V4 Flash → Nemotron 3 Ultra), แปลว่า "ความต่างมาจาก harness ไม่ใช่โมเดล"
ต้นตอ: "Startup Tax" (ภาษีเริ่มต้น)
ก่อนที่ prompt จะทำงานจริง harness ต้อง "แบก" ข้อมูลของตัวเองไปก่อน [1]:
ตัวเลขภาษีเริ่มต้น
| Harness | Token floor (ภาษีเริ่มต้น) |
|---|---|
| Aider (architect mode) | ~700 |
| OpenClaw | ~26,000 |
คณิตศาสตร์ที่เจ็บปวด: harness ที่มี floor 26,000 token × 15 รอบ = 390,000 input token ที่จ่ายไปกับ "scaffolding" อย่างเดียว (ยังไม่นับงานจริง)
ข้อสรุปจาก benchmark: "startup tax × จำนวนรอบ" ทำนาย token ต่อ task ได้แม่นยำถึง R-squared 0.99, แปลว่า "ภาษีเริ่มต้น" คือตัวแปรหลักที่กำหนดต้นทุน
ตัวแปรที่ 2: Cache (แคช)
อีกตัวแปรที่ "พลิกกระดาน" คือ cache hit rate [1]:
ตัวเลข cache hit rate
| Harness | Cache hit rate |
|---|---|
| Codex | ~70% |
| OMP | ~57% |
| Claude Code | ~1.5% |
ทำไมสำคัญ: input ที่ "แคชได้" ถูกกว่า "แคชไม่ได้" ถึง ~5-10 เท่า, Claude Code ใช้ token น้อย แต่ "แคชแทบไม่ได้" → บิลแพงกว่าที่ควร
บทเรียน: อย่าดูแค่ "token" ต้องดู "ต้นทุนต่อผลลัพธ์"
| ตัวชี้วัดที่ผิด | ตัวชี้วัดที่ถูก |
|---|---|
| token ต่อ task | ต้นทุนต่อผลลัพธ์ที่ verify แล้ว |
| pass rate อย่างเดียว | pass rate + ต้นทุน + cache tier |
ตัวอย่างจริง: Claude Code กับ DeepAgents ผ่านงานเท่ากัน แต่ Claude Code แพงกว่า 4 เท่า ต่อความสำเร็จ [3]
ข้อควรระวัง: มุมที่ต้องสมดุล
ก่อนสรุป ขอวางมุมให้ตรง:
| ข้อดี (ของ benchmark นี้) | ข้อควรระวัง |
|---|---|
| ชี้ว่า harness สำคัญเท่าโมเดล | June benchmark รันแค่ 1 ครั้ง/ชุด (ไม่มี variance) |
| เปิดประเด็น "startup tax" | agent run เป็น stochastic (ผลอาจแกว่ง) |
| สอนวิธีคิดต้นทุนที่ถูกต้อง | ต้องดู Artificial Analysis (326 tasks, 3 ครั้ง) ประกอบ |
สรุปมุมมองของผม
ผมมองว่านี่คือ "บทเรียนสำคัญ" สำหรับทุกคนที่ใช้ coding agent, เพราะมันทลายความเชื่อที่ว่า "เลือกโมเดลเก่งๆ ก็พอ"
ความจริงคือ: harness ที่ "แบกภาษีเริ่มต้น" หนัก (system prompt ยาว, tool description เยอะ) จะ "เผาเงิน" มากกว่า แม้ใช้โมเดลเดียวกัน
และมันสอดคล้องกับสิ่งที่ผมเขียนเรื่อง Harness Engineering มาตลอด: "harness" ไม่ได้มีเพียง "ตัวกลาง", มันคือ "ตัวกำหนดต้นทุน", และการเลือก harness ที่ "เบา" (floor ต่ำ) สำคัญพอๆ กับการเลือกโมเดล
จุดที่ผมอยากเน้นที่สุดคือ "silent truncation", benchmark พบว่า Kilo และ Opencode "ตัด" prompt ไป 83-89% แต่ยัง "รายงานว่าสำเร็จ", นี่คือ "อันตรายเงียบ" ที่ดูเหมือน "ประหยัด token" แต่จริงๆ คือ "ทำงานไม่ครบ"
คุณเคยเจอ coding agent ที่ "กิน token" เยอะผิดปกติไหมครับ? แล้วคุณเลือก harness จาก "ความเก่ง" หรือ "ต้นทุน" มากกว่ากัน? คอมเมนต์แลกเปลี่ยนกันได้ครับ
ถ้าชอบบทความแนว coding agent แบบนี้ ติดตาม Nokka ได้ที่ dev.to/sarantoon
แหล่งอ้างอิง
[1] The New Stack. "Aider, Claude Code, and OpenClaw ran an identical model. Token use varied 70-fold". 2026. https://thenewstack.io/agent-harness-token-costs/
[2] Eishan Lawrence. "Harness Efficiency Benchmark". 2026. https://www.eishanlawrence.com/blog/harness-efficiency-bench
[3] Composio. "Best Agent Harness: DeepSeek V4 Flash". 2026. https://composio.dev/content/best-agent-harness-deepseek-v4-flash
บทความนี้วิเคราะห์จาก The New Stack ข้อมูล ณ 29 สิงหาคม 2026 Nokka

Top comments (0)