Originally published on NextFuture
Bạn ước tính agent tốn chưa tới 2 cent mỗi task, chạy thử vài chục lần thấy khớp. Cuối tháng hóa đơn về gấp nhiều lần con số đó. Bài này chỉ ra tiền rò ở đâu trong vòng lặp agent, và đòn bẩy nào cắt được nhiều nhất.
Giá token không phải con số quyết định
Cách tính sai phổ biến: tra giá model, nhân số câu hỏi, thấy rẻ. Một phân tích đăng trên Dev.to ngày 25/9 mô tả kết quả là hóa đơn gấp 5-10 lần dự tính, vì theo tác giả "an agent isn't a chatbot you ask once — it's a loop that re-reads, retries, calls tools, and thinks in steps".
Bảng giá tác giả liệt kê (USD trên một triệu token, input/output, mốc tháng 9/2026):
ModelInputOutput
Haiku 4.5$1$5
Sonnet 5$2$10
Sonnet 4.6$3$15
Opus 5 / 4.8$5$25
Fable 5.1$10$50
Bốn chỗ rò tiền trong vòng lặp
Context gửi lại mỗi lượt. LLM là stateless, nên mỗi turn client gửi lại toàn bộ history. Tác giả tính: một task 8 bước không tốn 8 lần một call, mà gần với 1 + 2 + 3 + … + 8. Ví dụ trong bài: một coding agent kết thúc sau 12 turn, đến turn 12 context đã là 40.000 token.
Tool call là round trip. Kết quả tool được append vào context rồi gửi lại ở mọi turn sau đó. Một response JSON 10.000 token dump thẳng vào context sẽ bị tính tiền lặp lại tới hết task. Cắt output tool trước khi đưa vào context, không phải sau.
Retry và ngõ cụt. Bản demo đi một đường thẳng, production thì không: tác giả ước lượng task bạn dự toán 5 turn thường chạy 9 turn trong thực tế.
Fan-out nhân chi phí. Một planner spawn năm sub-agent không phải bằng 5x một call: mỗi sub-agent có context, loop, tool call và retry riêng.
Đòn bẩy: cache trước, route sau
Prompt caching đánh trúng khoản lớn nhất: theo bài viết, cached input read tốn khoảng 0,1x giá gốc, tức cắt chừng 90% phần context lặp lại. Batch processing rẻ hơn 50% cho công việc không cần real-time. Tác giả cho rằng chồng cache và batch có thể kéo effective spend xuống hơn 90% trên phần workload lặp lại — đây là tuyên bố của tác giả, không kèm benchmark độc lập.
Đòn bẩy thứ hai là route theo độ khó. Phân loại nhánh, trích xuất giá trị, kiểm tra "xong chưa" đều là việc model rẻ làm được; đẩy tất cả qua model mạnh nhất là trả giá Opus cho việc Haiku.
Ở quy mô công ty, harness mới là chỗ quyết định
Một paper arXiv nộp ngày 24/9 (Abbasi, Aqrawi, Kwartler) đặt cùng vấn đề ở tầng doanh nghiệp. Harness — sản phẩm chạy agent, ví dụ Claude Code hay Codex — theo mô tả của paper "decides which model answers, what the model reads, how the prompt cache is used and which subagents run", nên nó chọn luôn mức giá và khối lượng mua ở mức giá đó. Nhóm tác giả mô phỏng doanh nghiệp 10.000 seat với hành vi lấy từ dataset công khai: router của họ thu hồi 14-21% chi phí model, tương đương 3,3-5,0 triệu USD mỗi năm theo bảng giá niêm yết của Anthropic ngày 21/9/2026.
Chi tiết đáng chú ý cho ai tự viết router: họ chỉ chuyển model ở những điểm không buộc hội thoại đang chạy rebuild cache — lúc mở session, ở side lane, và khi launch subagent. Khi reprice khoảng 10.000 session thật từ dataset công khai, nhóm này báo cáo một crossover: trên session dài và nặng tool, model đắt nhất lại rẻ hơn tier kế tiếp.
Làm gì tuần này
Bật prompt caching trước mọi tối ưu khác, rồi đo tỉ lệ cached read thực tế.
Log token input/output theo từng turn chứ không chỉ theo task — chỗ rò nằm ở đường cong tăng của input.
Đặt hard cap số turn cho mỗi task.
Trim tool output xuống đúng các field cần dùng trước khi append vào context.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)