DEV Community

BeanBean
BeanBean

Posted on Originally published at nextfuture.io.vn

Chi phí LLM API: công thức ước tính và 4 chỗ token rò rỉ

Originally published on NextFuture

Hoá đơn LLM tháng đầu nhỏ nên không ai hỏi gì. Vài tháng sau, hoá đơn tăng nhanh hơn traffic và quản lý muốn một con số giải thích được. Bài này dựng lại con số đó: công thức, phần bỏ sót, bốn chỗ rò rỉ, ngưỡng self-host.

Công thức cơ bản, và phần nó bỏ sót

Giá tính theo token: input (prompt, system instructions, context attach) và output. Theo hướng dẫn ước tính chi phí trên Dev.to, cả hai niêm yết theo mỗi triệu token, và output thường đắt gấp ba đến năm lần input. Tác giả gọi đúng cái bẫy: "per token" che mất vài multiplier quyết định feature tốn $50 hay $5.000/tháng.

Ví dụ của họ — support-triage: 1.500 input token và 500 output token mỗi request, 100.000 request/tháng, model mid-tier $2/$10 mỗi triệu token. Input 150M token = $300, output 50M token = $500, tổng khoảng $800/tháng trước retry và margin.

Ba khoản estimate naive bỏ sót, theo cùng nguồn: retry do timeout hoặc rate limit, mỗi retry là một request có phí; tool-calling round trip — agent gọi ba tool trước khi trả lời là bốn request đầy đủ, mỗi lần resend conversation phình ra; và thinking token, bill như output và có thể dài gấp nhiều lần câu trả lời. Nhiều team vì vậy cộng thêm 20% đến 50%.

Bốn chỗ rò rỉ không đánh đổi chất lượng

Bài phân tích chi phí tiếng Hàn trên Dev.to nói thẳng: mở hoá đơn ra xem thì rò rỉ từ kiến trúc thường lớn hơn từ việc chọn model. Bốn chỗ đáng bịt trước trong danh sách của tác giả:

  • Gọi trùng request. User bấm hai lần hoặc client retry; log không báo gì vì request vẫn hợp lệ. Cách chặn: key = tên tool + hash input đã normalize, ghi kết quả và idempotency key trong cùng transaction, TTL một giờ.

  • Phần đầu prompt bị lệch. Prompt caching chỉ tái sử dụng đoạn trùng khớp chính xác từ đầu; nhét giờ hiện tại hay request ID vào system prompt là toàn bộ phần sau rơi khỏi cache. Cố định phần tĩnh lên trước.

  • Không kiểm soát độ dài output. Tác giả khuyên dùng format ("bảng", "trong 3 câu") thay vì trần token: trần làm câu đứt giữa, gây retry, thành ra trả tiền hai lần.

  • Bật reasoning depth cao cho mọi route. Classification hay chuyển đổi format chạy setting cao thì chất lượng gần như không khác, chi phí thì tăng.

Chỉ báo rẻ nhất: số cache-read token trong response — lặp lại mà vẫn là 0 là prompt prefix đang lệch. Nếu cache ăn, hướng dẫn ước tính provider đọc lại cache ở khoảng 10% giá input — ở ví dụ trên, cache 40% input kéo nửa input xuống khoảng $190, tiết kiệm $110 bằng một thay đổi config. Hai lever còn lại: model nhỏ cho call dễ (thường chênh 10x), và batch việc không gấp ở khoảng nửa giá.

Khi nào self-host mới rẻ hơn

Một TCO guide về Llama — do vendor hạ tầng private AI xuất bản, và chính họ ghi rõ con số chỉ là minh hoạ, không phải báo giá — đưa ra khung so sánh dùng được. Mô hình của họ: 1 tỷ token/tháng ở blended rate $5 mỗi triệu token là $5.000/tháng, tức $60.000/năm. Private deployment minh hoạ: $35.000 hardware khấu hao ba năm, $4.500 điện và cooling, $6.000 facilities, $18.000 nhân công vận hành — annualized khoảng $40.167.

Break-even nằm ở utilization, không ở giá hardware. Cùng TCO đó, phục vụ 12 tỷ token/năm ra khoảng $3,35 mỗi triệu token, thắng blended rate $5; phục vụ 2 tỷ token/năm thì đội lên trên $20 mỗi triệu token. Khoản guide cho là bị đánh giá thấp nhất: engineering time.

Thứ tự làm

Bài tiếng Hàn nói rõ thứ tự: làm các cải tiến miễn phí trước, rồi mới đến điều chỉnh đánh đổi chất lượng; làm ngược lại thì chỉ mất chất lượng mà chi phí không giảm. Tuần này: tách hoá đơn theo input/output, cắm cache-read token vào dashboard, và chỉ mở lại câu hỏi self-host khi volume đã ở thang tỷ token/năm.


This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.

Top comments (0)