Originally published on NextFuture
Pipeline coding agent của bạn đang chạy ổn trên Gemini 3.7 Flash, hoá đơn token tháng vừa rồi vẫn nằm trong ngân sách. Google vừa phát hành 3.8 Flash và nói rằng model mới mạnh hơn ở cùng mức giá — nghe như một lần đổi model không mất gì.
Bài này bóc tách con số Google công bố, chỉ ra hai chỗ chi phí có thể tăng dù đơn giá không đổi, và đưa ra quy trình quyết định nên đổi hay ở lại.
Google công bố chính xác những gì
Theo bài blog của Google DeepMind ngày 02/09/2026, Gemini 3.8 Flash được giới thiệu là "our best reasoning & coding model yet, at the same speed and low cost of 3.7". Google cũng nói rõ đây là bản Flash thứ ba trong vòng sáu tuần, tiếp nối 3.7 Flash ra mắt ba tuần trước.
Về giá, Google giữ nguyên mức introductory của 3.7 Flash: $0.75 / 1M input token và $3.75 / 1M output token. Nhưng chú thích cuối bài mới là phần quan trọng cho việc lập ngân sách.
Mốc thời gianInput / 1M tokenOutput / 1M token
Đến 31/12/2026 (introductory)$0.75$3.75
Từ 01/01/2027$1.50$7.50
Google ghi: "Introductory price expires on December 31, 2026. Starting January 1, 2027, $1.50/1M input tokens and $7.50/1M output tokens will apply." Đơn giá của 3.8 Flash sẽ tăng gấp đôi ở cả hai chiều sau mốc đó. Google không nêu mức giá của 3.7 Flash sau 31/12/2026, nên đừng giả định model cũ giữ giá — hãy kiểm tra bảng giá tại thời điểm lập ngân sách.
Bẫy thứ nhất: cùng đơn giá không có nghĩa cùng hoá đơn
Đây là đoạn dev cần đọc kỹ nhất trong toàn bộ bài công bố. Google mô tả nguồn gốc phần cải thiện chất lượng bằng một câu rất thẳng: "3.8 Flash works harder. On complex tasks, it exhibits greater diligence — executing extra reasoning steps, and calling tools iteratively."
Và ngay sau đó là cảnh báo: "At times, the model might use more tokens to maximize performance, especially at higher effort levels."
Nói cách khác, đơn giá per-token giữ nguyên nhưng số token cho cùng một task có thể tăng. Đánh giá của chúng tôi: với agent workflow, phần tăng này cộng dồn theo số vòng lặp chứ không cộng tuyến tính theo số request, vì mỗi vòng lặp là một lần gọi model mới. Nếu bạn đổi model rồi chỉ nhìn đơn giá để kết luận "chi phí không đổi", bạn đang đo sai đại lượng.
Google cũng đưa ra van điều chỉnh: "developers can utilize lower effort levels to minimize token overhead or continue to rely on Gemini 3.7 Flash, which remains fully supported for efficiency-first workloads." Hai lựa chọn đó là phần thực tế nhất của bài công bố — hạ effort level, hoặc ở lại 3.7 Flash.
Bẫy thứ hai: benchmark Google đưa ra không phải benchmark của bạn
Các con số dưới đây đều là kết quả Google tự công bố, chưa có kiểm chứng độc lập tại thời điểm viết:
Trên DeepSWE v1.1 (Long-Horizon Software Engineering), Google nói 3.8 Flash "outperforms most larger frontier models in autonomously solving complex engineering problems end to end, only at a fraction of the cost".
Trên HLE-Verified, 3.8 Flash đạt 54.9%, theo Google là thể hiện năng lực reasoning nhiều bước across STEM, humanities và professional fields.
Google nói 3.8 Flash vượt 3.7 Flash và các frontier model khác ở Vals Finance Agent V2 và Harvey's Legal Agent Benchmark — hai benchmark thuộc domain tài chính và pháp lý.
Không benchmark nào trong danh sách này đo workload của bạn. DeepSWE và HLE-Verified là tín hiệu tốt cho long-horizon coding và reasoning nhiều bước, nhưng nếu pipeline của bạn chủ yếu là extract có schema, classify, hay tóm tắt tài liệu tiếng Việt, phần "works harder" chỉ làm tăng token mà không đổi kết quả.
Quy trình 4 bước để quyết định đổi model
Đây là khung phân tích của chúng tôi, không phải khuyến nghị từ Google:
Ghim baseline trước khi đổi. Ghi lại input token, output token và latency trung bình mỗi task trên 3.7 Flash trong ít nhất một tuần chạy thật. Không có baseline thì mọi so sánh sau đó là cảm tính.
Chạy song song trên một slice traffic. Route một phần nhỏ task qua 3.8 Flash (ví dụ minh hoạ: 5–10%), giữ nguyên prompt và tool set. Mục tiêu của bước này là đo token per task, chưa phải đo chất lượng.
So sánh chi phí trên mỗi task hoàn thành, không phải trên mỗi 1M token. Đại lượng cần chốt là chi phí để một task chạy xong và pass acceptance check. Nếu token per task tăng rõ rệt mà tỉ lệ pass không tăng, việc đổi model đang lỗ.
Thử hạ effort level trước khi bỏ 3.8 Flash. Google nói rõ lower effort level là cách giảm token overhead. Nếu ở effort thấp mà chất lượng vẫn hơn 3.7 Flash, đó là cấu hình đáng giữ.
Với team ở Việt Nam còn một biến số nữa: kiểm tra lại giá quy đổi VND theo hoá đơn thực tế sau khi đổi model, vì mức tăng token và mốc tăng giá 01/01/2027 sẽ cộng dồn vào cùng một kỳ thanh toán.
Khi nào nên ở lại 3.7 Flash
Google tự đặt 3.7 Flash vào nhóm "efficiency-first workloads" và khẳng định model này "remains fully supported". Đó là tín hiệu cho các trường hợp sau: pipeline có schema output cố định và đã đạt tỉ lệ pass ổn định; task một bước không cần tool loop; hoặc hệ thống có ràng buộc chi phí cứng theo request.
Ngược lại, nếu bạn đang chạy agent nhiều bước tự sửa lỗi, hoặc task engineering dài mà 3.7 Flash thường bỏ dở giữa đường, đó đúng là nhóm workload mà Google nhắm tới với 3.8 Flash.
Bản Cyber không dành cho dev thông thường
Cùng ngày Google phát hành biến thể thứ hai, Gemini 3.8 Flash Cyber, mô tả là "our most capable cybersecurity model with frontier-level performance in vulnerability detection and automated patching". Model này chỉ mở qua Fairwind Program — chương trình giới hạn cho government agencies, critical infrastructure operators và cybersecurity partner, theo bài blog thứ hai của Google cùng ngày.
Google cũng yêu cầu tổ chức tham gia giới hạn quyền dùng trong nội bộ team security, incident response hoặc penetration testing, kèm multi-factor authentication. Nếu bạn không nằm trong nhóm đó, đây không phải model bạn có thể gọi qua API — đừng đưa nó vào kế hoạch kỹ thuật.
Việc cần làm tuần này
Ghim baseline token của pipeline hiện tại — việc này phải làm trước khi thử 3.8 Flash, không phải sau. Đặt lịch review ngân sách trước 31/12/2026, vì đó là ngày mức giá introductory của 3.8 Flash hết hiệu lực. Và trước khi đổi model theo dòng tiêu đề "cùng giá, mạnh hơn", hãy đo lại token per task: đó là chỗ chi phí thực sự dịch chuyển.
This article was originally published on NextFuture. Follow us for more fullstack & AI engineering content.
Top comments (0)