Google đã phát hành Gemini 3.7 Flash vào ngày 13 tháng 8 năm 2026, ba tuần sau 3.6 Flash, và gọi đây là “mẫu mô hình chủ lực thông minh nhất của chúng tôi”. Với đội ngũ vận hành API, thông tin quan trọng nhất không phải điểm chuẩn mà là lịch giá: mức ưu đãi $0.75 cho 1 triệu token đầu vào và $3.75 cho 1 triệu token đầu ra chỉ có hiệu lực đến hết ngày 31 tháng 12 năm 2026. Từ ngày 1 tháng 1 năm 2027, cả hai mức giá tăng gấp đôi.
Điều này tác động trực tiếp đến mọi workload đang chạy. Một chatbot có chi phí khoảng $788/tháng ở mức ưu đãi sẽ lên khoảng $1.575/tháng vào tháng 1 mà không cần thay đổi code, lưu lượng truy cập hay prompt. Vì vậy, hãy lập ngân sách theo cả giá ưu đãi lẫn giá tiêu chuẩn ngay từ đầu.
Bài viết này hướng dẫn cách:
- Tính chi phí token cho các workload thực tế.
- Đo token thực tế từ phản hồi API.
- Thiết lập guardrail để tránh tăng chi phí ngoài ý muốn.
- Giảm chi phí trước khi mức giá tiêu chuẩn có hiệu lực.
Nếu chưa gọi API lần đầu, hãy xem hướng dẫn nhanh về API Gemini 3.7 Flash. Sau khi có request chạy được, bạn có thể dùng Apidog để kiểm tra usageMetadata trong từng response thay vì chỉ ước lượng trên giấy.
Tóm tắt
- Giá ưu đãi: $0.75 / 1M token đầu vào và $3.75 / 1M token đầu ra, đến hết ngày 31 tháng 12 năm 2026.
- Giá tiêu chuẩn từ ngày 1 tháng 1 năm 2027: $1.50 đầu vào và $7.50 đầu ra — chính xác gấp đôi.
- Giá giới thiệu bằng một nửa giá Gemini 3.6 Flash khi ra mắt.
- Mô hình hỗ trợ văn bản, hình ảnh, video, âm thanh và PDF; cửa sổ ngữ cảnh 1 triệu token, đầu ra tối đa 64k token.
- Chatbot 10.000 request/ngày có chi phí khoảng $26.25/ngày ở giá ưu đãi hoặc $52.50/ngày ở giá tiêu chuẩn.
- Các đòn bẩy tiết kiệm chính: giới hạn output, cache ngữ cảnh, batch job và route tác vụ đơn giản sang model nhỏ hơn.
Hai mức giá cần đưa vào ngân sách
Gemini 3.7 Flash sử dụng giá ưu đãi có thời hạn thay vì một mức giá cố định.
| Mức giá | Thời gian | Đầu vào (mỗi 1M token) | Đầu ra (mỗi 1M token) |
|---|---|---|---|
| Giới thiệu | 13/08/2026–31/12/2026 | $0.75 | $3.75 |
| Tiêu chuẩn | Từ 01/01/2027 | $1.50 | $7.50 |
Có hai điểm cần hành động ngay:
- Đừng chỉ forecast theo giá hiện tại. Nếu hệ thống còn chạy sau tháng 12 năm 2026, hãy nhân đôi phần chi phí Gemini 3.7 Flash trong forecast.
- Tập trung kiểm soát output. Token đầu ra đắt gấp 5 lần token đầu vào ở cả hai mức giá.
Công thức cơ bản:
Chi phí = (token đầu vào / 1.000.000 × giá đầu vào)
+ (token đầu ra / 1.000.000 × giá đầu ra)
Ví dụ với 2.000 input token và 300 output token cho một request:
Giá ưu đãi:
(2.000 / 1.000.000 × 0.75) + (300 / 1.000.000 × 3.75)
= $0.002625/request
Giá tiêu chuẩn:
(2.000 / 1.000.000 × 1.50) + (300 / 1.000.000 × 7.50)
= $0.00525/request
Giá trên áp dụng cho Gemini API được tính phí qua khóa AI Studio. Vertex AI có SKU và cơ chế thanh toán Google Cloud riêng. Trước khi chốt ngân sách, hãy kiểm tra trang giá Gemini API chính thức.
Nếu đang chuyển từ phiên bản cũ, hãy dùng hướng dẫn di chuyển từ Gemini 3.6 sang 3.7 Flash để lập kế hoạch regression test.
Cách tính chi phí cho workload thực tế
Thay vì bắt đầu từ giá mỗi triệu token, hãy bắt đầu từ workload của bạn:
Token đầu vào/ngày = request/ngày × input token/request
Token đầu ra/ngày = request/ngày × output token/request
Sau đó áp dụng công thức giá cho từng loại token.
Tác vụ 1: chatbot hỗ trợ khách hàng
Giả sử chatbot có:
- 10.000 request/ngày
- 2.000 input token/request
- system prompt
- lịch sử hội thoại ngắn
- message hiện tại của người dùng
- 300 output token/request
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 20M | $15.00 | $30.00 |
| Đầu ra | 3M | $11.25 | $22.50 |
| Tổng | 23M | $26.25 | $52.50 |
Tương đương:
- Khoảng $788/tháng theo giá ưu đãi.
- Khoảng $1.575/tháng theo giá tiêu chuẩn, với tháng 30 ngày.
Đây là nơi việc giới hạn output tạo tác động lớn. Nếu output trung bình tăng từ 300 lên 600 token mà input không đổi, phần chi phí output sẽ tăng gấp đôi.
Tác vụ 2: xử lý tài liệu PDF
Gemini 3.7 Flash hỗ trợ đọc PDF trực tiếp. Điểm chuẩn GDP.pdf tăng từ 22.0% lên 34.0% so với 3.6 Flash, nên trích xuất và tóm tắt tài liệu là một workload phù hợp để đánh giá.
Giả sử:
- 500 tài liệu/ngày
- 40.000 input token/tài liệu
- 1.000 output token/tài liệu cho bản tóm tắt có cấu trúc
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 20M | $15.00 | $30.00 |
| Đầu ra | 0.5M | $1.88 | $3.75 |
| Tổng | 20.5M | $16.88 | $33.75 |
Tương đương khoảng:
- $506/tháng ở giá ưu đãi.
- $1.013/tháng ở giá tiêu chuẩn.
Với workload này, input chiếm phần lớn chi phí. Ưu tiên tối ưu theo thứ tự:
- Không gửi lại tài liệu hoặc hướng dẫn tĩnh không cần thiết.
- Dùng cache cho phần ngữ cảnh lặp lại.
- Chạy batch cho tài liệu không yêu cầu phản hồi tức thì.
- Chỉ yêu cầu các trường dữ liệu thực sự cần trong output.
Tác vụ 3: vòng lặp tác nhân
Tác nhân thường làm tăng chi phí vì ngữ cảnh và số lần gọi model tăng ở mỗi bước.
Giả sử:
- 200 tác vụ/ngày
- 12 model call/tác vụ
- 8.000 input token/call
- 400 output token/call
| Mục | Token hàng ngày | Chi phí ưu đãi/ngày | Chi phí tiêu chuẩn/ngày |
|---|---|---|---|
| Đầu vào | 19.2M | $14.40 | $28.80 |
| Đầu ra | 0.96M | $3.60 | $7.20 |
| Tổng | 20.16M | $18.00 | $36.00 |
Tương đương:
- $540/tháng ở giá ưu đãi.
- $1.080/tháng ở giá tiêu chuẩn.
Điểm cần theo dõi không chỉ là token/call mà còn là:
Chi phí/tác vụ =
số bước × số call/bước × token/call × đơn giá token
Nếu một tác vụ tăng từ 12 lên 20 model call, chi phí tăng khoảng 67% ngay cả khi token mỗi call không thay đổi.
Giới hạn output 64k token cũng xác định chi phí xấu nhất cho một call:
- Khoảng $0.24 ở giá ưu đãi.
- Khoảng $0.48 ở giá tiêu chuẩn.
Vì vậy, luôn giới hạn số lần retry và số bước tối đa trong agent loop.
Thiết lập guardrail trong code
1. Luôn đặt maxOutputTokens
Không để endpoint sử dụng giới hạn output mặc định nếu tác vụ không cần câu trả lời dài.
Ví dụ request Gemini với output giới hạn 500 token:
{
"contents": [
{
"role": "user",
"parts": [
{
"text": "Tóm tắt nội dung ticket hỗ trợ này trong tối đa 5 gạch đầu dòng."
}
]
}
],
"generationConfig": {
"maxOutputTokens": 500,
"temperature": 0.2
}
}
Quy tắc thực tế theo endpoint:
| Endpoint |
maxOutputTokens gợi ý |
|---|---|
| Phân loại / route | 50–150 |
| Trích xuất JSON ngắn | 200–500 |
| Chat hỗ trợ | 300–500 |
| Tóm tắt tài liệu | 500–2.000 |
| Lập kế hoạch hoặc debug phức tạp | Đặt theo giới hạn nghiệp vụ cụ thể |
Token đầu ra đắt gấp 5 lần đầu vào, nên đây thường là thay đổi có ROI cao nhất.
2. Đọc usageMetadata sau mỗi request
Mỗi phản hồi Gemini có usageMetadata, bao gồm số token đã dùng. Ví dụ:
{
"usageMetadata": {
"promptTokenCount": 2048,
"candidatesTokenCount": 312,
"totalTokenCount": 2360
}
}
Bạn có thể dùng các trường này để tính chi phí thực tế:
const inputPricePerMillion = 0.75;
const outputPricePerMillion = 3.75;
function estimateCost(usageMetadata) {
const inputTokens = usageMetadata.promptTokenCount ?? 0;
const outputTokens = usageMetadata.candidatesTokenCount ?? 0;
return (
(inputTokens / 1_000_000) * inputPricePerMillion +
(outputTokens / 1_000_000) * outputPricePerMillion
);
}
Khi chuyển sang giá tiêu chuẩn, chỉ cần cập nhật:
const inputPricePerMillion = 1.50;
const outputPricePerMillion = 7.50;
3. Đặt ngưỡng token cho từng endpoint
Đừng chỉ log token. Hãy biến token thành điều kiện kiểm thử.
Ví dụ logic kiểm tra cho endpoint chat:
const maxPromptTokens = 2500;
const maxOutputTokens = 500;
if (usageMetadata.promptTokenCount > maxPromptTokens) {
throw new Error(
`Prompt vượt ngân sách: ${usageMetadata.promptTokenCount} tokens`
);
}
if (usageMetadata.candidatesTokenCount > maxOutputTokens) {
throw new Error(
`Output vượt ngân sách: ${usageMetadata.candidatesTokenCount} tokens`
);
}
Cách này phát hiện prompt regression trước khi thay đổi được deploy.
So sánh vị trí giá của 3.7 Flash
So sánh giá mỗi token giữa các nhà cung cấp nhanh chóng lỗi thời, nên hãy xem Gemini 3.7 Flash như một lựa chọn định vị trong kiến trúc thay vì dựa vào một bảng giá cố định.
Gemini 3.7 Flash nằm trong nhóm model chủ lực: rẻ hơn đáng kể so với các model tiên phong như Gemini Pro, model lớn hơn của Claude hoặc phân khúc cao cấp của OpenAI, trong khi điểm chuẩn như 65.3% trên DeepSWE v1.1 và 1588 WebDev Arena Elo cho thấy năng lực đã tiến gần các model cao cấp trước đó.
Đừng giả định giá API sẽ ổn định. Các nhà cung cấp có thể thay đổi mức giá theo thời gian. DeepSeek, chẳng hạn, đã tăng giá API của mình; hướng dẫn tăng giá và tối ưu chi phí DeepSeek mô tả tác động của việc này lên ngân sách token.
Với Gemini, thay đổi giá đã được công bố rõ ngày và mức tăng. Điều đó cho phép bạn chủ động làm ba việc:
- Đo usage hiện tại.
- Ước tính chi phí theo giá tháng 1 năm 2027.
- Xác định endpoint nào cần tối ưu hoặc chuyển model.
Năm cách giảm chi phí token
1. Giới hạn output cho từng endpoint
Đặt maxOutputTokens là giá trị nhỏ nhất đáp ứng yêu cầu sản phẩm.
Một câu trả lời hỗ trợ thường không cần 64k token. Nếu không giới hạn output, một response bất thường có thể tốn gấp nhiều lần request bình thường.
2. Cache ngữ cảnh tĩnh
Nếu request nào cũng gửi lại system prompt 3.000 token, tài liệu chính sách hoặc schema giống nhau, bạn đang trả lại chi phí input cho cùng dữ liệu hàng nghìn lần.
Dùng context caching cho phần lặp lại và giữ phần động trong request. Xem tài liệu Gemini API để kiểm tra cách cấu hình và giá cache hiện tại.
Với chatbot 2.000 input token/request, nếu 1.500 token là ngữ cảnh tĩnh có thể cache, phần input trả giá đầy đủ có thể giảm đáng kể.
3. Chạy batch cho workload không tương tác
Tài liệu PDF, enrichment dữ liệu và tạo báo cáo thường không cần response trong vài giây.
Hãy tách workload:
Interactive request -> gọi đồng bộ
Document pipeline -> đưa vào hàng đợi và xử lý batch
Nightly enrichment -> batch job
Batch đánh đổi độ trễ lấy chi phí thấp hơn, phù hợp với các job chạy nền.
4. Route theo độ phức tạp thay vì dùng một model cho mọi thứ
Không phải request nào cũng cần Gemini 3.7 Flash.
Một chiến lược route cơ bản:
Phân loại intent -> model nhỏ hơn
Trích xuất trường đơn giản -> model nhỏ hơn
Tóm tắt ngắn -> model nhỏ hơn hoặc Flash
Debug nhiều bước -> Gemini 3.7 Flash
Agent có tool calling -> Gemini 3.7 Flash
Giữ 3.7 Flash cho các tác vụ thực sự cần lập kế hoạch đa bước, gỡ lỗi hoặc chuỗi tool call.
5. Prototype trên tầng miễn phí
Dùng hạn mức miễn phí AI Studio để chốt prompt, schema output và giới hạn token trước khi đưa workload vào production.
Hướng dẫn truy cập API Gemini miễn phí trình bày phạm vi và giới hạn của gói miễn phí.
Theo dõi chi phí theo endpoint với Apidog
Ước lượng hữu ích cho planning, nhưng số liệu theo request mới giúp bạn kiểm soát chi phí khi prompt, schema và traffic thay đổi.
Trong Apidog, bạn có thể thiết lập workflow sau:
- Lưu request cho từng endpoint production:
- chat
- tóm tắt tài liệu
- agent step
- Đưa API key vào biến môi trường:
GEMINI_API_KEY
- Gửi payload gần với dữ liệu production.
- Trích xuất hai trường token từ response:
usageMetadata.promptTokenCount
usageMetadata.candidatesTokenCount
- Thêm assertion cho token budget của từng endpoint.
- Chạy lại test khi thay đổi prompt, tool schema hoặc response schema.
Ví dụ budget cho chatbot:
| Chỉ số | Ngưỡng |
|---|---|
| Input token/request | ≤ 2.500 |
| Output token/request | ≤ 500 |
| Tổng token/request | ≤ 3.000 |
Nếu một thay đổi prompt đẩy input từ 2.000 lên 2.500 token, bạn có thể phát hiện mức tăng chi phí 25% trước khi merge hoặc deploy.
Cách tiếp cận này giống kiểm thử regression cho latency, nhưng thay vì chỉ kiểm tra thời gian phản hồi, bạn kiểm tra thêm token consumption. Hướng dẫn kiểm thử API cho kỹ sư QA có thêm ví dụ về cách tổ chức các test suite API.
Câu hỏi thường gặp
Khi nào giá Gemini 3.7 Flash tăng gấp đôi?
Vào ngày 1 tháng 1 năm 2027.
Giá ưu đãi $0.75 cho 1 triệu token đầu vào và $3.75 cho 1 triệu token đầu ra kéo dài đến hết ngày 31 tháng 12 năm 2026. Sau đó giá chuyển thành $1.50 đầu vào và $7.50 đầu ra.
Gemini 3.7 Flash có rẻ hơn Gemini 3.6 Flash không?
Khi ra mắt, có. Giá giới thiệu của Gemini 3.7 Flash bằng một nửa giá ra mắt của 3.6 Flash, đồng thời điểm chuẩn DeepSWE v1.1 tăng từ 49.0% lên 65.3%.
Xem hướng dẫn nhanh về thông số và giá Gemini 3.7 Flash để đối chiếu thêm.
Giá ưu đãi có áp dụng cho Vertex AI không?
Các mức giá trong bài áp dụng cho Gemini API được tính phí qua khóa AI Studio. Vertex AI dùng hệ thống thanh toán Google Cloud với SKU và điều khoản riêng.
Nếu chạy production trên Vertex AI, hãy kiểm tra giá trong GCP Billing và trang giá chính thức thay vì giả định giá tương đương.
Những gì được tính vào token đầu vào?
Mọi dữ liệu gửi lên đều được tính thành input token, bao gồm:
- Văn bản
- Hình ảnh
- Video
- Âm thanh
- Trang PDF
Vì vậy, tài liệu dài và request đa phương thức có thể làm chi phí input tăng nhanh. Hãy đọc usageMetadata từ response để lấy số token thực tế.
Làm thế nào để ước tính token trước khi gửi request?
Dùng endpoint countTokens để đo payload trước khi sinh nội dung, hoặc gửi một nhóm request đại diện và đọc usageMetadata.
Đừng dựa hoàn toàn vào trực giác từ tokenizer của nhà cung cấp khác. Đo bằng payload thật của bạn.
Kế hoạch triển khai trước tháng 1 năm 2027
Gemini 3.7 Flash có mức giá ưu đãi hấp dẫn, nhưng bạn đã biết chính xác khi nào chi phí sẽ tăng. Thay vì chờ đến tháng 1, hãy triển khai theo checklist này:
- [ ] Ghi nhận
usageMetadatacho mọi endpoint Gemini. - [ ] Tính chi phí hiện tại theo giá ưu đãi.
- [ ] Tính lại cùng usage theo giá tiêu chuẩn.
- [ ] Đặt
maxOutputTokenscho từng endpoint. - [ ] Thêm assertion token vào regression test.
- [ ] Cache system prompt và tài liệu tĩnh.
- [ ] Tách workload batch khỏi request tương tác.
- [ ] Route tác vụ đơn giản sang model nhỏ hơn.
- [ ] Đặt budget alert theo endpoint, không chỉ theo tổng hóa đơn.
Dùng Apidog để quản lý request Gemini, environment, assertion token và kiểm thử chi phí trong cùng một workspace. Khi hóa đơn tháng 1 đến, đó nên là con số bạn đã dự báo — không phải con số bạn mới phát hiện.
Top comments (0)