Gemini 3.7 Flash là mô hình AI chủ lực mới nhất của Google, phát hành ngày 13 tháng 8 năm 2026, ba tuần sau Gemini 3.6 Flash. Mô hình giữ cửa sổ ngữ cảnh 1 triệu token, hỗ trợ đầu vào đa phương thức và ra mắt với giá API giới thiệu 0,75 USD cho mỗi 1 triệu token đầu vào. Google gọi đây là “mô hình AI chủ lực thông minh nhất của chúng tôi.”
Khoảng cách ba tuần giữa 3.6 và 3.7 Flash cho thấy Google đang cập nhật tầng Flash rất nhanh, trong khi Gemini 3.5 Pro vẫn bị trì hoãn. Các cải tiến tập trung vào mã hóa và tác nhân: DeepSWE tăng 16 điểm, AutomationBench gần gấp đôi, đồng thời giá giới thiệu giảm một nửa so với giá ra mắt của 3.6 Flash.
Bài viết này tập trung vào các bước cần làm để đánh giá và tích hợp Gemini 3.7 Flash: so sánh điểm chuẩn, kiểm soát chi phí, gọi API bằng cURL và kiểm tra hồi quy trước khi chuyển đổi mô hình. Để đi sâu vào endpoint, xem hướng dẫn bắt đầu nhanh API Gemini 3.7 Flash. Bạn cũng có thể dùng Apidog để chạy cùng một bộ prompt trên nhiều model và lưu kết quả kiểm thử.
TL;DR
- Gemini 3.7 Flash ra mắt ngày 13 tháng 8 năm 2026. ID mô hình:
gemini-3.7-flash. - Điểm chuẩn mã hóa và tác nhân tăng đáng kể: DeepSWE v1.1 từ 49,0% lên 65,3%; AutomationBench từ 17,0% lên 30,4%; WebDev Arena từ 1538 lên 1588 Elo.
- Giá API giới thiệu: 0,75 USD / 1 triệu token đầu vào và 3,75 USD / 1 triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026.
- Từ ngày 1 tháng 1 năm 2027, giá tiêu chuẩn là 1,50 USD đầu vào và 7,50 USD đầu ra trên 1 triệu token.
- Thông số không đổi: ngữ cảnh đầu vào 1 triệu token, đầu ra tối đa 64 nghìn token, hỗ trợ văn bản, hình ảnh, video, âm thanh, PDF, gọi hàm, tìm kiếm và sử dụng máy tính.
- Có thể truy cập qua Gemini API, AI Studio, ứng dụng Gemini, Gemini Spark, Google Antigravity, Android Studio và Gemini Enterprise.
Gemini 3.7 Flash là gì?
Flash là tầng trung của dòng Gemini: nhanh và rẻ hơn Pro, nhưng mạnh hơn Flash-Lite. Gemini 3.7 Flash được Google định vị chủ yếu cho tác vụ mã hóa và tác nhân, thay vì chỉ dùng cho hội thoại. Xem thêm thông báo chính thức của Google.
Thông số kỹ thuật kế thừa từ Gemini 3.6 Flash:
- Ngữ cảnh: 1 triệu token đầu vào, tối đa 64 nghìn token đầu ra.
- Đầu vào: văn bản, hình ảnh, video, âm thanh và PDF.
- Đầu ra: văn bản.
- Công cụ: gọi hàm, tìm kiếm như công cụ và sử dụng máy tính.
- An toàn: các biện pháp bảo vệ CBRN và an ninh mạng được cập nhật cùng bản phát hành.
Khác biệt chính là hành vi khi thực hiện công việc: gỡ lỗi tốt hơn, tạo mã có thể chạy ngay, điều chỉnh kế hoạch khi công cụ thất bại, hỏi lại khi yêu cầu mơ hồ và tuân thủ ràng buộc đầu ra chính xác hơn.
Cải tiến điểm chuẩn: Gemini 3.6 Flash so với 3.7 Flash
| Điểm chuẩn | Gemini 3.6 Flash | Gemini 3.7 Flash | Thay đổi |
|---|---|---|---|
| DeepSWE v1.1 — mã hóa tác nhân | 49,0% | 65,3% | +16,3 điểm |
| FrontierCode 1.1 Main | 34,4% | 43,6% | +9,2 điểm |
| WebDev Arena | 1538 Elo | 1588 Elo | +50 Elo |
| GDP.pdf — lý luận tài liệu | 22,0% | 34,0% | +12,0 điểm |
| AutomationBench — tác vụ tác nhân | 17,0% | 30,4% | +13,4 điểm |
Google cũng công bố:
- 90,7% trên Harvey LAB-AA, một điểm chuẩn lý luận pháp lý.
- 97,0% trên 128k-needle, đánh giá khả năng truy xuất thông tin trong ngữ cảnh dài.
Với ứng dụng thực tế, các điểm cần kiểm tra không phải chỉ là benchmark tổng quát. Hãy ưu tiên các kịch bản gần với workload của bạn:
- Sửa lỗi đa tệp trong repository thật.
- Tạo pull request từ một issue có nhiều ràng buộc.
- Trích xuất dữ liệu từ PDF dài.
- Gọi tool nhiều bước và xử lý lỗi từ tool.
- Sinh JSON hoặc mã nguồn theo schema cố định.
Thông tin về lần ra mắt Gemini 3.7 Flash đặc biệt nhấn mạnh mức tăng DeepSWE. Để đặt các chênh lệch benchmark vào bối cảnh thực tế, xem so sánh Grok 4.6, GPT 5.6 và Claude.
Những cải tiến đáng kiểm tra trong workflow
Google mô tả một số hành vi cần xác minh trực tiếp bằng bộ prompt của bạn.
1. Gỡ lỗi nguyên nhân gốc
Thay vì chỉ đề xuất một bản vá cục bộ, hãy yêu cầu model:
- xác định nguyên nhân gốc;
- nêu tệp và dòng cần thay đổi;
- mô tả rủi ro của bản vá;
- tạo test hồi quy.
Ví dụ prompt:
Bạn là senior backend engineer. Hãy phân tích lỗi dưới đây.
Yêu cầu:
1. Xác định nguyên nhân gốc, không chỉ triệu chứng.
2. Liệt kê các tệp cần thay đổi.
3. Đề xuất bản vá tối thiểu.
4. Viết test hồi quy.
5. Nếu thiếu dữ liệu, hãy hỏi tối đa 3 câu hỏi làm rõ.
[Đính kèm log, stack trace và mã nguồn]
2. Tạo mã có thể triển khai
Đừng chỉ đánh giá mã sinh ra bằng cảm quan. Hãy chạy pipeline tự động:
npm run lint
npm test
npm run build
Với dự án Python:
ruff check .
pytest
mypy .
FrontierCode tăng 9,2 điểm là tín hiệu tốt, nhưng chỉ test và build trong môi trường của bạn mới xác nhận mã có thể triển khai.
3. Xử lý lỗi khi gọi công cụ
Nếu bạn xây dựng agent, hãy mô phỏng lỗi tool như timeout, 404, dữ liệu rỗng hoặc schema không hợp lệ. Ví dụ, thêm kết quả lỗi giả lập vào tool response và kiểm tra model có:
- dừng vòng lặp vô hạn;
- thử chiến lược thay thế;
- hỏi người dùng khi cần;
- báo lỗi rõ ràng thay vì bịa dữ liệu.
AutomationBench tăng từ 17,0% lên 30,4% cho thấy đây là nhóm tác vụ đáng ưu tiên kiểm thử.
4. Tuân thủ format đầu ra
Nếu downstream service cần JSON, hãy ép schema và kiểm tra parse ngay sau phản hồi:
{
"task": "Phân loại lỗi",
"output_format": {
"type": "object",
"properties": {
"severity": { "type": "string" },
"root_cause": { "type": "string" },
"next_action": { "type": "string" }
},
"required": ["severity", "root_cause", "next_action"]
}
}
Giá Gemini 3.7 Flash: giảm một nửa đến hết năm 2026
Gemini 3.7 Flash có lịch giá hai giai đoạn trên Gemini API:
| Giai đoạn | Đầu vào, mỗi 1 triệu token | Đầu ra, mỗi 1 triệu token |
|---|---|---|
| Đến ngày 31 tháng 12 năm 2026 | 0,75 USD | 3,75 USD |
| Từ ngày 1 tháng 1 năm 2027 | 1,50 USD | 7,50 USD |
Giá giới thiệu bằng một nửa giá ra mắt của Gemini 3.6 Flash. Tuy nhiên, không nên xây dựng ngân sách dài hạn theo mức khuyến mãi.
Cách ước lượng chi phí
Dùng công thức:
Tổng chi phí =
(input_tokens / 1_000_000 × giá đầu vào) +
(output_tokens / 1_000_000 × giá đầu ra)
Ví dụ, một workload dùng 10 triệu token đầu vào và 2 triệu token đầu ra trong giai đoạn giới thiệu:
Đầu vào: 10 × 0,75 USD = 7,50 USD
Đầu ra: 2 × 3,75 USD = 7,50 USD
Tổng: 15,00 USD
Từ ngày 1 tháng 1 năm 2027, cùng workload đó sẽ là:
Đầu vào: 10 × 1,50 USD = 15,00 USD
Đầu ra: 2 × 7,50 USD = 15,00 USD
Tổng: 30,00 USD
Trước khi triển khai, luôn kiểm tra trang giá Gemini API chính thức. Để xem ví dụ chi tiết cho chatbot, xử lý tài liệu và agent loop, đọc phân tích giá Gemini 3.7 Flash.
Nơi có thể dùng Gemini 3.7 Flash
Google triển khai Gemini 3.7 Flash tại hơn 160 quốc gia trên các sản phẩm sau:
- Gemini API: lựa chọn trực tiếp cho developer.
- Google AI Studio: playground để thử prompt và lấy API key.
- Ứng dụng Gemini: giao diện chat cho người dùng cuối.
- Gemini Spark: dành cho thuê bao AI Pro và Ultra.
- Google Antigravity: môi trường phát triển tác nhân của Google.
- Android Studio: hỗ trợ mã hóa trong IDE.
- Gemini Enterprise: triển khai quản lý cho tổ chức.
Với workload enterprise hoặc cần quản lý IAM, OAuth và audit log, bạn có thể gọi qua Vertex AI tại:
aiplatform.googleapis.com
Model và cấu trúc request tương tự, nhưng cách xác thực, kiểm soát quyền truy cập và lưu trữ dữ liệu khác nhau.
Tại sao Google phát hành Flash trước Gemini 3.5 Pro?
Thông thường, model chủ lực được phát hành trước rồi các phiên bản nhanh hoặc rẻ hơn mới theo sau. Google đang đi theo hướng ngược lại: Gemini 3.6 Flash vào cuối tháng 7, Gemini 3.7 Flash ba tuần sau, trong khi Gemini 3.5 Pro chưa có ngày phát hành.
Điều này có ý nghĩa thực tế với developer: Flash không còn chỉ là lựa chọn giảm chi phí. Với các cải tiến về tác nhân, đây là model nên được đánh giá cho workload sản xuất có volume cao trước khi chờ Pro.
Nếu bạn đang dùng 3.6 Flash, việc chuyển đổi thường bắt đầu bằng thay đổi một dòng model ID:
- gemini-3.6-flash
+ gemini-3.7-flash
Sau đó, chạy test hồi quy cho prompt, tool call, format đầu ra và chi phí token. Xem hướng dẫn di chuyển từ Gemini 3.6 sang 3.7 Flash để có checklist chi tiết.
Gọi Gemini 3.7 Flash API trong năm phút
Bạn cần API key từ Google AI Studio.
1. Xuất API key
export GEMINI_API_KEY="AIza..."
Không commit key vào Git. Với local development, dùng .env; với CI/CD, dùng secret manager của nền tảng.
2. Gửi request đầu tiên
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{
"text": "Review this function for bugs: def dedupe(items): return list(set(items))"
}]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
3. Đọc phản hồi và theo dõi token
Phản hồi chứa nội dung sinh trong:
candidates[].content.parts[]
Dữ liệu sử dụng token nằm trong:
usageMetadata
Hãy log usageMetadata ngay từ đầu. Đây là dữ liệu cần thiết để:
- theo dõi chi phí theo endpoint hoặc người dùng;
- phát hiện prompt tăng kích thước bất thường;
- so sánh 3.6 Flash và 3.7 Flash công bằng;
- lập ngân sách khi giá chuyển sang mức tiêu chuẩn năm 2027.
4. Bật streaming khi cần phản hồi từng phần
Thay endpoint:
:generateContent
bằng:
:streamGenerateContent?alt=sse
Ví dụ:
curl -N "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:streamGenerateContent?alt=sse" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{ "text": "Giải thích ngắn gọn cách hoạt động của SSE." }]
}]
}'
Cách kiểm tra 3.6 Flash và 3.7 Flash trước khi migrate
Đừng thay model ID trong production ngay lập tức. Thay vào đó, tạo một bộ đánh giá nhỏ nhưng đại diện.
Bộ test tối thiểu
Chuẩn bị 20–50 prompt từ log đã được ẩn dữ liệu nhạy cảm, chia theo nhóm:
| Nhóm | Ví dụ |
|---|---|
| Mã hóa | Sửa bug, tạo unit test, refactor |
| RAG | Trả lời từ tài liệu dài hoặc PDF |
| Agent | Tool call nhiều bước, retry khi lỗi |
| Structured output | JSON theo schema |
| Hỗ trợ khách hàng | Tóm tắt, phân loại, routing |
Với mỗi prompt, lưu:
- input;
- model ID;
- output;
- tổng token đầu vào và đầu ra;
- latency;
- điểm đánh giá thủ công hoặc tự động;
- lỗi parse JSON, lỗi tool call hoặc lỗi policy.
Trong Apidog, bạn có thể lưu GEMINI_API_KEY dưới dạng biến môi trường và model ID dưới dạng biến đường dẫn:
{{base_url}}/v1beta/models/{{model}}:generateContent
Tạo hai environment hoặc hai test case:
model = gemini-3.6-flash
model = gemini-3.7-flash
Sau đó gửi cùng request, lưu response làm example và so sánh:
- output có đúng yêu cầu hơn không;
- số token đầu ra có tăng đột biến không;
- JSON có parse được không;
- tool call có ổn định hơn không;
- latency có phù hợp với SLA không.
Cách này giúp bạn xác minh tuyên bố “tuân thủ hướng dẫn tốt hơn” trên prompt thực tế, thay vì chỉ dựa vào benchmark công bố.
Câu hỏi thường gặp
Gemini 3.7 Flash có miễn phí sử dụng không?
Gemini API có tầng miễn phí qua AI Studio với hạn mức hằng ngày, phù hợp để tạo mẫu. Gói trả phí có giá giới thiệu 0,75 USD cho mỗi 1 triệu token đầu vào đến hết ngày 31 tháng 12 năm 2026. Xem thêm hướng dẫn về truy cập API Gemini miễn phí.
Gemini 3.7 Flash khác Gemini 3.6 Flash thế nào?
Thông số kỹ thuật giữ nguyên: ngữ cảnh, giới hạn đầu ra, phương thức đầu vào và hỗ trợ công cụ không đổi. Khác biệt nằm ở chất lượng mã hóa và tác nhân: DeepSWE tăng 16,3 điểm, AutomationBench tăng 13,4 điểm và WebDev Arena tăng 50 Elo.
Gemini 3.7 Flash có thay thế Gemini 3.5 Pro không?
Không. Pro vẫn là tầng chủ lực cho các tác vụ lý luận khó nhất. Gemini 3.7 Flash phù hợp hơn cho workload sản xuất có khối lượng lớn, nơi chi phí và độ trễ quan trọng.
Giá thay đổi thế nào vào ngày 1 tháng 1 năm 2027?
Giá giới thiệu kết thúc. Giá chuẩn là 1,50 USD cho mỗi 1 triệu token đầu vào và 7,50 USD cho mỗi 1 triệu token đầu ra, gấp đôi mức giá ra mắt.
Gemini 3.7 Flash có xử lý hình ảnh và PDF không?
Có. Model hỗ trợ văn bản, hình ảnh, video, âm thanh và PDF trong cùng mảng contents. Đầu ra là văn bản. Điểm GDP.pdf tăng từ 22,0% lên 34,0%, cho thấy khả năng hiểu tài liệu được cải thiện.
Kết luận: đánh giá bằng workload của bạn
Gemini 3.7 Flash kết hợp khả năng tác nhân tốt hơn, thông số quen thuộc và mức giá giới thiệu thấp hơn. Với người đang dùng Gemini 3.6 Flash, bước tiếp theo nên là đánh giá có kiểm soát thay vì migrate theo cảm tính:
- Lấy 20–50 prompt đại diện từ workload hiện tại.
- Chạy song song trên
gemini-3.6-flashvàgemini-3.7-flash. - So sánh chất lượng, token, latency, tỷ lệ lỗi và độ đúng schema.
- Đánh giá chi phí theo giá chuẩn năm 2027, không chỉ theo giá khuyến mãi.
- Chỉ rollout sau khi bộ test hồi quy đạt tiêu chí của bạn.
Tải Apidog để lưu request, response và chạy so sánh model trong cùng workspace.

Top comments (0)