Google đã làm mới cấp Flash vào ngày 21 tháng 7 năm 2026 với mô hình chủ lực Gemini 3.6 Flash. Nếu đang chạy Gemini 3.5 Flash trong môi trường production, bạn nên xem 3.6 Flash là bản thay thế trực tiếp: cùng họ mô hình, cùng cửa sổ ngữ cảnh 1M token và cùng giá đầu vào, nhưng giá đầu ra thấp hơn và số token đầu ra cần dùng cho cùng tác vụ cũng ít hơn. Xem thêm: Gemini 3.6 Flash là gì.
Câu trả lời ngắn gọn
Nâng cấp lên Gemini 3.6 Flash nếu bạn có thể chạy lại đánh giá và kiểm thử hồi quy.
So với Gemini 3.5 Flash, Gemini 3.6 Flash:
- Giữ nguyên giá đầu vào: 1,50 USD / 1 triệu token
- Giảm giá đầu ra: từ 9,00 USD xuống 7,50 USD / 1 triệu token
- Tạo ít hơn khoảng 17% token đầu ra cho cùng tác vụ
- Đạt điểm cao hơn trong bài kiểm thử sử dụng máy tính: 83,0 so với 78,4 trên OSWorld-Verified
- Cần ít bước suy luận và ít lệnh gọi công cụ hơn trong workflow đa bước
Chỉ nên tạm giữ gemini-3.5-flash nếu phiên bản đó đã được xác thực trong production nhưng bạn chưa có thời gian hoặc điều kiện để kiểm tra lại đầu ra.
Gemini 3.6 Flash so với Gemini 3.5 Flash
Các số liệu dưới đây dựa trên thông tin ra mắt của Google. Tham khảo bài đăng của Google và trang mô hình DeepMind Flash.
| Thuộc tính | Gemini 3.6 Flash | Gemini 3.5 Flash |
|---|---|---|
| ID mô hình | gemini-3.6-flash |
gemini-3.5-flash |
| Giá đầu vào mỗi 1M token | 1,50 USD | 1,50 USD |
| Giá đầu ra mỗi 1M token | 7,50 USD | 9,00 USD |
| Hiệu quả token đầu ra | Ít hơn khoảng 17% | Cơ sở |
| Sử dụng máy tính — OSWorld-Verified | 83,0 | 78,4 |
| Cửa sổ ngữ cảnh | 1M token đầu vào | 1M token đầu vào |
Giá đầu vào và cửa sổ ngữ cảnh không thay đổi. Điểm khác biệt chính nằm ở chi phí đầu ra, hiệu quả token và hiệu năng trong các luồng agent.
Những gì thực sự được cải thiện
Ít token đầu ra hơn
Gemini 3.6 Flash tạo ít hơn khoảng 17% token đầu ra so với Gemini 3.5 Flash cho cùng một công việc.
Token đầu ra bao gồm cả token suy nghĩ. Khi mô hình cần ít token hơn để đi đến cùng kết quả, chi phí đầu ra giảm trực tiếp. Đây là chỉ số quan trọng cho các workload tạo nội dung, sinh mã hoặc agent chạy nhiều bước.
Giá đầu ra thấp hơn
Google giảm giá đầu ra từ 9,00 USD xuống 7,50 USD cho mỗi 1 triệu token.
Mức giảm này cộng dồn với việc mô hình sinh ít token hơn. Vì vậy, chi phí không chỉ giảm theo đơn giá mà còn giảm theo tổng lượng token cần thanh toán.
Sử dụng máy tính tốt hơn
Trên OSWorld-Verified, Gemini 3.6 Flash đạt 83,0 điểm so với 78,4 điểm của Gemini 3.5 Flash.
Nếu bạn xây dựng agent để:
- Tương tác với giao diện người dùng
- Điền biểu mẫu
- Điều khiển công cụ
- Thực hiện chuỗi thao tác trên máy tính
thì điểm số cao hơn có thể đồng nghĩa với ít bước thất bại hơn trong workflow thực tế.
Ít bước suy luận và lệnh gọi công cụ hơn
Trong workflow agent đa bước, Gemini 3.6 Flash hoàn thành mục tiêu với ít bước suy luận và ít lệnh gọi công cụ hơn.
Điều này quan trọng vì mỗi lệnh gọi công cụ thường kéo theo:
- Một lần round-trip mạng
- Thời gian chờ bổ sung
- Token đầu vào và đầu ra bổ sung
- Nhiều điểm có thể phát sinh lỗi hơn
Độ chính xác khi lập trình cũng được cải thiện, đặc biệt hữu ích khi mô hình chỉnh sửa tệp hoặc tạo diff mã nguồn.
API không đổi hình dạng: định dạng yêu cầu, phương thức đầu vào — văn bản, hình ảnh, video, âm thanh, PDF — và đầu ra văn bản vẫn giữ nguyên.
Ý nghĩa đối với hóa đơn của bạn
Có hai hiệu ứng tiết kiệm chi phí:
- Giá trên mỗi token đầu ra thấp hơn.
- Tổng số token đầu ra cũng thấp hơn.
Hai hiệu ứng này nhân với nhau, không chỉ cộng lại.
Ví dụ, giả sử một workload tạo ra 10 triệu token đầu ra mỗi ngày trên Gemini 3.5 Flash:
-
Gemini 3.5 Flash:
10M × 9,00 USD = 90,00 USD/ngày -
Gemini 3.6 Flash: giảm 17% token đầu ra còn khoảng
8,3M, sau đó tính giá mới:8,3M × 7,50 USD = 62,25 USD/ngày
Trong ví dụ này, chi phí đầu ra giảm khoảng 31% mà không cần thay đổi prompt.
Chi phí đầu vào không đổi vì cả hai mô hình đều có giá 1,50 USD cho mỗi 1 triệu token đầu vào. Tuy nhiên, mức tiết kiệm thực tế phụ thuộc vào tỷ lệ đầu vào/đầu ra của workload:
- Đọc nhiều, viết ít: phân loại, trích xuất dữ liệu — tổng mức tiết kiệm thấp hơn.
- Viết nhiều: tạo nội dung, sinh mã, agent chạy dài — hưởng lợi nhiều hơn.
- Agent gọi nhiều công cụ: có thể tiết kiệm thêm nhờ giảm số round-trip.
Xem thêm giá Gemini 3.6 Flash và tài liệu giá API Gemini.
Khi nào nên giữ Gemini 3.5 Flash?
Lý do hợp lý nhất để tạm giữ gemini-3.5-flash là bạn chưa thể xác thực lại hệ thống.
Ví dụ:
- Bộ đánh giá đang bị khóa do quy trình tuân thủ.
- Output hiện tại đã được tinh chỉnh bằng prompt và hệ thống downstream phụ thuộc vào cách diễn đạt cụ thể.
- Bạn chưa có cửa sổ chạy regression test trong sprint hiện tại.
- Hệ thống parse output bằng JSON key, regex hoặc schema nghiêm ngặt.
Việc đổi mô hình có thể thay đổi cách diễn đạt hoặc cấu trúc đầu ra theo những cách nhỏ nhưng đủ để làm hỏng downstream service. Nếu chưa thể kiểm tra, hãy tiếp tục ghim:
gemini-3.5-flash
Sau đó lên lịch migration khi bạn có thời gian chạy evaluation và regression test.
Gemini 3.5 Flash không biến mất khi Gemini 3.6 Flash ra mắt. Nó vẫn khả dụng qua API. Tuy nhiên, với đa số team không bị khóa bởi quy trình xác thực, cả chi phí lẫn chất lượng đều cho thấy nên nâng cấp.
Cách di chuyển
Về mặt mã nguồn, thay đổi chỉ là ID mô hình:
- gemini-3.5-flash
+ gemini-3.6-flash
Request body, xác thực và endpoint vẫn giữ nguyên.
Xem hướng dẫn chi tiết tại cách sử dụng API Gemini 3.6 Flash và tài liệu API Gemini.
Phần quan trọng là xác minh thay đổi trước khi rollout hoàn toàn.
Checklist migration
- Chạy lại bộ đánh giá với Gemini 3.6 Flash và so sánh với baseline Gemini 3.5 Flash.
- Chạy regression test vì cấu trúc và cách diễn đạt đầu ra có thể thay đổi.
- Kiểm tra parser downstream, đặc biệt với JSON key, regex và schema validation.
- Theo dõi latency và token usage trên một phần traffic thực.
- Triển khai sau feature flag nếu output được sử dụng bởi service khác.
- So sánh kết quả A/B trước khi chuyển toàn bộ traffic.
Kiểm tra hồi quy thay đổi bằng Apidog
Apidog là API client và nền tảng kiểm thử phù hợp để xác minh migration này. Apidog không chạy mô hình; nó gửi request tới Gemini API và kiểm tra response theo các assertion bạn cấu hình.
Quy trình A/B hai mô hình:
Lưu request Gemini hiện tại
Tạo requestPOSTtới Gemini API trong Apidog. Lưu API key trong environment variable thay vì đưa trực tiếp vào request body.Nhân bản request
Giữ nguyên prompt, payload, cấu hình generation và header. Chỉ đổi model ID:
- gemini-3.5-flash
+ gemini-3.6-flash
Thêm assertion
Kiểm tra status code và các trường JSON mà ứng dụng thực sự dùng. Ví dụ, hãy xác nhận response có đúng cấu trúc mà downstream service yêu cầu.So sánh response, latency và token usage
Chạy cả hai request với cùng input. Đặt output cạnh nhau và kiểm tra Gemini 3.6 Flash có vượt qua toàn bộ assertion mà Gemini 3.5 Flash đã vượt qua hay không.Lưu thành regression test
Lưu hai request vào test scenario và lên lịch kiểm thử API để phát hiện sớm thay đổi do model hoặc prompt trong tương lai.
Quy trình cốt lõi là: nhân bản request, chỉ thay model ID, sau đó để assertion xác nhận migration có an toàn hay không.
Tải xuống Apidog để chạy thử so sánh trên các Gemini API call của bạn.
Câu hỏi thường gặp
Gemini 3.6 Flash có phải là bản thay thế trực tiếp cho Gemini 3.5 Flash không?
Về mặt kỹ thuật, có. Bạn chỉ cần đổi model ID từ gemini-3.5-flash sang gemini-3.6-flash; phần còn lại của request giữ nguyên.
Tuy vậy, vẫn nên chạy lại evaluation và regression test trước khi đưa vào production vì cách diễn đạt và cấu trúc output có thể thay đổi giữa các phiên bản.
Giá đầu vào có thay đổi không?
Không. Giá đầu vào vẫn là 1,50 USD cho mỗi 1 triệu token trên cả hai mô hình.
Chỉ giá đầu ra thay đổi, từ 9,00 USD xuống 7,50 USD cho mỗi 1 triệu token.
Tại sao mô hình là 3.6 nhưng Flash-Lite và Flash Cyber là 3.5?
Google chỉ nâng cấp mô hình Flash chủ lực lên phiên bản 3.6 trong lần làm mới này. Flash-Lite và Flash Cyber được phát hành dưới phiên bản 3.5.
Đừng chỉ nhìn số phiên bản của họ mô hình; hãy luôn kiểm tra chính xác model ID bạn đang gọi.
Hóa đơn có chắc chắn giảm 31% không?
Không. Mức giảm khoảng 31% là ví dụ dành cho workload nặng về đầu ra.
Mức tiết kiệm thực tế phụ thuộc vào tỷ lệ token đầu vào/đầu ra:
- Workload nặng về đầu ra tiết kiệm nhiều hơn.
- Workload chủ yếu đọc hoặc phân loại tiết kiệm ít hơn.
- Agent có nhiều tool call có thể giảm thêm chi phí nhờ ít round-trip hơn.
Gemini 3.5 Flash còn dùng được không?
Có. Gemini 3.5 Flash vẫn khả dụng qua API.
Nếu bạn đã xác thực nó trong production nhưng chưa thể chạy lại kiểm thử, ghim phiên bản này là lựa chọn ngắn hạn hợp lý. Hãy lên kế hoạch migration trong cửa sổ kiểm tra tiếp theo.
Để tìm hiểu về thế hệ trước, xem Gemini 3.5 là gì.
Với hầu hết team, quyết định khá rõ ràng: đổi model ID sang gemini-3.6-flash, chạy evaluation và regression test trong Apidog, sau đó triển khai mô hình hiệu quả hơn và rẻ hơn. Chỉ giữ Gemini 3.5 Flash khi bạn thực sự bị chặn bởi yêu cầu xác thực hiện tại.

Top comments (0)