DEV Community

Cover image for Giá Gemini 3.6 Flash: chi phí thực tế năm 2026
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Giá Gemini 3.6 Flash: chi phí thực tế năm 2026

Gemini 3.6 Flash có giá 1,50 đô la cho mỗi 1M token đầu vào và 7,50 đô la cho mỗi 1M token đầu ra. Con số này thấp hơn mô hình mà nó thay thế. Google phát hành bản cập nhật vào ngày 21 tháng 7 năm 2026; nếu bạn theo dõi hóa đơn API, điểm chính là: gói Flash chủ lực nhanh hơn và rẻ hơn cùng lúc.

Dùng thử Apidog ngay hôm nay

Bài viết này giúp bạn lập ngân sách trước khi triển khai: giá theo token, chi phí bộ nhớ đệm ngữ cảnh, phạm vi của gói miễn phí và ví dụ tính chi phí hàng tháng. Các số liệu được lấy từ tài liệu giá Gemini APIthông báo ra mắt của Google. Nếu cần tổng quan về mô hình, hãy đọc Gemini 3.6 Flash là gì.

Lưu ý về phiên bản: mô hình chủ lực là Gemini 3.6 Flash, trong khi Flash-Lite vẫn là Gemini 3.5 Flash-Lite. Hai gói được công bố cùng đợt nhưng có số phiên bản khác nhau.

Tổng quan về giá Gemini 3.6 Flash

Mục Chi phí
Đầu vào 1,50 đô la cho mỗi 1M token
Đầu ra, bao gồm token suy nghĩ 7,50 đô la cho mỗi 1M token
Đọc đầu vào từ bộ nhớ đệm ngữ cảnh 0,15 đô la cho mỗi 1M token
Lưu trữ bộ nhớ đệm ngữ cảnh 1,00 đô la cho mỗi 1M token mỗi giờ
Gói miễn phí Có, qua Google AI Studio, kèm giới hạn tỷ lệ

Khi lập ngân sách, cần tính cả hai phần sau:

  1. Token đầu ra bao gồm token suy nghĩ. Suy luận nội bộ trước khi mô hình trả lời được tính theo giá đầu ra 7,50 đô la cho mỗi 1M token.
  2. Bộ nhớ đệm ngữ cảnh có phí đọc và phí lưu trữ. Bạn tiết kiệm khi đọc lại ngữ cảnh đã lưu, nhưng vẫn trả phí lưu trữ theo giờ.

Bộ nhớ đệm chỉ có lợi khi cùng một tiền tố prompt hoặc tài liệu tham chiếu được tái sử dụng nhiều lần trong khoảng thời gian lưu trữ.

So sánh với Gemini 3.5 Flash

Giá token đầu ra giảm từ 9,00 đô la cho mỗi 1M token trên Gemini 3.5 Flash xuống còn 7,50 đô la trên Gemini 3.6 Flash.

Mức giảm giá đầu ra
= (9,00 - 7,50) / 9,00
≈ 16,7%
Enter fullscreen mode Exit fullscreen mode

Theo trang mô hình DeepMind Flash, Gemini 3.6 Flash cũng tạo ra ít hơn khoảng 17% token đầu ra cho cùng một tác vụ. Điều này đặc biệt quan trọng với quy trình đa bước hoặc tác nhân có gọi công cụ:

  • Giá mỗi token đầu ra thấp hơn.
  • Tổng số token đầu ra cũng thấp hơn.
  • Hai mức giảm này được nhân với nhau trong hóa đơn thực tế.

Nếu bạn đang dùng Gemini 3.5 Flash, hãy đối chiếu với phân tích giá Gemini 3.5 Flash. Để so sánh về khả năng và hiệu suất, xem Gemini 3.6 Flash vs 3.5 Flash.

Gói miễn phí: dùng để tạo mẫu, không phải sản xuất

Bạn có thể gọi Gemini 3.6 Flash miễn phí qua Google AI Studio, không cần thẻ tín dụng.

Tuy nhiên, hãy dùng gói này đúng mục đích:

  • Phù hợp để tạo mẫu, thử prompt và kiểm tra tích hợp.
  • Bị giới hạn tỷ lệ, không phù hợp với lưu lượng production.
  • Google có thể sử dụng dữ liệu từ gói miễn phí để cải thiện sản phẩm.

Không gửi dữ liệu nhạy cảm, dữ liệu khách hàng hoặc dữ liệu độc quyền qua gói miễn phí. Khi triển khai thực tế, hãy chuyển sang khóa API trả phí.

Xem hướng dẫn cách sử dụng Gemini 3.6 Flash miễn phí để thiết lập và kiểm tra giới hạn.

Ví dụ tính chi phí thực tế

Giả sử bạn vận hành một tác nhân đọc nhiều, viết ít:

  • 2M token đầu vào mỗi ngày
  • 500k token đầu ra mỗi ngày

Đây là mô hình phổ biến cho trợ lý truy xuất thông tin: đọc tài liệu, áp dụng ngữ cảnh và trả về câu trả lời ngắn.

Chi phí Gemini 3.6 Flash mỗi ngày

Chi phí đầu vào
= 2M × 1,50 đô la / 1M
= 3,00 đô la

Chi phí đầu ra
= 500k × 7,50 đô la / 1M
= 3,75 đô la

Tổng mỗi ngày
= 3,00 + 3,75
= 6,75 đô la

Tổng 30 ngày
= 6,75 × 30
= 202,50 đô la
Enter fullscreen mode Exit fullscreen mode

Hiệu ứng cộng dồn so với Gemini 3.5 Flash

Giả sử cùng tác vụ đó tạo ra 600k token đầu ra trên Gemini 3.5 Flash. Nếu Gemini 3.6 Flash giảm khoảng 17% token đầu ra, con số này còn khoảng 500k token.

Mô hình Token đầu ra/ngày Giá đầu ra Chi phí đầu ra/ngày
Gemini 3.5 Flash 600k 9,00 đô la / 1M 5,40 đô la
Gemini 3.6 Flash 500k 7,50 đô la / 1M 3,75 đô la

Chênh lệch là:

5,40 - 3,75 = 1,65 đô la/ngày
1,65 × 30 = 49,50 đô la/tháng
Enter fullscreen mode Exit fullscreen mode

Chỉ riêng chi phí đầu ra đã giảm khoảng 31%. Đây là kết quả của việc giảm đồng thời giá token và số token được tạo ra.

Khi nào nên dùng Gemini 3.5 Flash-Lite

Nếu tác vụ đơn giản và có khối lượng lớn, hãy cân nhắc Gemini 3.5 Flash-Lite.

Mục Gemini 3.5 Flash-Lite
Đầu vào 0,30 đô la / 1M token
Đầu ra 2,50 đô la / 1M token
Đọc bộ nhớ đệm 0,03 đô la / 1M token
Lưu trữ bộ nhớ đệm 1,00 đô la / 1M token mỗi giờ
Tốc độ đầu ra Khoảng 350 token/giây

Với cùng khối lượng 2M token đầu vào và 500k token đầu ra:

Đầu vào
= 2M × 0,30 đô la / 1M
= 0,60 đô la

Đầu ra
= 500k × 2,50 đô la / 1M
= 1,25 đô la

Tổng mỗi ngày
= 1,85 đô la

Tổng 30 ngày
= 55,50 đô la
Enter fullscreen mode Exit fullscreen mode

Với cùng số token, Flash-Lite rẻ hơn khoảng 70% so với Gemini 3.6 Flash.

Dùng Flash-Lite cho các tác vụ như:

  • Phân loại.
  • Trích xuất dữ liệu.
  • Định tuyến yêu cầu.
  • Tạo phản hồi có cấu trúc ngắn.
  • Xử lý khối lượng lớn với độ phức tạp thấp.

Dành Gemini 3.6 Flash cho các tác vụ cần suy luận đa bước hoặc xử lý khó hơn. Đọc thêm Gemini 3.5 Flash-Lite là gìGemini 3.5 Flash-Lite vs 3.6 Flash trước khi thiết kế logic định tuyến.

Cách kiểm soát và đo lường chi phí

Dưới đây là bốn đòn bẩy thực tế để giảm chi phí.

1. Lưu ngữ cảnh lặp lại vào bộ nhớ đệm

Nếu mọi yêu cầu đều dùng cùng một system prompt dài hoặc cùng tài liệu tham chiếu, hãy sử dụng bộ nhớ đệm ngữ cảnh.

  • Đọc từ bộ nhớ đệm: 0,15 đô la / 1M token.
  • Đọc đầu vào thông thường: 1,50 đô la / 1M token.
  • Lưu trữ bộ nhớ đệm: 1,00 đô la / 1M token mỗi giờ.

Chỉ lưu vào bộ nhớ đệm khi bạn dự kiến tái sử dụng ngữ cảnh nhiều lần. Với yêu cầu chỉ chạy một lần, chi phí lưu trữ có thể không mang lại lợi ích.

2. Cắt gọn prompt và giới hạn đầu ra

Đầu ra đắt gấp năm lần đầu vào, nhưng prompt dài vẫn làm tăng chi phí ở quy mô lớn.

Checklist thực hiện:

  • Loại bỏ hướng dẫn lặp lại trong prompt.
  • Không gửi lại toàn bộ lịch sử hội thoại nếu không cần thiết.
  • Chỉ đưa các đoạn tài liệu liên quan vào ngữ cảnh.
  • Đặt giới hạn token đầu ra phù hợp với tác vụ.
  • Dùng định dạng đầu ra có cấu trúc khi cần phản hồi ngắn, ổn định.

3. Định tuyến tác vụ đơn giản sang Flash-Lite

Không nên dùng một mô hình cho mọi yêu cầu. Một chiến lược định tuyến đơn giản có thể là:

Nếu tác vụ là phân loại, trích xuất hoặc định tuyến
  → Gemini 3.5 Flash-Lite

Nếu tác vụ cần suy luận đa bước hoặc xử lý phức tạp
  → Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Cách này giúp giữ chi phí thấp mà không buộc phải đánh đổi chất lượng ở các yêu cầu khó.

4. Theo dõi usageMetadata trong mọi phản hồi

Đừng chỉ dựa vào ước tính. Gemini trả về usageMetadata, cho biết số token đầu vào, đầu ra và token suy nghĩ mà một lần gọi đã dùng.

Khi ghi log, hãy lưu tối thiểu:

{
  "requestId": "your-request-id",
  "model": "gemini-3.6-flash",
  "usageMetadata": {
    "promptTokenCount": 0,
    "candidatesTokenCount": 0,
    "totalTokenCount": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

Sau đó, tính chi phí từ token thực tế thay vì từ giả định ban đầu. Bạn cũng có thể đặt ngưỡng cảnh báo khi token đầu ra tăng bất thường sau một thay đổi prompt.

Trong Apidog, bạn có thể tạo yêu cầu POST đến Gemini API, lưu API key trong biến môi trường và kiểm tra trực tiếp usageMetadata trong phản hồi. Thêm assertion cho số token đầu ra để phát hiện prompt regression trước khi nó làm tăng hóa đơn. Bạn cũng có thể lên lịch chạy kiểm thử API định kỳ để phát hiện sớm các sai lệch chi phí.

Tải Apidog và gửi một yêu cầu Gemini thực tế trước khi đưa tích hợp vào production.

Câu hỏi thường gặp

Gemini 3.6 Flash có giá bao nhiêu cho mỗi 1 triệu token?

1,50 đô la cho token đầu vào và 7,50 đô la cho token đầu ra. Đọc từ bộ nhớ đệm ngữ cảnh có giá 0,15 đô la cho mỗi 1M token, cộng thêm phí lưu trữ 1,00 đô la cho mỗi 1M token mỗi giờ.

Giá đầu ra có bao gồm token suy nghĩ không?

Có. Token suy nghĩ được tính theo giá token đầu ra là 7,50 đô la cho mỗi 1M token. Không có dòng phí riêng, nhưng token suy nghĩ vẫn được cộng vào tổng token đầu ra.

Có gói miễn phí không?

Có, qua Google AI Studio và có giới hạn tỷ lệ. Gói này phù hợp cho tạo mẫu và thử nghiệm, không dành cho production. Không dùng gói miễn phí cho dữ liệu nhạy cảm.

Gemini 3.6 Flash có rẻ hơn Gemini 3.5 Flash không?

Có. Giá đầu ra giảm từ 9,00 xuống 7,50 đô la cho mỗi 1M token. Gemini 3.6 Flash cũng dùng ít hơn khoảng 17% token đầu ra cho cùng tác vụ, nên chi phí đầu ra thực tế có thể giảm khoảng 31%.

Khi nào nên dùng Flash-Lite?

Dùng Flash-Lite khi tác vụ đơn giản, có khối lượng lớn và không yêu cầu suy luận phức tạp. Với giá 0,30 đô la cho đầu vào và 2,50 đô la cho đầu ra, đây là lựa chọn phù hợp cho phân loại, trích xuất và định tuyến.

Gemini 3.6 Flash giúp giảm chi phí ở cả giá token lẫn lượng token đầu ra. Hãy lập ngân sách với mức 1,50 đô la cho đầu vào và 7,50 đô la cho đầu ra; tính cả token suy nghĩ; dùng bộ nhớ đệm cho ngữ cảnh tái sử dụng; và định tuyến tác vụ đơn giản sang Flash-Lite.

Để xem bối cảnh lịch sử, hãy tham khảo phân tích chi phí API Gemini 3.0. Cuối cùng, hãy đo token thực tế của chính bạn trong Apidog để đảm bảo dự báo chi phí khớp với hóa đơn.

Top comments (0)