DEV Community

Cover image for Giá Gemini 3.8 Flash: Ưu đãi ban đầu, token suy nghĩ và chi phí thực tế mỗi tác vụ
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Giá Gemini 3.8 Flash: Ưu đãi ban đầu, token suy nghĩ và chi phí thực tế mỗi tác vụ

Gemini 3.8 Flash có giá giới thiệu $0,75 cho mỗi triệu token đầu vào và $3,75 cho mỗi triệu token đầu ra, tương tự Gemini 3.7 Flash. Mức giá này áp dụng đến hết ngày 31 tháng 12 năm 2026. Từ ngày 1 tháng 1 năm 2027, giá sẽ tăng gấp đôi lên $1,50 và $7,50. Gemini 3.6 Flash và 3.7 Flash cũng tăng giá vào cùng ngày.

Dùng thử Apidog ngay hôm nay

Điểm đáng chú ý không nằm ở giá mỗi token, mà ở số token mô hình sử dụng. Google cho biết Gemini 3.8 Flash “làm việc chăm chỉ hơn”: mô hình thực hiện nhiều bước suy luận hơn, gọi công cụ lặp lại và có thể dùng nhiều token hơn cho các tác vụ phức tạp.

Artificial Analysis đo được chi phí trung bình $0,58 cho mỗi tác vụ trên Gemini 3.8 Flash ở mức suy nghĩ cao, so với $0,40 trên Gemini 3.7 Flash. Gemini 3.8 Flash sử dụng khoảng 30% token đầu ra nhiều hơn. Nói cách khác: giá niêm yết giống nhau, nhưng hóa đơn cho mỗi tác vụ có thể cao hơn.

Bài viết này phân tích bảng giá API Gemini, ước tính chi phí cho 1.000 tác vụ mỗi ngày ở từng cấp độ suy nghĩ và so sánh với Flash-Lite, Claude Sonnet 5 và GPT-5.6 Luna. Nếu cần tìm hiểu tổng quan trước, hãy xem Gemini 3.8 Flash là gì.

Tổng quan giá Gemini 3.8 Flash

Tất cả mức giá dưới đây tính trên 1 triệu token ở bậc trả phí.

Hạng mục Giới thiệu
(đến 31/12/2026)
Tiêu chuẩn
(từ 01/01/2027)
Đầu vào: văn bản, hình ảnh, video, âm thanh, PDF $0,75 $1,50
Đầu ra, bao gồm token suy nghĩ $3,75 $7,50
Đọc bộ nhớ đệm ngữ cảnh $0,075 $0,15
Lưu trữ bộ nhớ đệm
(mỗi 1M token/giờ)
$0,50 $1,00
Đầu vào API hàng loạt
(giảm 50%)
$0,375 $0,75
Đầu ra API hàng loạt
(giảm 50%)
$1,875 $3,75
Google Search grounding 5.000 yêu cầu miễn phí/tháng dùng chung cho Gemini 3.x; sau đó $14/1.000 yêu cầu Tương tự
Tầng miễn phí $0, có giới hạn tỷ lệ; dữ liệu được dùng để cải thiện sản phẩm Google Tương tự

Bảng giá Gemini 3.8 Flash

Ba điểm cần ghi nhớ:

  1. Token suy nghĩ được tính như token đầu ra, ở mức $3,75/1M token.
  2. Giá giới thiệu kết thúc cố định vào ngày 31 tháng 12 năm 2026.
  3. Gemini 3.6 Flash và 3.7 Flash cũng tăng gấp đôi vào ngày 1 tháng 1 năm 2027.

Bạn có thể xem chi tiết trong trang giá API Gemini chính thứcphân tích giá Gemini 3.7 Flash.

Token suy nghĩ cũng là token đầu ra

Gemini 3.8 Flash suy luận trước khi trả lời. Mỗi token được tạo trong quá trình suy luận đều được tính phí như đầu ra.

API trả về các số liệu này trong usageMetadata:

  • promptTokenCount: số token đầu vào.
  • thoughtsTokenCount: số token suy nghĩ.
  • candidatesTokenCount: số token trong câu trả lời hiển thị.

thoughtsTokenCountcandidatesTokenCount đều bị tính phí ở mức $3,75/1M token.

Bạn điều chỉnh mức suy nghĩ bằng thinking_level:

  • low
  • medium
  • high

Trên Gemini 3.8 Flash, mặc định là medium. Giá trị minimal đã bị loại bỏ và sẽ gây lỗi xác thực, vì vậy cần ánh xạ cấu hình cũ từ minimal sang low.

thinking_level biểu thị mức độ nỗ lực tương đối, không phải ngân sách token cố định. Bạn không thể giới hạn trực tiếp số token suy nghĩ như với thinking_budget dạng số nguyên trước đây. Xem thêm tài liệu suy nghĩ của Googlehướng dẫn cấp độ suy nghĩ Gemini 3.8 Flash.

Ví dụ tính chi phí

Giả sử một yêu cầu sử dụng:

  • 10.000 token đầu vào.
  • 2.000 token đầu ra hiển thị.
  • 6.000 token suy nghĩ.

Ở mức giá giới thiệu:

Đầu vào:
10.000 × $0,75 / 1.000.000 = $0,0075

Đầu ra:
(2.000 + 6.000) × $3,75 / 1.000.000 = $0,03

Tổng:
$0,0375 mỗi yêu cầu
Enter fullscreen mode Exit fullscreen mode

Token suy nghĩ chiếm 75% phí đầu ra và 60% tổng chi phí yêu cầu.

Từ ngày 1 tháng 1 năm 2027, cùng yêu cầu sẽ tốn:

$0,015 + $0,06 = $0,075
Enter fullscreen mode Exit fullscreen mode

Vì vậy, nhận định “giá giống Gemini 3.7 Flash” chỉ đúng ở cấp độ mỗi token. Số token được sử dụng có thể đã thay đổi đáng kể.

Vì sao chi phí mỗi tác vụ tăng dù giá không đổi?

Theo bài đăng ra mắt của Google, Gemini 3.8 Flash thực hiện thêm các bước suy luận và gọi công cụ lặp lại trên tác vụ phức tạp để tự kiểm tra kết quả.

Nhiều bước hơn dẫn đến:

  • Nhiều token suy nghĩ hơn.
  • Nhiều lượt gọi công cụ hơn trong quy trình tác nhân.
  • Thời gian xử lý dài hơn.
  • Chi phí cho mỗi tác vụ cao hơn.

Google đề xuất hai cách giảm chi phí:

  1. Hạ thinking_level.
  2. Tiếp tục dùng Gemini 3.7 Flash nếu chất lượng của mô hình cũ đã đáp ứng yêu cầu.

Theo Artificial Analysis, Intelligence Index chạy chín đánh giá. Gemini 3.8 Flash ở mức cao đạt 59 điểm, so với 56 điểm của Gemini 3.7 Flash ở cùng mức, nhưng sử dụng trung bình khoảng 48.000 token đầu ra mỗi tác vụ — cao hơn khoảng 30%.

Cấu hình Chi phí/tác vụ
(giá giới thiệu)
Thời gian/tác vụ
Gemini 3.8 Flash, cao $0,58 2,5 phút
Gemini 3.8 Flash, trung bình $0,41 Chưa công bố
Gemini 3.8 Flash, thấp $0,24 0,8 phút
Gemini 3.7 Flash, cao $0,40 2,2 phút

Có thể đọc bảng theo hai hướng:

  • So với Gemini 3.7 Flash, Gemini 3.8 Flash ở mức cao đắt hơn 45% mỗi tác vụ ($0,58 / $0,40 = 1,45) để tăng 3 điểm chỉ số.
  • Trên Gemini 3.8 Flash, chuyển từ cao xuống trung bình giảm khoảng 29% chi phí ($0,41 / $0,58 = 0,71).
  • Chuyển xuống thấp giảm khoảng 59% ($0,24 / $0,58 = 0,41).
  • Mức trung bình của Gemini 3.8 Flash gần bằng mức cao của Gemini 3.7 Flash — một mốc hữu ích để cân nhắc nâng cấp.

Xem thêm so sánh Gemini 3.8 Flash và 3.7 Flash theo khối lượng công việc.

Artificial Analysis cũng công bố mức giá tổng hợp $0,58 cho mỗi triệu token với tỷ lệ đầu vào/đầu ra là 3:1. Việc con số này trùng với chi phí cao mỗi tác vụ chỉ là ngẫu nhiên: một bên là giá trên mỗi token, bên còn lại phụ thuộc vào số token mô hình thực sự sử dụng.

Tận dụng giá giới thiệu trước ngày 31 tháng 12

“Cố định giá” cần được hiểu chính xác: giá giới thiệu không phải hợp đồng cố định. Google tính phí theo giá hiện hành tại thời điểm token được tiêu thụ. Bạn không thể trả trước mức sử dụng năm 2027 bằng giá năm 2026, và chuyển sang Gemini 3.7 hoặc 3.6 Flash cũng không tránh được đợt tăng giá.

Bạn có thể giảm tác động bằng cách:

  • Chạy các tác vụ không cần thời gian thực qua Batch API ngay trong năm nay. Ví dụ, một tác vụ 100 triệu token gồm 75 triệu token đầu vào và 25 triệu token đầu ra sẽ có chi phí:
  75 × $0,375 + 25 × $1,875
  = $28,13 + $46,88
  = $74,99
Enter fullscreen mode Exit fullscreen mode

Từ tháng 1, cùng khối lượng sẽ tăng gấp đôi lên $149,98.

  • Xây dựng bộ đánh giá và ghi nhận mức sử dụng token cơ sở trước khi giá thay đổi. Khi đó, bạn chỉ cần theo dõi tác động của việc tăng giá, thay vì đồng thời phân biệt cả thay đổi về prompt, model và số token.

  • Chọn thinking_level cho từng quy trình. Để mọi quy trình ở medium chỉ vì đó là mặc định nghĩa là bạn chưa đánh giá chi phí. Nếu mức low vẫn đạt yêu cầu, hãy chuyển sang mức này trước tháng 1.

Nếu chi phí là yếu tố quyết định, hãy tham khảo tổng hợp các nhà cung cấp API LLM rẻ nhấtso sánh Fable 5.1 với GPT-5.6 Sol.

So sánh với Flash-Lite, Sonnet 5 và GPT-5.6 Luna

Giá trên mỗi 1 triệu [REDACTED CREDENTIAL] Mô hình Đầu vào Đầu ra Ghi chú
Gemini 3.8 Flash, giới thiệu $0,75 $3,75 Token suy nghĩ tính như đầu ra; đọc bộ nhớ đệm $0,075
Gemini 3.8 Flash, từ 1/1/2027 $1,50 $7,50 Đọc bộ nhớ đệm $0,15
Gemini 3.5 Flash-Lite $0,30 $2,50 Khoảng 350 token/giây
Claude Sonnet 5 $2 $10 Vĩnh viễn; đợt tăng giá ngày 1 tháng 9 đã bị hủy
GPT-5.6 Luna $1 $6

Ở mức giá giới thiệu:

  • Đầu vào Gemini 3.8 Flash đắt gấp 2,5 lần Flash-Lite.
  • Đầu ra đắt gấp 1,5 lần Flash-Lite.
  • Gemini 3.8 Flash rẻ hơn Sonnet 5 khoảng 2,7 lần ở cả đầu vào và đầu ra.
  • Gemini 3.8 Flash cũng rẻ hơn GPT-5.6 Luna: $0,75 so với $1 đầu vào và $3,75 so với $6 đầu ra.

Từ ngày 1 tháng 1, mức giá $1,50/$7,50 khiến Gemini 3.8 Flash đắt hơn Luna ở cả đầu vào và đầu ra. Khoảng cách với Sonnet 5 thu hẹp còn khoảng 1,3 lần. Flash-Lite vẫn rẻ hơn trong cả hai giai đoạn.

Nếu giá giới thiệu là lý do chính để chọn Gemini 3.8 Flash, hãy lên lịch đánh giá lại nhà cung cấp vào tháng 1.

Giá mỗi token chỉ là một nửa câu chuyện. Một mô hình có giá cao hơn nhưng dùng ít token hơn vẫn có thể rẻ hơn trên mỗi tác vụ. Cách kiểm chứng duy nhất là chạy cùng một bộ tác vụ qua từng mô hình và so sánh usageMetadata.

Xem hướng dẫn sử dụng API Gemini 3.8 Flash để biết cách đọc dữ liệu này từ cả Interactions API và generateContent API.

Phát hiện tăng chi phí bằng kiểm thử token trong Apidog

Một lỗi phổ biến không phải là mô hình trả lời sai, mà là trả lời đúng nhưng âm thầm dùng thêm 40% token sau khi bạn thay đổi prompt hoặc thinking_level. Vấn đề chỉ xuất hiện khi hóa đơn tăng.

Có thể xử lý bằng cách biến số lượng token thành một điều kiện kiểm thử, tương tự mã trạng thái HTTP.

1. Lưu API key trong biến môi trường

Tạo biến GEMINI_API_KEY trong môi trường Apidog và tham chiếu biến này trong header:

x-goog-[REDACTED CREDENTIAL]EMINI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Nhờ đó, khóa không nằm trong request đã lưu.

2. Tạo một golden prompt

Lưu request POST tới endpoint:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Sử dụng prompt đại diện cho từng quy trình production và đặt rõ thinkingConfig.thinkingLevel.

3. Khẳng định các trường usage

Thêm post-response script để kiểm tra token suy nghĩ, token đầu ra và chi phí tối đa:

const usage = pm.response.json().usageMetadata;

pm.test("thinking tokens within budget", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});

pm.test("visible output within budget", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});

pm.test("request cost within budget", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;

  pm.expect(cost).to.be.below(0.05);
});
Enter fullscreen mode Exit fullscreen mode

4. Lên lịch kiểm thử

Đưa request vào một kịch bản kiểm thử và chạy theo lịch. Khi số token tăng, pipeline sẽ thất bại ngay trong ngày thay vì chờ đến hóa đơn cuối tháng.

Tham khảo hướng dẫn lên lịch kiểm tra API trong Apidog. Ngày 1 tháng 1, cập nhật hai hằng số giá trong script và tiếp tục dùng assertion để theo dõi chi phí.

Bạn cũng có thể sao chép kịch bản sang Flash-Lite, Sonnet 5 hoặc Luna, sau đó so sánh các trường usage cạnh nhau. Tải xuống Apidog để xây dựng kịch bản đầu tiên; gói miễn phí hỗ trợ quy trình này.

Câu hỏi thường gặp

Gemini 3.8 Flash có đắt hơn Gemini 3.7 Flash không?

**Mỗi [REDACTED CREDENTIAL] không. Cả hai có giá $0,75 đầu vào và $3,75 đầu ra đến hết ngày 31 tháng 12, sau đó tăng lên $1,50 và $7,50.

Mỗi tác vụ: có thể đắt hơn. Artificial Analysis đo được $0,58 mỗi tác vụ trên Gemini 3.8 Flash ở mức cao, so với $0,40 trên Gemini 3.7 Flash, do Gemini 3.8 Flash tạo ra nhiều hơn khoảng 30% token đầu ra.

Token suy nghĩ có bị tính phí riêng không?

Không. Chúng được tính như token đầu ra ở mức $3,75/1M token trong giai đoạn giới thiệu và xuất hiện trong usageMetadata.thoughtsTokenCount.

Bạn kiểm soát chúng gián tiếp qua thinking_level. Gemini 3.8 Flash không hỗ trợ ngân sách token cứng và minimal sẽ gây lỗi.

Gemini 3.8 Flash có tầng miễn phí không?

Có. AI Studio không tính phí đầu vào hoặc đầu ra ở tầng miễn phí, nhưng có giới hạn tỷ lệ và Google sử dụng dữ liệu để cải thiện sản phẩm.

Ứng dụng Gemini dành cho người dùng chỉ cung cấp Gemini 3.8 Flash cho người đăng ký AI Pro và Ultra. Xem hướng dẫn sử dụng Gemini 3.8 Flash miễn phí.

Chi phí thay đổi thế nào vào ngày 1 tháng 1 năm 2027?

Giá đầu vào, đầu ra, đọc bộ nhớ đệm, lưu trữ bộ nhớ đệm và Batch API đều tăng gấp đôi. Nếu số token mỗi tác vụ không đổi, hóa đơn cũng tăng gấp đôi. Gemini 3.6 Flash và 3.7 Flash tăng giá cùng ngày.

Cấp độ suy nghĩ nào giúp giảm chi phí?

Hãy bắt đầu với số liệu Artificial Analysis:

  • Thấp: $0,24/tác vụ.
  • Trung bình: $0,41/tác vụ.
  • Cao: $0,58/tác vụ.

Sau đó chạy bộ đánh giá riêng ở cả ba cấp độ, chọn mức thấp nhất vẫn đáp ứng yêu cầu và thêm assertion để ngăn số token tăng ngoài dự kiến.

Việc cần làm trong tuần này

Gemini 3.8 Flash có giá mỗi token tương tự Gemini 3.7 Flash, nhưng có thể sử dụng lượng token như một mô hình lớn hơn.

Để kiểm soát chi phí:

  1. Xem thinking_level là một cài đặt chi phí, không chỉ là cài đặt chất lượng.
  2. Chọn cấp độ riêng cho từng pipeline.
  3. Chuyển các tác vụ có thể xử lý theo lô sang Batch API trước ngày 31 tháng 12.
  4. Đo mức sử dụng token hiện tại làm baseline.
  5. Thêm assertion cho token và chi phí trong Apidog.
  6. Đánh giá lại các mô hình vào tháng 1 năm 2027.

Khi đó, đợt tăng giá sẽ là một thay đổi đã được dự toán, thay vì một bất ngờ trong hóa đơn.

Top comments (0)