DEV Community

Cover image for Giá Gemini 4 Argon: $2/$10 ban đầu, $4/$20 sau đó và chi phí câu trả lời 1M token
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Giá Gemini 4 Argon: $2/$10 ban đầu, $4/$20 sau đó và chi phí câu trả lời 1M token

Gemini 4 Argon có giá 2 đô la cho 1 triệu token đầu vào và 10 đô la cho 1 triệu token đầu ra trong giai đoạn giới thiệu; sau đó giá sẽ là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm 95% so với đầu vào thông thường: 0,10 đô la cho mỗi 1 triệu token ở giá giới thiệu và 0,20 đô la sau đó. Google chưa công bố thời gian áp dụng giá giới thiệu. Argon đã được công bố nhưng chưa khả dụng rộng rãi; hiện chỉ được triển khai cho các chuyên gia an ninh mạng thuộc Chương trình Fairwind.

Dùng thử Apidog ngay hôm nay

Bài viết này chuyển bảng giá thành ngân sách triển khai: so sánh với bảy mô hình hiện có, tính chi phí cho bốn kịch bản thực tế, phân biệt giá/token với giá/tác vụ và thiết lập kiểm soát chi phí ngay từ bây giờ.

Để tìm hiểu mô hình, xem Gemini 4 Argon là gì. Để biết khả năng truy cập, xem Gemini 4 Argon có miễn phí không. Bạn có thể chuẩn bị kiểm thử chi phí trong Apidog với một mô hình đang gọi được hôm nay, rồi chỉ thay đổi ID mô hình khi Argon được mở quyền truy cập.

fe

Bảng giá

Google công bố giá trong bài đăng ra mắt Gemini 4 Argon. Chú thích 1 nêu rõ: sau khi giai đoạn giới thiệu kết thúc, mức giá 4 đô la cho 1 triệu token đầu vào và 20 đô la cho 1 triệu token đầu ra sẽ được áp dụng.

Gemini 4 Argon, mỗi 1 triệu token Giới thiệu Tiêu chuẩn (sau giới thiệu)
Đầu vào 2,00 đô la 4,00 đô la
Đầu vào được lưu trữ (giảm 95% giá đầu vào) 0,10 đô la 0,20 đô la
Đầu ra 10,00 đô la 20,00 đô la
Đầu ra tối đa mỗi phản hồi (Google) 1 triệu token 1 triệu token
Chi phí của một đầu ra 1 triệu token đầy đủ 10,00 đô la 20,00 đô la

Giá đầu vào được lưu trữ được tính theo quy tắc giảm 95% của Google:

Giới thiệu: 2,00 đô la × 0,05 = 0,10 đô la / 1M token
Tiêu chuẩn: 4,00 đô la × 0,05 = 0,20 đô la / 1M token
Enter fullscreen mode Exit fullscreen mode

Google chưa công bố cửa sổ ngữ cảnh đầu vào hoặc ID mô hình. Google cho biết giới hạn đầu ra là 1 triệu token, tăng từ 64K token trước đây. Tuy nhiên, Vals AI liệt kê đầu ra tối đa 262K token cho cấu hình họ đã thử nghiệm.

Argon so với các mô hình tiên tiến và Gemini hiện tại

Tất cả mức giá dưới đây được tính trên mỗi 1 triệu token.

Mô hình Đầu vào Đầu vào được lưu trữ Đầu ra Đầu ra tối đa
Gemini 4 Argon (giới thiệu) 2 đô la 0,10 đô la 10 đô la 1 triệu
Gemini 4 Argon (tiêu chuẩn) 4 đô la 0,20 đô la 20 đô la 1 triệu
GPT-6 Astra 10 đô la 1 đô la 50 đô la 128.000
Claude Opus 5.5 4 đô la 0,20 đô la 20 đô la 128K (300K trên Batch, beta)
Claude Sonnet 5.5 2 đô la 0,20 đô la 10 đô la 128K (300K trên Batch, beta)
GPT-6.1 Sol 2 đô la 0,10 đô la 10 đô la 128.000
Claude Fable 5.1 10 đô la 0,25 đô la 50 đô la 128K
gemini-3.1-pro-preview (lời nhắc <=200K / >200K) 2 đô la / 4 đô la 0,20 đô la / 0,40 đô la 12 đô la / 18 đô la 65.536
gemini-3.8-flash (giới thiệu / từ 2027-01-01) 0,75 đô la / 1,50 đô la 0,075 đô la / 0,15 đô la 3,75 đô la / 7,50 đô la 65.536

Nguồn giá đối thủ: GPT-6 Astra của OpenAI, bảng giá Anthropic và bảng giá API Gemini.

Các điểm cần dùng khi lập ngân sách:

  • Argon tiêu chuẩn tương đương Claude Opus 5.5: 4 đô la đầu vào, 20 đô la đầu ra và 0,20 đô la đầu vào được lưu trữ.
  • Argon giới thiệu tương đương Claude Sonnet 5.5 và GPT-6.1 Sol ở mức 2 đô la đầu vào và 10 đô la đầu ra.
  • GPT-6 Astra và Claude Fable 5.1 đắt gấp 5 lần Argon giới thiệu và gấp 2,5 lần Argon tiêu chuẩn theo giá/token. Xem thêm giá Claude Fable 5.1.
  • Đầu ra Argon ở giá giới thiệu thấp hơn gemini-3.1-pro-preview: 10 đô la thay vì 12 đô la cho mỗi 1 triệu token.
  • Lời nhắc dài có thể thay đổi chi phí thực tế. OpenAI tính giá cao hơn cho lời nhắc vượt 272K token đầu vào; Gemini 3.1 Pro tăng giá trên 200K token. Google chưa xác nhận Argon có cấp giá lời nhắc dài hay không.

Để so sánh cả năng lực lẫn giá, xem Gemini 4 Argon so với GPT-6 Astra so với Claude Opus 5.5.

Token suy nghĩ được tính phí như đầu ra

Trên các mô hình Gemini hiện tại, token suy nghĩ được tính như token đầu ra. Tài liệu về suy nghĩ của Google nêu rằng giá phản hồi là tổng token đầu ra và token suy nghĩ.

Google chưa tài liệu hóa riêng quy tắc này cho Argon, nhưng khi lập ngân sách bạn nên giả định:

token đầu ra bị tính phí = token phản hồi + token suy nghĩ
Enter fullscreen mode Exit fullscreen mode

Google đã chạy đánh giá Argon với các cài đặt suy nghĩ cao nhất. Vì vậy, mức “10 đô la cho 1 triệu token đầu ra” nên được hiểu là chi phí cho cả câu trả lời và quá trình suy luận.

Bốn kịch bản triển khai

Công thức cơ bản:

chi phí = (token / 1.000.000) × đơn giá mỗi 1M token
Enter fullscreen mode Exit fullscreen mode

Các kịch bản 1–3 giả định không sử dụng bộ nhớ đệm.

1. Cuộc gọi API điển hình: 20K đầu vào, 5K đầu ra

Giá giới thiệu

Đầu vào: 20.000 / 1.000.000 × 2 đô la = 0,04 đô la
Đầu ra:   5.000 / 1.000.000 × 10 đô la = 0,05 đô la
Tổng: 0,09 đô la
Enter fullscreen mode Exit fullscreen mode

Giá tiêu chuẩn

Đầu vào: 0,08 đô la
Đầu ra:  0,10 đô la
Tổng: 0,18 đô la
Enter fullscreen mode Exit fullscreen mode

Với 1.000 cuộc gọi mỗi ngày:

Mức giá Chi phí/ngày
Giới thiệu 90 đô la
Tiêu chuẩn 180 đô la

Để đối chiếu, cùng khối lượng này có giá:

  • Claude Opus 5.5: 0,18 đô la.
  • GPT-6 Astra: 0,45 đô la.
  • gemini-3.1-pro-preview: 0,10 đô la.
  • gemini-3.8-flash ở giá giới thiệu: khoảng 0,034 đô la.

2. Một lượt tác nhân dài: 200K đầu vào, 50K đầu ra

Giá giới thiệu

Đầu vào: 200.000 / 1.000.000 × 2 đô la = 0,40 đô la
Đầu ra:   50.000 / 1.000.000 × 10 đô la = 0,50 đô la
Tổng: 0,90 đô la
Enter fullscreen mode Exit fullscreen mode

Giá tiêu chuẩn

Đầu vào: 0,80 đô la
Đầu ra:  1,00 đô la
Tổng: 1,80 đô la
Enter fullscreen mode Exit fullscreen mode

GPT-6 Astra sẽ có giá 4,50 đô la cho cùng tác vụ: 2,00 đô la đầu vào và 2,50 đô la đầu ra.

gemini-3.1-pro-preview có giá 1,00 đô la ở đúng ngưỡng 200K token, nhưng lời nhắc dài hơn sẽ chuyển sang mức 4 đô la đầu vào và 18 đô la đầu ra. Nếu Argon có một cấp tương tự, các lượt tác nhân dài hơn có thể đắt hơn đáng kể.

3. Phản hồi tối đa: 1 triệu token đầu ra

Chỉ phần đầu ra đã có giá:

Giới thiệu: 1.000.000 / 1.000.000 × 10 đô la = 10,00 đô la
Tiêu chuẩn: 1.000.000 / 1.000.000 × 20 đô la = 20,00 đô la
Enter fullscreen mode Exit fullscreen mode

Nếu thêm lời nhắc 100K token:

Thành phần Giới thiệu Tiêu chuẩn
Đầu vào 100K 0,20 đô la 0,40 đô la
Đầu ra 1M 10,00 đô la 20,00 đô la
Tổng 10,20 đô la 20,40 đô la

Không mô hình nào khác trong bảng có thể tạo đầu ra này trong một phản hồi đồng bộ: các đối thủ giới hạn ở 128K, còn Gemini Pro trước đó ở 65.536 token.

Nếu giới hạn thực tế là 262K như Vals AI liệt kê, đầu ra đầy đủ sẽ tốn khoảng:

  • 2,62 đô la ở giá giới thiệu.
  • 5,24 đô la ở giá tiêu chuẩn.

Các vấn đề kỹ thuật như timeout, streaming và gateway được trình bày trong 1 triệu token đầu ra của Gemini 4 Argon.

4. Lời nhắc 500K token được lưu trữ và tái sử dụng 10 lần

Giả sử bạn gửi cùng cơ sở mã hoặc bộ hợp đồng 500K token mười lần, mỗi lần nhận 5K token đầu ra. Cuộc gọi đầu tiên trả toàn bộ giá đầu vào để tạo bộ nhớ đệm; chín cuộc gọi sau đọc từ bộ nhớ đệm.

10 cuộc gọi, lời nhắc 500K, 5K đầu ra mỗi lần Giới thiệu Tiêu chuẩn
Đầu vào không có bộ nhớ đệm (10 × 500K) 10,00 đô la 20,00 đô la
Đầu vào có bộ nhớ đệm (1 đầy đủ + 9 được lưu trữ) 1,00 đô la + 9 × 0,05 đô la = 1,45 đô la 2,00 đô la + 9 × 0,10 đô la = 2,90 đô la
Đầu ra (10 × 5K) 0,50 đô la 1,00 đô la
Tổng với bộ nhớ đệm 1,95 đô la 3,90 đô la
Tổng không có bộ nhớ đệm 10,50 đô la 21,00 đô la

Bộ nhớ đệm giảm hóa đơn đầu vào 85,5%.

Tuy nhiên, cần tính đến hai điểm chưa rõ:

  1. Google chưa công bố Argon có phí lưu trữ bộ nhớ đệm hay không. Ví dụ, gemini-3.1-pro-preview tính 4,50 đô la cho mỗi 1 triệu token mỗi giờ; lưu 500K token trong một giờ sẽ thêm 2,25 đô la.
  2. Lời nhắc 500K token đã vượt ngưỡng 200K của Gemini 3.1 Pro.

Giá đầu vào được lưu trữ tiêu chuẩn của Argon bằng Claude Opus 5.5, vì vậy logic hòa vốn trong phép tính chi phí lưu trữ lời nhắc Claude Opus 5.5 vẫn có thể áp dụng.

Giá mỗi token không phải là chi phí mỗi tác vụ

Đừng lập ngân sách chỉ từ bảng giá. Chi phí thực tế phụ thuộc vào lượng token mô hình sử dụng để hoàn thành tác vụ.

Artificial Analysis liệt kê chi phí 1,99 đô la mỗi tác vụ để chạy Chỉ số Thông minh trên Gemini 4 Argon ở cấu hình Cao với giá giới thiệu. The Decoder đưa ra chi phí 3,98 đô la cho cùng lần chạy ở giá tiêu chuẩn.

Artificial Analysis chấm Argon 53 điểm, bằng GPT-6 Astra ở cấu hình tối đa. Tuy nhiên:

  • Argon dùng khoảng 62K token đầu ra cho mỗi tác vụ.
  • Astra dùng khoảng 27K token đầu ra cho mỗi tác vụ.
  • Argon do đó dùng đầu ra nhiều hơn khoảng 2,3 lần.

Phần chi phí đầu ra ở giá giới thiệu:

Argon: 62.000 / 1.000.000 × 10 đô la = 0,62 đô la
Astra: 27.000 / 1.000.000 × 50 đô la = 1,35 đô la
Enter fullscreen mode Exit fullscreen mode

Ở giá tiêu chuẩn, chi phí toàn tác vụ của Argon là 3,98 đô la, cao hơn 3,26 đô la mà Artificial Analysis ghi nhận cho Astra ở cấu hình tối đa, dù đơn giá tiêu chuẩn của Argon thấp hơn Astra 60%.

Vals AI cũng cho thấy cùng xu hướng:

Mô hình Chi phí mỗi thử nghiệm trên Chỉ số Vals
Gemini 4 Argon 15,68 đô la
Claude Opus 5.5 32,14 đô la
Claude Sonnet 5.5 21,34 đô la
GPT-6.1 Sol 3,24 đô la

Sonnet 5.5 và GPT-6.1 Sol có cùng đơn giá giới thiệu với Argon trên giấy tờ, nhưng chi phí mỗi thử nghiệm chênh lệch hơn 6 lần.

Kết luận: lập ngân sách theo telemetry token của ứng dụng, không theo bảng giá đơn thuần.

Kiểm soát chi phí cần thiết lập trước khi Argon ra mắt

1. Giới hạn đầu ra

Với generateContent, dùng generationConfig.maxOutputTokens để chặn đầu ra vượt ngân sách.

{
  "generationConfig": {
    "maxOutputTokens": 8192
  }
}
Enter fullscreen mode Exit fullscreen mode

Google cho biết các mô hình mới sẽ ra mắt trên API Interactions, vì vậy hãy cấu hình giới hạn tương đương ngay khi tài liệu Argon được phát hành.

Giới hạn kỹ thuật 1 triệu token tương đương rủi ro tối đa 20 đô la cho riêng đầu ra trong một cuộc gọi ở giá tiêu chuẩn.

2. Lưu trữ nội dung ổn định

Đưa các phần lặp lại vào bộ nhớ đệm:

  • Hướng dẫn hệ thống.
  • Schema JSON hoặc OpenAPI.
  • Tài liệu tham khảo.
  • Cơ sở mã.
  • Bộ hợp đồng hoặc quy tắc nghiệp vụ.

Đây là loại nội dung hưởng lợi trực tiếp từ mức giảm giá 95% của token đầu vào được lưu trữ.

3. Chọn mức suy nghĩ có chủ đích

Google chưa công bố các cấp suy nghĩ của Argon. Hiện tại:

  • gemini-3.1-pro-preview mặc định ở mức high.
  • gemini-3.8-flash mặc định ở mức medium.

Khi Argon có tài liệu chính thức, hãy benchmark ít nhất hai mức suy nghĩ trên tập kiểm thử của bạn. Chỉ dùng mức cao nếu nó cải thiện rõ ràng chất lượng, tỷ lệ thành công công cụ hoặc độ chính xác.

4. Xác nhận mức sử dụng và chi phí trong CI

Mỗi phản hồi generateContent kết thúc bằng usageMetadata. Lưu ID mô hình vào biến môi trường để thay đổi mô hình mà không sửa request.

GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Trong Apidog, tạo request dùng biến {{GEMINI_MODEL}}, sau đó thêm assertion sau phản hồi để:

  1. Đọc token đầu vào, token đầu vào được lưu trữ, token đầu ra và token suy nghĩ từ usageMetadata.
  2. Tính chi phí theo đơn giá hiện tại.
  3. Làm thất bại kiểm thử nếu chi phí vượt ngân sách cho mỗi request.

Công thức:

chi_phi = dau_vao_khong_cache / 1.000.000 x ty_le_dau_vao
     + dau_vao_cache   / 1.000.000 x ty_le_cache
     + (dau_ra + suy_nghi) / 1.000.000 x ty_le_dau_ra
Enter fullscreen mode Exit fullscreen mode

Quy trình triển khai thực tế:

1. Chạy bộ kiểm thử với gemini-3.8-flash ngay hôm nay.
2. Ghi nhận usageMetadata cho từng loại tác vụ.
3. Đặt ngưỡng chi phí cho mỗi request và mỗi pipeline.
4. Khi Google công bố ID Argon, chỉ đổi GEMINI_MODEL.
5. Chạy lại cùng bộ kiểm thử để có chi phí thực tế từ ngày đầu tiên.
Enter fullscreen mode Exit fullscreen mode

Những gì Google chưa định giá

Các thông tin vẫn chưa được công bố gồm:

  • Thời gian giai đoạn giá giới thiệu và ngày bắt đầu mức 4 đô la/20 đô la.
  • Việc lời nhắc trên 200K token có bị tính phí cao hơn hay không.
  • Giá Batch hoặc Flex.
  • Phí lưu trữ bộ nhớ đệm.
  • Giới hạn tốc độ.
  • Khả năng có cấp miễn phí.

Để tham chiếu, Gemini 3.1 Pro có Batch và Flex ở mức 1 đô la/2 đô la đầu vào và 6 đô la/9 đô la đầu ra.

Câu hỏi thường gặp

Gemini 4 Argon có giá bao nhiêu cho mỗi triệu token?

2 đô la đầu vào và 10 đô la đầu ra trong giai đoạn giới thiệu; sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm 95%, còn 0,10 đô la rồi 0,20 đô la.

Giá giới thiệu kéo dài bao lâu?

Google chưa công bố ngày kết thúc hoặc thời hạn cụ thể.

Token suy nghĩ có được tính phí như đầu ra không?

Với các mô hình Gemini hiện tại, có. Google chưa tài liệu hóa quy tắc riêng cho Argon.

Một phản hồi 1 triệu token đầu ra có giá bao nhiêu?

10 đô la ở giá giới thiệu và 20 đô la ở giá tiêu chuẩn, chưa gồm đầu vào.

Argon có rẻ hơn Claude Opus 5.5 hoặc GPT-6 Astra không?

Theo token, Argon tiêu chuẩn bằng Opus 5.5 và thấp hơn Astra 60%. Theo tác vụ, câu trả lời phụ thuộc vào lượng token mô hình tiêu thụ. Artificial Analysis đo Argon dùng khoảng 2,3 lần token đầu ra của Astra. Nếu cần một Gemini rẻ hơn hiện nay, xem giá Gemini 3.8 Flash.

Tôi có thể trả tiền để dùng Argon ngay hôm nay không?

Không. Argon hiện chỉ được triển khai cho đối tác của Chương trình Fairwind. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ được tiếp theo, nhưng chưa có ngày cụ thể.

Lập ngân sách ngay, đo lường sau

Bắt đầu bằng cách nhân lượng token lưu lượng hiện tại của bạn với cả hai mức giá:

Giá giới thiệu:
- Đầu vào: 2 đô la / 1M token
- Đầu ra: 10 đô la / 1M token

Giá tiêu chuẩn:
- Đầu vào: 4 đô la / 1M token
- Đầu ra: 20 đô la / 1M token
Enter fullscreen mode Exit fullscreen mode

Sau đó xây dựng phép đo thay vì chờ Argon khả dụng:

  1. Tải xuống Apidog.
  2. Lưu request hiện tại của bạn cho gemini-3.8-flash.
  3. Dùng GEMINI_MODEL làm biến môi trường.
  4. Thêm assertion tính chi phí từ usageMetadata.
  5. Đặt ngưỡng chi phí và chạy trong CI.
  6. Khi Google công bố ID Argon, thay đổi một biến và chạy lại bộ kiểm thử.

Kết quả là bạn có chi phí thực tế trên lưu lượng của mình ngay từ ngày đầu tiên, thay vì chỉ ước lượng từ bảng giá.

Top comments (0)