Gemini 4 Argon có giá 2 đô la cho 1 triệu token đầu vào và 10 đô la cho 1 triệu token đầu ra trong giai đoạn giới thiệu; sau đó giá sẽ là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm 95% so với đầu vào thông thường: 0,10 đô la cho mỗi 1 triệu token ở giá giới thiệu và 0,20 đô la sau đó. Google chưa công bố thời gian áp dụng giá giới thiệu. Argon đã được công bố nhưng chưa khả dụng rộng rãi; hiện chỉ được triển khai cho các chuyên gia an ninh mạng thuộc Chương trình Fairwind.
Bài viết này chuyển bảng giá thành ngân sách triển khai: so sánh với bảy mô hình hiện có, tính chi phí cho bốn kịch bản thực tế, phân biệt giá/token với giá/tác vụ và thiết lập kiểm soát chi phí ngay từ bây giờ.
Để tìm hiểu mô hình, xem Gemini 4 Argon là gì. Để biết khả năng truy cập, xem Gemini 4 Argon có miễn phí không. Bạn có thể chuẩn bị kiểm thử chi phí trong Apidog với một mô hình đang gọi được hôm nay, rồi chỉ thay đổi ID mô hình khi Argon được mở quyền truy cập.
Bảng giá
Google công bố giá trong bài đăng ra mắt Gemini 4 Argon. Chú thích 1 nêu rõ: sau khi giai đoạn giới thiệu kết thúc, mức giá 4 đô la cho 1 triệu token đầu vào và 20 đô la cho 1 triệu token đầu ra sẽ được áp dụng.
| Gemini 4 Argon, mỗi 1 triệu token | Giới thiệu | Tiêu chuẩn (sau giới thiệu) |
|---|---|---|
| Đầu vào | 2,00 đô la | 4,00 đô la |
| Đầu vào được lưu trữ (giảm 95% giá đầu vào) | 0,10 đô la | 0,20 đô la |
| Đầu ra | 10,00 đô la | 20,00 đô la |
| Đầu ra tối đa mỗi phản hồi (Google) | 1 triệu token | 1 triệu token |
| Chi phí của một đầu ra 1 triệu token đầy đủ | 10,00 đô la | 20,00 đô la |
Giá đầu vào được lưu trữ được tính theo quy tắc giảm 95% của Google:
Giới thiệu: 2,00 đô la × 0,05 = 0,10 đô la / 1M token
Tiêu chuẩn: 4,00 đô la × 0,05 = 0,20 đô la / 1M token
Google chưa công bố cửa sổ ngữ cảnh đầu vào hoặc ID mô hình. Google cho biết giới hạn đầu ra là 1 triệu token, tăng từ 64K token trước đây. Tuy nhiên, Vals AI liệt kê đầu ra tối đa 262K token cho cấu hình họ đã thử nghiệm.
Argon so với các mô hình tiên tiến và Gemini hiện tại
Tất cả mức giá dưới đây được tính trên mỗi 1 triệu token.
| Mô hình | Đầu vào | Đầu vào được lưu trữ | Đầu ra | Đầu ra tối đa |
|---|---|---|---|---|
| Gemini 4 Argon (giới thiệu) | 2 đô la | 0,10 đô la | 10 đô la | 1 triệu |
| Gemini 4 Argon (tiêu chuẩn) | 4 đô la | 0,20 đô la | 20 đô la | 1 triệu |
| GPT-6 Astra | 10 đô la | 1 đô la | 50 đô la | 128.000 |
| Claude Opus 5.5 | 4 đô la | 0,20 đô la | 20 đô la | 128K (300K trên Batch, beta) |
| Claude Sonnet 5.5 | 2 đô la | 0,20 đô la | 10 đô la | 128K (300K trên Batch, beta) |
| GPT-6.1 Sol | 2 đô la | 0,10 đô la | 10 đô la | 128.000 |
| Claude Fable 5.1 | 10 đô la | 0,25 đô la | 50 đô la | 128K |
| gemini-3.1-pro-preview (lời nhắc <=200K / >200K) | 2 đô la / 4 đô la | 0,20 đô la / 0,40 đô la | 12 đô la / 18 đô la | 65.536 |
| gemini-3.8-flash (giới thiệu / từ 2027-01-01) | 0,75 đô la / 1,50 đô la | 0,075 đô la / 0,15 đô la | 3,75 đô la / 7,50 đô la | 65.536 |
Nguồn giá đối thủ: GPT-6 Astra của OpenAI, bảng giá Anthropic và bảng giá API Gemini.
Các điểm cần dùng khi lập ngân sách:
- Argon tiêu chuẩn tương đương Claude Opus 5.5: 4 đô la đầu vào, 20 đô la đầu ra và 0,20 đô la đầu vào được lưu trữ.
- Argon giới thiệu tương đương Claude Sonnet 5.5 và GPT-6.1 Sol ở mức 2 đô la đầu vào và 10 đô la đầu ra.
- GPT-6 Astra và Claude Fable 5.1 đắt gấp 5 lần Argon giới thiệu và gấp 2,5 lần Argon tiêu chuẩn theo giá/token. Xem thêm giá Claude Fable 5.1.
- Đầu ra Argon ở giá giới thiệu thấp hơn gemini-3.1-pro-preview: 10 đô la thay vì 12 đô la cho mỗi 1 triệu token.
- Lời nhắc dài có thể thay đổi chi phí thực tế. OpenAI tính giá cao hơn cho lời nhắc vượt 272K token đầu vào; Gemini 3.1 Pro tăng giá trên 200K token. Google chưa xác nhận Argon có cấp giá lời nhắc dài hay không.
Để so sánh cả năng lực lẫn giá, xem Gemini 4 Argon so với GPT-6 Astra so với Claude Opus 5.5.
Token suy nghĩ được tính phí như đầu ra
Trên các mô hình Gemini hiện tại, token suy nghĩ được tính như token đầu ra. Tài liệu về suy nghĩ của Google nêu rằng giá phản hồi là tổng token đầu ra và token suy nghĩ.
Google chưa tài liệu hóa riêng quy tắc này cho Argon, nhưng khi lập ngân sách bạn nên giả định:
token đầu ra bị tính phí = token phản hồi + token suy nghĩ
Google đã chạy đánh giá Argon với các cài đặt suy nghĩ cao nhất. Vì vậy, mức “10 đô la cho 1 triệu token đầu ra” nên được hiểu là chi phí cho cả câu trả lời và quá trình suy luận.
Bốn kịch bản triển khai
Công thức cơ bản:
chi phí = (token / 1.000.000) × đơn giá mỗi 1M token
Các kịch bản 1–3 giả định không sử dụng bộ nhớ đệm.
1. Cuộc gọi API điển hình: 20K đầu vào, 5K đầu ra
Giá giới thiệu
Đầu vào: 20.000 / 1.000.000 × 2 đô la = 0,04 đô la
Đầu ra: 5.000 / 1.000.000 × 10 đô la = 0,05 đô la
Tổng: 0,09 đô la
Giá tiêu chuẩn
Đầu vào: 0,08 đô la
Đầu ra: 0,10 đô la
Tổng: 0,18 đô la
Với 1.000 cuộc gọi mỗi ngày:
| Mức giá | Chi phí/ngày |
|---|---|
| Giới thiệu | 90 đô la |
| Tiêu chuẩn | 180 đô la |
Để đối chiếu, cùng khối lượng này có giá:
- Claude Opus 5.5: 0,18 đô la.
- GPT-6 Astra: 0,45 đô la.
- gemini-3.1-pro-preview: 0,10 đô la.
- gemini-3.8-flash ở giá giới thiệu: khoảng 0,034 đô la.
2. Một lượt tác nhân dài: 200K đầu vào, 50K đầu ra
Giá giới thiệu
Đầu vào: 200.000 / 1.000.000 × 2 đô la = 0,40 đô la
Đầu ra: 50.000 / 1.000.000 × 10 đô la = 0,50 đô la
Tổng: 0,90 đô la
Giá tiêu chuẩn
Đầu vào: 0,80 đô la
Đầu ra: 1,00 đô la
Tổng: 1,80 đô la
GPT-6 Astra sẽ có giá 4,50 đô la cho cùng tác vụ: 2,00 đô la đầu vào và 2,50 đô la đầu ra.
gemini-3.1-pro-preview có giá 1,00 đô la ở đúng ngưỡng 200K token, nhưng lời nhắc dài hơn sẽ chuyển sang mức 4 đô la đầu vào và 18 đô la đầu ra. Nếu Argon có một cấp tương tự, các lượt tác nhân dài hơn có thể đắt hơn đáng kể.
3. Phản hồi tối đa: 1 triệu token đầu ra
Chỉ phần đầu ra đã có giá:
Giới thiệu: 1.000.000 / 1.000.000 × 10 đô la = 10,00 đô la
Tiêu chuẩn: 1.000.000 / 1.000.000 × 20 đô la = 20,00 đô la
Nếu thêm lời nhắc 100K token:
| Thành phần | Giới thiệu | Tiêu chuẩn |
|---|---|---|
| Đầu vào 100K | 0,20 đô la | 0,40 đô la |
| Đầu ra 1M | 10,00 đô la | 20,00 đô la |
| Tổng | 10,20 đô la | 20,40 đô la |
Không mô hình nào khác trong bảng có thể tạo đầu ra này trong một phản hồi đồng bộ: các đối thủ giới hạn ở 128K, còn Gemini Pro trước đó ở 65.536 token.
Nếu giới hạn thực tế là 262K như Vals AI liệt kê, đầu ra đầy đủ sẽ tốn khoảng:
- 2,62 đô la ở giá giới thiệu.
- 5,24 đô la ở giá tiêu chuẩn.
Các vấn đề kỹ thuật như timeout, streaming và gateway được trình bày trong 1 triệu token đầu ra của Gemini 4 Argon.
4. Lời nhắc 500K token được lưu trữ và tái sử dụng 10 lần
Giả sử bạn gửi cùng cơ sở mã hoặc bộ hợp đồng 500K token mười lần, mỗi lần nhận 5K token đầu ra. Cuộc gọi đầu tiên trả toàn bộ giá đầu vào để tạo bộ nhớ đệm; chín cuộc gọi sau đọc từ bộ nhớ đệm.
| 10 cuộc gọi, lời nhắc 500K, 5K đầu ra mỗi lần | Giới thiệu | Tiêu chuẩn |
|---|---|---|
| Đầu vào không có bộ nhớ đệm (10 × 500K) | 10,00 đô la | 20,00 đô la |
| Đầu vào có bộ nhớ đệm (1 đầy đủ + 9 được lưu trữ) | 1,00 đô la + 9 × 0,05 đô la = 1,45 đô la | 2,00 đô la + 9 × 0,10 đô la = 2,90 đô la |
| Đầu ra (10 × 5K) | 0,50 đô la | 1,00 đô la |
| Tổng với bộ nhớ đệm | 1,95 đô la | 3,90 đô la |
| Tổng không có bộ nhớ đệm | 10,50 đô la | 21,00 đô la |
Bộ nhớ đệm giảm hóa đơn đầu vào 85,5%.
Tuy nhiên, cần tính đến hai điểm chưa rõ:
- Google chưa công bố Argon có phí lưu trữ bộ nhớ đệm hay không. Ví dụ, gemini-3.1-pro-preview tính 4,50 đô la cho mỗi 1 triệu token mỗi giờ; lưu 500K token trong một giờ sẽ thêm 2,25 đô la.
- Lời nhắc 500K token đã vượt ngưỡng 200K của Gemini 3.1 Pro.
Giá đầu vào được lưu trữ tiêu chuẩn của Argon bằng Claude Opus 5.5, vì vậy logic hòa vốn trong phép tính chi phí lưu trữ lời nhắc Claude Opus 5.5 vẫn có thể áp dụng.
Giá mỗi token không phải là chi phí mỗi tác vụ
Đừng lập ngân sách chỉ từ bảng giá. Chi phí thực tế phụ thuộc vào lượng token mô hình sử dụng để hoàn thành tác vụ.
Artificial Analysis liệt kê chi phí 1,99 đô la mỗi tác vụ để chạy Chỉ số Thông minh trên Gemini 4 Argon ở cấu hình Cao với giá giới thiệu. The Decoder đưa ra chi phí 3,98 đô la cho cùng lần chạy ở giá tiêu chuẩn.
Artificial Analysis chấm Argon 53 điểm, bằng GPT-6 Astra ở cấu hình tối đa. Tuy nhiên:
- Argon dùng khoảng 62K token đầu ra cho mỗi tác vụ.
- Astra dùng khoảng 27K token đầu ra cho mỗi tác vụ.
- Argon do đó dùng đầu ra nhiều hơn khoảng 2,3 lần.
Phần chi phí đầu ra ở giá giới thiệu:
Argon: 62.000 / 1.000.000 × 10 đô la = 0,62 đô la
Astra: 27.000 / 1.000.000 × 50 đô la = 1,35 đô la
Ở giá tiêu chuẩn, chi phí toàn tác vụ của Argon là 3,98 đô la, cao hơn 3,26 đô la mà Artificial Analysis ghi nhận cho Astra ở cấu hình tối đa, dù đơn giá tiêu chuẩn của Argon thấp hơn Astra 60%.
Vals AI cũng cho thấy cùng xu hướng:
| Mô hình | Chi phí mỗi thử nghiệm trên Chỉ số Vals |
|---|---|
| Gemini 4 Argon | 15,68 đô la |
| Claude Opus 5.5 | 32,14 đô la |
| Claude Sonnet 5.5 | 21,34 đô la |
| GPT-6.1 Sol | 3,24 đô la |
Sonnet 5.5 và GPT-6.1 Sol có cùng đơn giá giới thiệu với Argon trên giấy tờ, nhưng chi phí mỗi thử nghiệm chênh lệch hơn 6 lần.
Kết luận: lập ngân sách theo telemetry token của ứng dụng, không theo bảng giá đơn thuần.
Kiểm soát chi phí cần thiết lập trước khi Argon ra mắt
1. Giới hạn đầu ra
Với generateContent, dùng generationConfig.maxOutputTokens để chặn đầu ra vượt ngân sách.
{
"generationConfig": {
"maxOutputTokens": 8192
}
}
Google cho biết các mô hình mới sẽ ra mắt trên API Interactions, vì vậy hãy cấu hình giới hạn tương đương ngay khi tài liệu Argon được phát hành.
Giới hạn kỹ thuật 1 triệu token tương đương rủi ro tối đa 20 đô la cho riêng đầu ra trong một cuộc gọi ở giá tiêu chuẩn.
2. Lưu trữ nội dung ổn định
Đưa các phần lặp lại vào bộ nhớ đệm:
- Hướng dẫn hệ thống.
- Schema JSON hoặc OpenAPI.
- Tài liệu tham khảo.
- Cơ sở mã.
- Bộ hợp đồng hoặc quy tắc nghiệp vụ.
Đây là loại nội dung hưởng lợi trực tiếp từ mức giảm giá 95% của token đầu vào được lưu trữ.
3. Chọn mức suy nghĩ có chủ đích
Google chưa công bố các cấp suy nghĩ của Argon. Hiện tại:
-
gemini-3.1-pro-previewmặc định ở mứchigh. -
gemini-3.8-flashmặc định ở mứcmedium.
Khi Argon có tài liệu chính thức, hãy benchmark ít nhất hai mức suy nghĩ trên tập kiểm thử của bạn. Chỉ dùng mức cao nếu nó cải thiện rõ ràng chất lượng, tỷ lệ thành công công cụ hoặc độ chính xác.
4. Xác nhận mức sử dụng và chi phí trong CI
Mỗi phản hồi generateContent kết thúc bằng usageMetadata. Lưu ID mô hình vào biến môi trường để thay đổi mô hình mà không sửa request.
GEMINI_MODEL=gemini-3.8-flash
Trong Apidog, tạo request dùng biến {{GEMINI_MODEL}}, sau đó thêm assertion sau phản hồi để:
- Đọc token đầu vào, token đầu vào được lưu trữ, token đầu ra và token suy nghĩ từ
usageMetadata. - Tính chi phí theo đơn giá hiện tại.
- Làm thất bại kiểm thử nếu chi phí vượt ngân sách cho mỗi request.
Công thức:
chi_phi = dau_vao_khong_cache / 1.000.000 x ty_le_dau_vao
+ dau_vao_cache / 1.000.000 x ty_le_cache
+ (dau_ra + suy_nghi) / 1.000.000 x ty_le_dau_ra
Quy trình triển khai thực tế:
1. Chạy bộ kiểm thử với gemini-3.8-flash ngay hôm nay.
2. Ghi nhận usageMetadata cho từng loại tác vụ.
3. Đặt ngưỡng chi phí cho mỗi request và mỗi pipeline.
4. Khi Google công bố ID Argon, chỉ đổi GEMINI_MODEL.
5. Chạy lại cùng bộ kiểm thử để có chi phí thực tế từ ngày đầu tiên.
Những gì Google chưa định giá
Các thông tin vẫn chưa được công bố gồm:
- Thời gian giai đoạn giá giới thiệu và ngày bắt đầu mức 4 đô la/20 đô la.
- Việc lời nhắc trên 200K token có bị tính phí cao hơn hay không.
- Giá Batch hoặc Flex.
- Phí lưu trữ bộ nhớ đệm.
- Giới hạn tốc độ.
- Khả năng có cấp miễn phí.
Để tham chiếu, Gemini 3.1 Pro có Batch và Flex ở mức 1 đô la/2 đô la đầu vào và 6 đô la/9 đô la đầu ra.
Câu hỏi thường gặp
Gemini 4 Argon có giá bao nhiêu cho mỗi triệu token?
2 đô la đầu vào và 10 đô la đầu ra trong giai đoạn giới thiệu; sau đó là 4 đô la và 20 đô la. Đầu vào được lưu trữ giảm 95%, còn 0,10 đô la rồi 0,20 đô la.
Giá giới thiệu kéo dài bao lâu?
Google chưa công bố ngày kết thúc hoặc thời hạn cụ thể.
Token suy nghĩ có được tính phí như đầu ra không?
Với các mô hình Gemini hiện tại, có. Google chưa tài liệu hóa quy tắc riêng cho Argon.
Một phản hồi 1 triệu token đầu ra có giá bao nhiêu?
10 đô la ở giá giới thiệu và 20 đô la ở giá tiêu chuẩn, chưa gồm đầu vào.
Argon có rẻ hơn Claude Opus 5.5 hoặc GPT-6 Astra không?
Theo token, Argon tiêu chuẩn bằng Opus 5.5 và thấp hơn Astra 60%. Theo tác vụ, câu trả lời phụ thuộc vào lượng token mô hình tiêu thụ. Artificial Analysis đo Argon dùng khoảng 2,3 lần token đầu ra của Astra. Nếu cần một Gemini rẻ hơn hiện nay, xem giá Gemini 3.8 Flash.
Tôi có thể trả tiền để dùng Argon ngay hôm nay không?
Không. Argon hiện chỉ được triển khai cho đối tác của Chương trình Fairwind. Khách hàng API trả phí và người đăng ký Google AI Ultra sẽ được tiếp theo, nhưng chưa có ngày cụ thể.
Lập ngân sách ngay, đo lường sau
Bắt đầu bằng cách nhân lượng token lưu lượng hiện tại của bạn với cả hai mức giá:
Giá giới thiệu:
- Đầu vào: 2 đô la / 1M token
- Đầu ra: 10 đô la / 1M token
Giá tiêu chuẩn:
- Đầu vào: 4 đô la / 1M token
- Đầu ra: 20 đô la / 1M token
Sau đó xây dựng phép đo thay vì chờ Argon khả dụng:
- Tải xuống Apidog.
- Lưu request hiện tại của bạn cho
gemini-3.8-flash. - Dùng
GEMINI_MODELlàm biến môi trường. - Thêm assertion tính chi phí từ
usageMetadata. - Đặt ngưỡng chi phí và chạy trong CI.
- Khi Google công bố ID Argon, thay đổi một biến và chạy lại bộ kiểm thử.
Kết quả là bạn có chi phí thực tế trên lưu lượng của mình ngay từ ngày đầu tiên, thay vì chỉ ước lượng từ bảng giá.

Top comments (0)