Gemini 4 Argon berharga $2 per 1 juta token input dan $10 per 1 juta token output selama periode perkenalan. Setelah periode tersebut, tarifnya menjadi $4 untuk input dan $20 untuk output. Input yang di-cache mendapat diskon 95%: $0,10 per 1 juta token pada tarif perkenalan dan $0,20 setelahnya. Google belum menyatakan durasi periode perkenalan. Argon juga belum tersedia secara umum; saat ini model hanya diluncurkan kepada pembela siber Program Fairwind.
Postingan ini mengubah lembar harga tersebut menjadi angka anggaran yang bisa dipakai: perbandingan dengan tujuh model, empat skenario kerja, biaya per tugas dari evaluator pihak ketiga, serta kontrol biaya yang perlu disiapkan sebelum Argon tersedia. Untuk memahami modelnya, mulai dari apa itu Gemini 4 Argon; untuk status aksesnya, lihat apakah Gemini 4 Argon gratis. Anda dapat membangun asumsi biaya di Apidog menggunakan model yang tersedia hari ini, lalu mengganti nama model ketika Argon dirilis.
Lembar harga
Google menerbitkan harga di postingan peluncuran Gemini 4 Argon. Catatan kaki 1 menyatakan bahwa setelah periode perkenalan berakhir, harga $4 per 1 juta token input dan $20 per 1 juta token output akan berlaku.
| Gemini 4 Argon, per 1 juta token | Perkenalan | Standar setelah perkenalan |
|---|---|---|
| Input | $2,00 | $4,00 |
| Input yang di-cache, diskon 95% dari input | $0,10 | $0,20 |
| Output | $10,00 | $20,00 |
| Output maksimum per respons menurut Google | 1 juta token | 1 juta token |
| Biaya satu output penuh 1 juta token | $10,00 | $20,00 |
Tarif cache dihitung dari diskon 95% Google:
Tarif cache perkenalan = $2 × 0,05 = $0,10 per 1 juta token
Tarif cache standar = $4 × 0,05 = $0,20 per 1 juta token
Google belum menerbitkan jendela konteks input maupun ID model Argon. Google menyebut batas output mencapai 1 juta token, naik dari 64K token sebelumnya. Namun, setidaknya satu evaluator pihak ketiga, Vals AI, mencantumkan output maksimum 262K token untuk konfigurasi yang diuji.
Argon vs. model frontier dan Gemini saat ini
Semua harga berikut adalah per 1 juta token.
| Model | Input | Input di-cache | Output | Output maksimum |
|---|---|---|---|---|
| Gemini 4 Argon, perkenalan | $2 | $0,10 | $10 | 1 juta |
| Gemini 4 Argon, standar | $4 | $0,20 | $20 | 1 juta |
| GPT-6 Astra | $10 | $1 | $50 | 128.000 |
| Claude Opus 5.5 | $4 | $0,20 | $20 | 128K, 300K di Batch beta |
| Claude Sonnet 5.5 | $2 | $0,20 | $10 | 128K, 300K di Batch beta |
| GPT-6.1 Sol | $2 | $0,10 | $10 | 128.000 |
| Claude Fable 5.1 | $10 | $0,25 | $50 | 128K |
| gemini-3.1-pro-preview, prompt <=200K / >200K | $2 / $4 | $0,20 / $0,40 | $12 / $18 | 65.536 |
| gemini-3.8-flash, perkenalan / mulai 2027-01-01 | $0,75 / $1,50 | $0,075 / $0,15 | $3,75 / $7,50 | 65.536 |
Harga kompetitor berasal dari halaman vendor masing-masing: GPT-6 Astra OpenAI, harga Anthropic, dan harga Gemini API Google.
Poin penting untuk perencanaan biaya:
- Argon standar setara dengan Claude Opus 5.5. Keduanya berharga $4/$20 dengan input cache $0,20.
- Argon perkenalan setara dengan Claude Sonnet 5.5 dan GPT-6.1 Sol. Ketiganya berharga $2/$10, sementara tarif cache Argon perkenalan $0,10 sama dengan GPT-6.1 Sol.
- GPT-6 Astra dan Claude Fable 5.1 berharga 5x Argon perkenalan serta 2,5x Argon standar. Lihat juga harga Claude Fable 5.1.
- Output Argon pada masa perkenalan, $10, berada di bawah gemini-3.1-pro-preview, $12.
- Prompt panjang dapat mengubah total biaya secara signifikan. OpenAI mengenakan tarif lebih tinggi untuk prompt di atas 272K token input: 2x untuk input dan cache, serta 1,5x untuk output pada permintaan penuh. Gemini 3.1 Pro juga naik tarif di atas 200K token, sementara Anthropic tidak. Google belum menyatakan apakah Argon memiliki tingkat harga untuk prompt panjang.
Untuk membandingkan kemampuan model di luar harga, lihat Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5.
Token pemikiran ditagih sebagai output
Pada model Gemini saat ini, token pemikiran ditagih sebagai output. Dokumentasi pemikiran Google menyatakan bahwa harga respons adalah jumlah token output dan token pemikiran.
Google belum mendokumentasikan perilaku Argon secara spesifik, tetapi gunakan asumsi yang sama dalam anggaran Anda:
Token output yang ditagih = token jawaban + token pemikiran
Google menjalankan evaluasi Argon dengan pengaturan pemikiran tertinggi. Jadi, tarif $10 per 1 juta token output sebaiknya diperlakukan sebagai biaya gabungan untuk jawaban dan penalaran model.
Empat skenario kerja
Gunakan rumus dasar berikut:
biaya = (token / 1.000.000) × tarif per 1 juta token
Skenario 1 sampai 3 tidak mengasumsikan caching.
1. Panggilan API tipikal: 20K input, 5K output
Tarif perkenalan
Input = 20.000 / 1.000.000 × $2 = $0,04
Output = 5.000 / 1.000.000 × $10 = $0,05
Total = $0,09
Tarif standar
Input = $0,08
Output = $0,10
Total = $0,18
Jika aplikasi membuat 1.000 panggilan per hari:
| Tarif | Biaya per panggilan | Biaya per hari |
|---|---|---|
| Perkenalan | $0,09 | $90 |
| Standar | $0,18 | $180 |
Untuk prompt dan output yang sama, perkiraan biaya model lain:
- Claude Opus 5.5: $0,18
- GPT-6 Astra: $0,45, terdiri dari $0,20 input dan $0,25 output
- gemini-3.1-pro-preview: $0,10
- gemini-3.8-flash pada tarif perkenalan: sekitar $0,034
2. Giliran agen panjang: 200K input, 50K output
Tarif perkenalan
Input = 200.000 / 1.000.000 × $2 = $0,40
Output = 50.000 / 1.000.000 × $10 = $0,50
Total = $0,90
Tarif standar
Input = $0,80
Output = $1,00
Total = $1,80
Sebagai pembanding:
- GPT-6 Astra: $4,50, terdiri dari $2,00 input dan $2,50 output.
- gemini-3.1-pro-preview: $1,00, terdiri dari $0,40 input dan $0,60 output.
Namun, 200K token adalah batas tingkat harga Gemini 3.1 Pro. Prompt yang lebih panjang ditagih $4 input dan $18 output per 1 juta token. Jika Argon memakai pola tingkat serupa, biaya agen dengan konteks panjang dapat meningkat.
3. Satu respons maksimum: 1 juta token output
Output saja berharga:
Perkenalan = 1.000.000 / 1.000.000 × $10 = $10,00
Standar = 1.000.000 / 1.000.000 × $20 = $20,00
Jika Anda menambahkan prompt 100K token:
| Komponen | Perkenalan | Standar |
|---|---|---|
| Output 1 juta token | $10,00 | $20,00 |
| Input 100K token | $0,20 | $0,40 |
| Total | $10,20 | $20,40 |
Tidak ada model lain dalam tabel sebelumnya yang menghasilkan output sebesar ini dalam satu respons sinkron. Kompetitor dibatasi pada 128K token, sedangkan Gemini Pro sebelumnya dibatasi pada 65.536 token.
Pada batas output 262K yang dicantumkan Vals AI, satu respons penuh kira-kira berharga:
Perkenalan = 262.000 / 1.000.000 × $10 = $2,62
Standar = 262.000 / 1.000.000 × $20 = $5,24
Untuk konsekuensi implementasi seperti timeout, streaming, dan gateway, lihat 1 juta token output Gemini 4 Argon.
4. Prompt 500K token yang di-cache dan dipakai ulang 10 kali
Asumsikan Anda mengirim kode sumber atau kumpulan kontrak yang sama, sebesar 500K token, sebanyak 10 kali. Setiap panggilan menghasilkan 5K token output.
Asumsi:
- Panggilan pertama membayar input penuh untuk membangun cache.
- Sembilan panggilan berikutnya membaca cache.
- Output tetap ditagih penuh pada setiap panggilan.
| 10 panggilan: prompt 500K, output 5K per panggilan | Perkenalan | Standar |
|---|---|---|
| Input tanpa caching, 10 × 500K | $10,00 | $20,00 |
| Input di-cache, 1 penuh + 9 cache | $1,00 + 9 × $0,05 = $1,45 | $2,00 + 9 × $0,10 = $2,90 |
| Output, 10 × 5K | $0,50 | $1,00 |
| Total dengan caching | $1,95 | $3,90 |
| Total tanpa caching | $10,50 | $21,00 |
Dalam contoh ini, caching memangkas tagihan input sebesar 85,5%.
Tetap perhatikan dua hal:
- Google belum menyatakan apakah Argon mengenakan biaya penyimpanan cache. Sebagai pembanding, gemini-3.1-pro-preview menagih $4,50 per 1 juta token per jam. Menyimpan 500K token selama satu jam akan menambah $2,25.
- Prompt 500K token melewati ambang 200K pada Gemini 3.1 Pro.
Tarif cache standar Argon sama dengan $0,20 milik Claude Opus 5.5. Karena itu, logika titik impas dalam perhitungan biaya caching prompt Claude Opus 5.5 dapat digunakan sebagai referensi.
Harga per token bukan biaya per tugas
Tarif per token hanya memberi Anda biaya unit. Biaya aktual per tugas dipengaruhi oleh jumlah token yang dikonsumsi model untuk menyelesaikan pekerjaan.
Artificial Analysis mencantumkan biaya $1,99 per tugas untuk menjalankan Intelligence Index pada Gemini 4 Argon dengan pengaturan Tinggi dan harga perkenalan. The Decoder menempatkan pengujian yang sama pada $3,98 dengan harga standar.
Artificial Analysis memberi Argon skor 53, sama dengan GPT-6 Astra pada pengaturan maksimal, yang dicantumkan sebesar $3,26 per tugas.
Perbedaannya ada pada volume token:
Argon, Tinggi: sekitar 62K token output per tugas
Astra, Maks: sekitar 27K token output per tugas
Itu berarti Argon menggunakan sekitar 2,3x lebih banyak token output dalam pengujian tersebut.
Pada harga perkenalan:
Argon output = 62.000 / 1.000.000 × $10 = $0,62
Astra output = 27.000 / 1.000.000 × $50 = $1,35
Pada harga standar, angka tugas penuh Argon dari The Decoder, $3,98, berada di atas biaya $3,26 GPT-6 Astra dari Artificial Analysis, meskipun tarif standar Argon 60% lebih rendah daripada Astra.
Vals AI menunjukkan pola serupa. Vals mencantumkan:
| Model | Biaya per tes Vals Index |
|---|---|
| Gemini 4 Argon | $15,68 |
| Claude Opus 5.5 | $32,14 |
| Claude Sonnet 5.5 | $21,34 |
| GPT-6.1 Sol | $3,24 |
Vals mencantumkan Argon pada tarif standar $4/$20. Claude Sonnet 5.5 dan GPT-6.1 Sol memiliki harga per token yang sama atau sangat dekat dengan Argon perkenalan, tetapi biaya per tesnya tetap berbeda lebih dari 6x.
Kesimpulan: buat anggaran berdasarkan penggunaan token aplikasi Anda sendiri, bukan hanya kartu tarif model.
Kontrol biaya yang perlu disiapkan sebelum Argon diluncurkan
1. Batasi output
Pada generateContent, gunakan generationConfig.maxOutputTokens untuk menetapkan batas respons.
{
"generationConfig": {
"maxOutputTokens": 8000
}
}
Google menyatakan model baru akan diluncurkan melalui Interactions API. Saat dokumentasi Argon tersedia, gunakan parameter pembatas output yang setara di API tersebut.
Batas 1 juta token berarti satu panggilan dapat menghasilkan biaya output hingga $20 pada tarif standar. Jangan biarkan batas ini menjadi default aplikasi Anda.
2. Cache konten yang stabil
Prioritaskan caching untuk konten yang sama di banyak panggilan:
- instruksi sistem;
- skema JSON;
- definisi tool;
- dokumentasi referensi;
- kode sumber atau kontrak yang dipakai ulang.
Diskon 95% pada input cache paling berguna ketika konteks besar dipakai berulang kali.
3. Pilih tingkat pemikiran dengan sengaja
Google belum menerbitkan tingkat pemikiran Argon. Pada model saat ini:
-
gemini-3.1-pro-previewmenggunakanhighsebagai default; -
gemini-3.8-flashmenggunakanmediumsebagai default.
Ketika pengaturan Argon tersedia, uji kualitas dan biaya untuk tiap tingkat pada dataset Anda sendiri. Jangan selalu memakai tingkat pemikiran tertinggi tanpa mengukur dampaknya.
4. Tegaskan batas biaya dari usageMetadata
Setiap respons generateContent menyertakan usageMetadata. Gunakan data ini untuk menghitung biaya aktual setelah respons diterima.
Di Apidog:
- Simpan nama model dalam variabel lingkungan
GEMINI_MODEL. - Buat permintaan terhadap model yang tersedia, misalnya
gemini-3.8-flash. - Tambahkan skrip pasca-respons untuk membaca
usageMetadata. - Hitung biaya berdasarkan token input, token cache, output, dan token pemikiran.
- Gagalkan pengujian jika biaya melebihi batas yang ditetapkan.
- Saat ID Argon tersedia, cukup ubah nilai
GEMINI_MODELlalu jalankan ulang suite yang sama.
Gunakan rumus berikut:
biaya = input_tanpa_cache / 1.000.000 × tarif_input
+ input_cache / 1.000.000 × tarif_cache
+ (output + pemikiran) / 1.000.000 × tarif_output
Apa yang belum ditetapkan harganya oleh Google
Sebelum memakai Argon dalam produksi, pantau dokumentasi Google untuk informasi berikut:
- durasi periode perkenalan dan tanggal mulai tarif $4/$20;
- apakah prompt di atas 200K token mendapat tarif lebih mahal;
- harga Batch atau Flex;
- biaya penyimpanan cache;
- batas laju;
- ketersediaan tingkatan gratis.
Sebagai pembanding, Gemini 3.1 Pro memiliki Batch dan Flex dengan input $1/$2 serta output $6/$9, tetapi Google belum menyatakan apakah Argon akan memiliki opsi yang sama.
FAQ
Berapa biaya Gemini 4 Argon per juta token?
$2 untuk input dan $10 untuk output selama periode perkenalan. Setelahnya, $4 untuk input dan $20 untuk output. Input cache mendapat diskon 95%: $0,10 saat perkenalan dan $0,20 setelahnya.
Berapa lama harga perkenalan berlaku?
Google belum menyatakan durasi maupun tanggal akhirnya.
Apakah token pemikiran ditagih sebagai output?
Pada model Gemini saat ini, ya. Google belum mendokumentasikan aturan Argon secara spesifik.
Berapa biaya respons dengan output 1 juta token?
$10 pada harga perkenalan dan $20 pada harga standar, belum termasuk input.
Apakah Argon lebih murah daripada Claude Opus 5.5 atau GPT-6 Astra?
Per token, Argon standar setara dengan Opus 5.5 dan 60% lebih murah daripada Astra. Per tugas, hasilnya bergantung pada volume token. Artificial Analysis mengukur Argon menggunakan sekitar 2,3x token output Astra. Untuk model Gemini yang lebih murah saat ini, lihat harga Gemini 3.8 Flash.
Bisakah saya membayar Argon hari ini?
Belum. Argon hanya diluncurkan untuk mitra Program Fairwind. Pelanggan API berbayar dan Google AI Ultra akan menyusul tanpa tanggal yang diumumkan.
Anggarkan sekarang, ukur nanti
Kalikan volume token aplikasi Anda saat ini dengan dua tarif berikut:
Rentang perkenalan: input $2 / output $10 per 1 juta token
Rentang standar: input $4 / output $20 per 1 juta token
Setelah itu, siapkan pengukurannya sekarang:
- Unduh Apidog.
- Simpan model dalam variabel
GEMINI_MODEL. - Jalankan request terhadap
gemini-3.8-flash. - Tambahkan asersi biaya berbasis
usageMetadata. - Saat Google menerbitkan ID Argon, ubah satu variabel dan ukur biaya per panggilan nyata sejak hari pertama.

Top comments (0)