DEV Community

Cover image for Harga Gemini 4 Argon: Awal $2/$10, Setelahnya $4/$20, dan Biaya Jawaban 1 Juta Token
Walse
Walse

Posted on Originally published at apidog.com

Harga Gemini 4 Argon: Awal $2/$10, Setelahnya $4/$20, dan Biaya Jawaban 1 Juta Token

Gemini 4 Argon berharga $2 per 1 juta token input dan $10 per 1 juta token output selama periode perkenalan. Setelah periode tersebut, tarifnya menjadi $4 untuk input dan $20 untuk output. Input yang di-cache mendapat diskon 95%: $0,10 per 1 juta token pada tarif perkenalan dan $0,20 setelahnya. Google belum menyatakan durasi periode perkenalan. Argon juga belum tersedia secara umum; saat ini model hanya diluncurkan kepada pembela siber Program Fairwind.

Coba Apidog hari ini

Postingan ini mengubah lembar harga tersebut menjadi angka anggaran yang bisa dipakai: perbandingan dengan tujuh model, empat skenario kerja, biaya per tugas dari evaluator pihak ketiga, serta kontrol biaya yang perlu disiapkan sebelum Argon tersedia. Untuk memahami modelnya, mulai dari apa itu Gemini 4 Argon; untuk status aksesnya, lihat apakah Gemini 4 Argon gratis. Anda dapat membangun asumsi biaya di Apidog menggunakan model yang tersedia hari ini, lalu mengganti nama model ketika Argon dirilis.


fe

Lembar harga

Google menerbitkan harga di postingan peluncuran Gemini 4 Argon. Catatan kaki 1 menyatakan bahwa setelah periode perkenalan berakhir, harga $4 per 1 juta token input dan $20 per 1 juta token output akan berlaku.

Gemini 4 Argon, per 1 juta token Perkenalan Standar setelah perkenalan
Input $2,00 $4,00
Input yang di-cache, diskon 95% dari input $0,10 $0,20
Output $10,00 $20,00
Output maksimum per respons menurut Google 1 juta token 1 juta token
Biaya satu output penuh 1 juta token $10,00 $20,00

Tarif cache dihitung dari diskon 95% Google:

Tarif cache perkenalan = $2 × 0,05 = $0,10 per 1 juta token
Tarif cache standar     = $4 × 0,05 = $0,20 per 1 juta token
Enter fullscreen mode Exit fullscreen mode

Google belum menerbitkan jendela konteks input maupun ID model Argon. Google menyebut batas output mencapai 1 juta token, naik dari 64K token sebelumnya. Namun, setidaknya satu evaluator pihak ketiga, Vals AI, mencantumkan output maksimum 262K token untuk konfigurasi yang diuji.

Argon vs. model frontier dan Gemini saat ini

Semua harga berikut adalah per 1 juta token.

Model Input Input di-cache Output Output maksimum
Gemini 4 Argon, perkenalan $2 $0,10 $10 1 juta
Gemini 4 Argon, standar $4 $0,20 $20 1 juta
GPT-6 Astra $10 $1 $50 128.000
Claude Opus 5.5 $4 $0,20 $20 128K, 300K di Batch beta
Claude Sonnet 5.5 $2 $0,20 $10 128K, 300K di Batch beta
GPT-6.1 Sol $2 $0,10 $10 128.000
Claude Fable 5.1 $10 $0,25 $50 128K
gemini-3.1-pro-preview, prompt <=200K / >200K $2 / $4 $0,20 / $0,40 $12 / $18 65.536
gemini-3.8-flash, perkenalan / mulai 2027-01-01 $0,75 / $1,50 $0,075 / $0,15 $3,75 / $7,50 65.536

Harga kompetitor berasal dari halaman vendor masing-masing: GPT-6 Astra OpenAI, harga Anthropic, dan harga Gemini API Google.

Poin penting untuk perencanaan biaya:

  • Argon standar setara dengan Claude Opus 5.5. Keduanya berharga $4/$20 dengan input cache $0,20.
  • Argon perkenalan setara dengan Claude Sonnet 5.5 dan GPT-6.1 Sol. Ketiganya berharga $2/$10, sementara tarif cache Argon perkenalan $0,10 sama dengan GPT-6.1 Sol.
  • GPT-6 Astra dan Claude Fable 5.1 berharga 5x Argon perkenalan serta 2,5x Argon standar. Lihat juga harga Claude Fable 5.1.
  • Output Argon pada masa perkenalan, $10, berada di bawah gemini-3.1-pro-preview, $12.
  • Prompt panjang dapat mengubah total biaya secara signifikan. OpenAI mengenakan tarif lebih tinggi untuk prompt di atas 272K token input: 2x untuk input dan cache, serta 1,5x untuk output pada permintaan penuh. Gemini 3.1 Pro juga naik tarif di atas 200K token, sementara Anthropic tidak. Google belum menyatakan apakah Argon memiliki tingkat harga untuk prompt panjang.

Untuk membandingkan kemampuan model di luar harga, lihat Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5.

Token pemikiran ditagih sebagai output

Pada model Gemini saat ini, token pemikiran ditagih sebagai output. Dokumentasi pemikiran Google menyatakan bahwa harga respons adalah jumlah token output dan token pemikiran.

Google belum mendokumentasikan perilaku Argon secara spesifik, tetapi gunakan asumsi yang sama dalam anggaran Anda:

Token output yang ditagih = token jawaban + token pemikiran
Enter fullscreen mode Exit fullscreen mode

Google menjalankan evaluasi Argon dengan pengaturan pemikiran tertinggi. Jadi, tarif $10 per 1 juta token output sebaiknya diperlakukan sebagai biaya gabungan untuk jawaban dan penalaran model.

Empat skenario kerja

Gunakan rumus dasar berikut:

biaya = (token / 1.000.000) × tarif per 1 juta token
Enter fullscreen mode Exit fullscreen mode

Skenario 1 sampai 3 tidak mengasumsikan caching.

1. Panggilan API tipikal: 20K input, 5K output

Tarif perkenalan

Input  = 20.000 / 1.000.000 × $2  = $0,04
Output =  5.000 / 1.000.000 × $10 = $0,05
Total  = $0,09
Enter fullscreen mode Exit fullscreen mode

Tarif standar

Input  = $0,08
Output = $0,10
Total  = $0,18
Enter fullscreen mode Exit fullscreen mode

Jika aplikasi membuat 1.000 panggilan per hari:

Tarif Biaya per panggilan Biaya per hari
Perkenalan $0,09 $90
Standar $0,18 $180

Untuk prompt dan output yang sama, perkiraan biaya model lain:

  • Claude Opus 5.5: $0,18
  • GPT-6 Astra: $0,45, terdiri dari $0,20 input dan $0,25 output
  • gemini-3.1-pro-preview: $0,10
  • gemini-3.8-flash pada tarif perkenalan: sekitar $0,034

2. Giliran agen panjang: 200K input, 50K output

Tarif perkenalan

Input  = 200.000 / 1.000.000 × $2  = $0,40
Output =  50.000 / 1.000.000 × $10 = $0,50
Total  = $0,90
Enter fullscreen mode Exit fullscreen mode

Tarif standar

Input  = $0,80
Output = $1,00
Total  = $1,80
Enter fullscreen mode Exit fullscreen mode

Sebagai pembanding:

  • GPT-6 Astra: $4,50, terdiri dari $2,00 input dan $2,50 output.
  • gemini-3.1-pro-preview: $1,00, terdiri dari $0,40 input dan $0,60 output.

Namun, 200K token adalah batas tingkat harga Gemini 3.1 Pro. Prompt yang lebih panjang ditagih $4 input dan $18 output per 1 juta token. Jika Argon memakai pola tingkat serupa, biaya agen dengan konteks panjang dapat meningkat.

3. Satu respons maksimum: 1 juta token output

Output saja berharga:

Perkenalan = 1.000.000 / 1.000.000 × $10 = $10,00
Standar     = 1.000.000 / 1.000.000 × $20 = $20,00
Enter fullscreen mode Exit fullscreen mode

Jika Anda menambahkan prompt 100K token:

Komponen Perkenalan Standar
Output 1 juta token $10,00 $20,00
Input 100K token $0,20 $0,40
Total $10,20 $20,40

Tidak ada model lain dalam tabel sebelumnya yang menghasilkan output sebesar ini dalam satu respons sinkron. Kompetitor dibatasi pada 128K token, sedangkan Gemini Pro sebelumnya dibatasi pada 65.536 token.

Pada batas output 262K yang dicantumkan Vals AI, satu respons penuh kira-kira berharga:

Perkenalan = 262.000 / 1.000.000 × $10 = $2,62
Standar     = 262.000 / 1.000.000 × $20 = $5,24
Enter fullscreen mode Exit fullscreen mode

Untuk konsekuensi implementasi seperti timeout, streaming, dan gateway, lihat 1 juta token output Gemini 4 Argon.

4. Prompt 500K token yang di-cache dan dipakai ulang 10 kali

Asumsikan Anda mengirim kode sumber atau kumpulan kontrak yang sama, sebesar 500K token, sebanyak 10 kali. Setiap panggilan menghasilkan 5K token output.

Asumsi:

  1. Panggilan pertama membayar input penuh untuk membangun cache.
  2. Sembilan panggilan berikutnya membaca cache.
  3. Output tetap ditagih penuh pada setiap panggilan.
10 panggilan: prompt 500K, output 5K per panggilan Perkenalan Standar
Input tanpa caching, 10 × 500K $10,00 $20,00
Input di-cache, 1 penuh + 9 cache $1,00 + 9 × $0,05 = $1,45 $2,00 + 9 × $0,10 = $2,90
Output, 10 × 5K $0,50 $1,00
Total dengan caching $1,95 $3,90
Total tanpa caching $10,50 $21,00

Dalam contoh ini, caching memangkas tagihan input sebesar 85,5%.

Tetap perhatikan dua hal:

  1. Google belum menyatakan apakah Argon mengenakan biaya penyimpanan cache. Sebagai pembanding, gemini-3.1-pro-preview menagih $4,50 per 1 juta token per jam. Menyimpan 500K token selama satu jam akan menambah $2,25.
  2. Prompt 500K token melewati ambang 200K pada Gemini 3.1 Pro.

Tarif cache standar Argon sama dengan $0,20 milik Claude Opus 5.5. Karena itu, logika titik impas dalam perhitungan biaya caching prompt Claude Opus 5.5 dapat digunakan sebagai referensi.

Harga per token bukan biaya per tugas

Tarif per token hanya memberi Anda biaya unit. Biaya aktual per tugas dipengaruhi oleh jumlah token yang dikonsumsi model untuk menyelesaikan pekerjaan.

Artificial Analysis mencantumkan biaya $1,99 per tugas untuk menjalankan Intelligence Index pada Gemini 4 Argon dengan pengaturan Tinggi dan harga perkenalan. The Decoder menempatkan pengujian yang sama pada $3,98 dengan harga standar.

Artificial Analysis memberi Argon skor 53, sama dengan GPT-6 Astra pada pengaturan maksimal, yang dicantumkan sebesar $3,26 per tugas.

Perbedaannya ada pada volume token:

Argon, Tinggi: sekitar 62K token output per tugas
Astra, Maks:  sekitar 27K token output per tugas
Enter fullscreen mode Exit fullscreen mode

Itu berarti Argon menggunakan sekitar 2,3x lebih banyak token output dalam pengujian tersebut.

Pada harga perkenalan:

Argon output = 62.000 / 1.000.000 × $10 = $0,62
Astra output = 27.000 / 1.000.000 × $50 = $1,35
Enter fullscreen mode Exit fullscreen mode

Pada harga standar, angka tugas penuh Argon dari The Decoder, $3,98, berada di atas biaya $3,26 GPT-6 Astra dari Artificial Analysis, meskipun tarif standar Argon 60% lebih rendah daripada Astra.

Vals AI menunjukkan pola serupa. Vals mencantumkan:

Model Biaya per tes Vals Index
Gemini 4 Argon $15,68
Claude Opus 5.5 $32,14
Claude Sonnet 5.5 $21,34
GPT-6.1 Sol $3,24

Vals mencantumkan Argon pada tarif standar $4/$20. Claude Sonnet 5.5 dan GPT-6.1 Sol memiliki harga per token yang sama atau sangat dekat dengan Argon perkenalan, tetapi biaya per tesnya tetap berbeda lebih dari 6x.

Kesimpulan: buat anggaran berdasarkan penggunaan token aplikasi Anda sendiri, bukan hanya kartu tarif model.

Kontrol biaya yang perlu disiapkan sebelum Argon diluncurkan

1. Batasi output

Pada generateContent, gunakan generationConfig.maxOutputTokens untuk menetapkan batas respons.

{
  "generationConfig": {
    "maxOutputTokens": 8000
  }
}
Enter fullscreen mode Exit fullscreen mode

Google menyatakan model baru akan diluncurkan melalui Interactions API. Saat dokumentasi Argon tersedia, gunakan parameter pembatas output yang setara di API tersebut.

Batas 1 juta token berarti satu panggilan dapat menghasilkan biaya output hingga $20 pada tarif standar. Jangan biarkan batas ini menjadi default aplikasi Anda.

2. Cache konten yang stabil

Prioritaskan caching untuk konten yang sama di banyak panggilan:

  • instruksi sistem;
  • skema JSON;
  • definisi tool;
  • dokumentasi referensi;
  • kode sumber atau kontrak yang dipakai ulang.

Diskon 95% pada input cache paling berguna ketika konteks besar dipakai berulang kali.

3. Pilih tingkat pemikiran dengan sengaja

Google belum menerbitkan tingkat pemikiran Argon. Pada model saat ini:

  • gemini-3.1-pro-preview menggunakan high sebagai default;
  • gemini-3.8-flash menggunakan medium sebagai default.

Ketika pengaturan Argon tersedia, uji kualitas dan biaya untuk tiap tingkat pada dataset Anda sendiri. Jangan selalu memakai tingkat pemikiran tertinggi tanpa mengukur dampaknya.

4. Tegaskan batas biaya dari usageMetadata

Setiap respons generateContent menyertakan usageMetadata. Gunakan data ini untuk menghitung biaya aktual setelah respons diterima.

Di Apidog:

  1. Simpan nama model dalam variabel lingkungan GEMINI_MODEL.
  2. Buat permintaan terhadap model yang tersedia, misalnya gemini-3.8-flash.
  3. Tambahkan skrip pasca-respons untuk membaca usageMetadata.
  4. Hitung biaya berdasarkan token input, token cache, output, dan token pemikiran.
  5. Gagalkan pengujian jika biaya melebihi batas yang ditetapkan.
  6. Saat ID Argon tersedia, cukup ubah nilai GEMINI_MODEL lalu jalankan ulang suite yang sama.

Gunakan rumus berikut:

biaya = input_tanpa_cache / 1.000.000 × tarif_input
     + input_cache       / 1.000.000 × tarif_cache
     + (output + pemikiran) / 1.000.000 × tarif_output
Enter fullscreen mode Exit fullscreen mode

Apa yang belum ditetapkan harganya oleh Google

Sebelum memakai Argon dalam produksi, pantau dokumentasi Google untuk informasi berikut:

  • durasi periode perkenalan dan tanggal mulai tarif $4/$20;
  • apakah prompt di atas 200K token mendapat tarif lebih mahal;
  • harga Batch atau Flex;
  • biaya penyimpanan cache;
  • batas laju;
  • ketersediaan tingkatan gratis.

Sebagai pembanding, Gemini 3.1 Pro memiliki Batch dan Flex dengan input $1/$2 serta output $6/$9, tetapi Google belum menyatakan apakah Argon akan memiliki opsi yang sama.

FAQ

Berapa biaya Gemini 4 Argon per juta token?

$2 untuk input dan $10 untuk output selama periode perkenalan. Setelahnya, $4 untuk input dan $20 untuk output. Input cache mendapat diskon 95%: $0,10 saat perkenalan dan $0,20 setelahnya.

Berapa lama harga perkenalan berlaku?

Google belum menyatakan durasi maupun tanggal akhirnya.

Apakah token pemikiran ditagih sebagai output?

Pada model Gemini saat ini, ya. Google belum mendokumentasikan aturan Argon secara spesifik.

Berapa biaya respons dengan output 1 juta token?

$10 pada harga perkenalan dan $20 pada harga standar, belum termasuk input.

Apakah Argon lebih murah daripada Claude Opus 5.5 atau GPT-6 Astra?

Per token, Argon standar setara dengan Opus 5.5 dan 60% lebih murah daripada Astra. Per tugas, hasilnya bergantung pada volume token. Artificial Analysis mengukur Argon menggunakan sekitar 2,3x token output Astra. Untuk model Gemini yang lebih murah saat ini, lihat harga Gemini 3.8 Flash.

Bisakah saya membayar Argon hari ini?

Belum. Argon hanya diluncurkan untuk mitra Program Fairwind. Pelanggan API berbayar dan Google AI Ultra akan menyusul tanpa tanggal yang diumumkan.

Anggarkan sekarang, ukur nanti

Kalikan volume token aplikasi Anda saat ini dengan dua tarif berikut:

Rentang perkenalan: input $2 / output $10 per 1 juta token
Rentang standar:    input $4 / output $20 per 1 juta token
Enter fullscreen mode Exit fullscreen mode

Setelah itu, siapkan pengukurannya sekarang:

  1. Unduh Apidog.
  2. Simpan model dalam variabel GEMINI_MODEL.
  3. Jalankan request terhadap gemini-3.8-flash.
  4. Tambahkan asersi biaya berbasis usageMetadata.
  5. Saat Google menerbitkan ID Argon, ubah satu variabel dan ukur biaya per panggilan nyata sejak hari pertama.

Top comments (0)