Gemini 3.6 Flash berbiaya $1.50 per 1 juta token masukan dan $7.50 per 1 juta token keluaran. Google merilis pembaruan ini pada 21 Juli 2026. Bagi developer yang memantau tagihan API, dampaknya jelas: model Flash utama menjadi lebih cepat sekaligus lebih murah dibanding model yang digantikannya.
Panduan ini membahas angka yang perlu Anda masukkan ke anggaran: tarif per token, biaya cache konteks, cakupan tingkat gratis, serta contoh perhitungan biaya bulanan. Semua angka merujuk pada dokumentasi harga API Gemini dan pengumuman peluncuran Google. Untuk pengenalan model, baca apa itu Gemini 3.6 Flash.
Catatan penamaan: model utama naik ke versi 3.6, sedangkan Flash-Lite tetap berada di versi 3.5. Keduanya dirilis dalam peluncuran yang sama, tetapi versinya berbeda.
Harga Gemini 3.6 Flash sekilas
| Item | Biaya |
|---|---|
| Masukan | $1.50 per 1 juta token |
| Keluaran, termasuk token berpikir | $7.50 per 1 juta token |
| Pembacaan masukan dari cache konteks | $0.15 per 1 juta token |
| Penyimpanan cache konteks | $1.00 per 1 juta token per jam |
| Tingkat gratis | Ya, melalui Google AI Studio dengan batas kecepatan |
Ada dua detail penting:
- Token berpikir sudah termasuk biaya keluaran. Tidak ada baris biaya terpisah, tetapi token yang digunakan model untuk bernalar tetap ditagih pada tarif keluaran $7.50 per 1 juta token.
- Cache konteks memiliki biaya baca dan biaya simpan. Token yang dibaca dari cache jauh lebih murah, tetapi cache tetap dikenai biaya penyimpanan per jam. Cache hanya menghemat biaya jika awalan prompt yang sama digunakan berulang kali.
Perbandingan dengan Gemini 3.5 Flash
Tarif keluaran turun dari $9.00 per 1 juta token pada Gemini 3.5 Flash menjadi $7.50 pada Gemini 3.6 Flash. Itu berarti penurunan sekitar 17% untuk setiap token keluaran.
Menurut halaman model DeepMind Flash, Gemini 3.6 Flash juga menghasilkan sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Model ini bernalar dalam langkah yang lebih sedikit dan melakukan lebih sedikit panggilan alat pada pekerjaan multi-langkah.
Artinya, penghematan datang dari dua arah:
- Tarif per token lebih rendah.
- Jumlah token keluaran lebih kecil.
Jika Anda masih menggunakan model lama sebagai dasar anggaran, bandingkan dengan harga Gemini 3.5 Flash. Untuk fitur dan benchmark, lihat Gemini 3.6 Flash vs 3.5 Flash.
Apa yang didapat dari tingkat gratis
Tingkat gratis tersedia melalui Google AI Studio. Anda dapat memanggil Gemini 3.6 Flash tanpa kartu kredit untuk membuat prototipe dan menguji integrasi.
Namun, gunakan tingkat gratis dengan batasan berikut:
- Dibatasi kecepatan, sehingga tidak ditujukan untuk traffic produksi.
- Cocok untuk prototipe, eksperimen, dan pengujian ringan.
- Google dapat menggunakan data dari tingkat gratis untuk meningkatkan produknya.
- Jangan kirim data sensitif, kepemilikan, atau data pelanggan ke tingkat gratis.
Saat aplikasi masuk ke produksi, gunakan kunci API berbayar agar ketentuan penggunaan data tingkat gratis tidak berlaku. Untuk langkah setup, baca cara menggunakan Gemini 3.6 Flash secara gratis.
Contoh perhitungan biaya
Misalkan Anda menjalankan agen yang banyak membaca dokumen tetapi menghasilkan jawaban singkat:
- Masukan: 2 juta token per hari
- Keluaran: 500 ribu token per hari
Perhitungannya pada Gemini 3.6 Flash:
Biaya masukan
= 2.000.000 / 1.000.000 × $1.50
= $3.00
Biaya keluaran
= 500.000 / 1.000.000 × $7.50
= $3.75
Total harian
= $3.00 + $3.75
= $6.75
Estimasi bulanan, 30 hari
= $6.75 × 30
= $202.50
Dampak gabungan: tarif turun dan token lebih sedikit
Misalkan tugas yang sama pada Gemini 3.5 Flash menghasilkan 600 ribu token keluaran. Jika Gemini 3.6 Flash mengurangi keluaran sekitar 17%, jumlahnya menjadi sekitar 500 ribu token.
Bandingkan biaya keluarannya:
Gemini 3.5 Flash
= 600.000 / 1.000.000 × $9.00
= $5.40 per hari
Gemini 3.6 Flash
= 500.000 / 1.000.000 × $7.50
= $3.75 per hari
Selisihnya:
$5.40 - $3.75 = $1.65 per hari
$1.65 × 30 = $49.50 per bulan
Biaya keluaran turun sekitar 31%. Ini lebih besar daripada diskon harga 17% karena jumlah token keluarannya juga berkurang.
Flash-Lite lebih murah untuk tugas sederhana
Untuk tugas berkompleksitas rendah dan volume tinggi, gunakan Gemini 3.5 Flash-Lite:
| Item | Biaya Flash-Lite |
|---|---|
| Masukan | $0.30 per 1 juta token |
| Keluaran | $2.50 per 1 juta token |
| Pembacaan cache | $0.03 per 1 juta token |
| Penyimpanan cache | $1.00 per 1 juta token per jam |
Flash-Lite juga berjalan cepat, sekitar 350 token keluaran per detik.
Untuk beban kerja yang sama—2 juta token masukan dan 500 ribu token keluaran per hari—perhitungannya adalah:
Masukan
= 2 × $0.30
= $0.60
Keluaran
= 0.5 × $2.50
= $1.25
Total harian
= $1.85
Estimasi bulanan
= $1.85 × 30
= $55.50
Itu sekitar 70% lebih murah daripada Gemini 3.6 Flash untuk jumlah token yang identik.
Gunakan Flash-Lite untuk:
- Klasifikasi
- Ekstraksi data
- Routing
- Respons terstruktur singkat
- Tugas bervolume tinggi dengan logika sederhana
Simpan Gemini 3.6 Flash untuk penalaran yang lebih sulit atau alur multi-langkah. Pelajari perbedaannya melalui apa itu Gemini 3.5 Flash-Lite dan Gemini 3.5 Flash-Lite vs 3.6 Flash.
Cara mengontrol dan mengukur biaya
Gunakan empat langkah berikut untuk menjaga biaya API tetap terkendali.
1. Cache konteks yang digunakan berulang
Jika setiap request memakai system prompt panjang atau dokumen referensi yang sama, gunakan cache konteks.
- Masukan normal: $1.50 per 1 juta token
- Masukan dari cache: $0.15 per 1 juta token
- Penyimpanan cache: $1.00 per 1 juta token per jam
Cache paling masuk akal jika Anda menggunakan awalan prompt yang sama berkali-kali dalam periode cache aktif.
2. Pangkas prompt dan batasi keluaran
Keluaran lima kali lebih mahal daripada masukan. Namun, masukan yang tidak relevan juga akan menambah biaya pada skala besar.
Praktik yang bisa langsung diterapkan:
- Hapus konteks yang tidak diperlukan.
- Ringkas dokumen sebelum memasukkannya ke prompt.
- Batasi token keluaran maksimum.
- Minta format respons yang spesifik agar model tidak menulis terlalu panjang.
Contoh payload dengan batas keluaran:
{
"contents": [
{
"parts": [
{
"text": "Ringkas dokumen berikut dalam maksimal lima poin."
}
]
}
],
"generationConfig": {
"maxOutputTokens": 500
}
}
3. Route tugas sederhana ke Flash-Lite
Jangan gunakan satu model untuk semua endpoint. Buat routing berdasarkan kompleksitas tugas:
Klasifikasi / ekstraksi / tagging → Flash-Lite
Respons singkat dan terstruktur → Flash-Lite
Analisis multi-langkah / penalaran → Gemini 3.6 Flash
Strategi model campuran biasanya lebih hemat daripada mengirim semua request ke model utama.
4. Ukur penggunaan token aktual
Jangan hanya mengandalkan estimasi. Setiap respons Gemini menyediakan usageMetadata, yang menunjukkan jumlah token aktual untuk request tersebut.
Contoh struktur yang perlu Anda log:
{
"usageMetadata": {
"promptTokenCount": 1200,
"candidatesTokenCount": 450,
"thoughtsTokenCount": 180
}
}
Simpan metrik ini per endpoint, per model, dan per versi prompt. Dengan begitu, Anda bisa mendeteksi perubahan prompt yang meningkatkan penggunaan token sebelum tagihan bulanan naik.
Di Apidog, Anda dapat membuat request POST ke API Gemini, menyimpan API key dalam environment variable, lalu menguji prompt nyata Anda. Periksa usageMetadata dari respons dan tambahkan assertion agar perubahan yang menaikkan token keluaran dapat gagal saat pengujian.
Anda juga dapat menjadwalkan pengujian API untuk mendeteksi regresi biaya secara rutin. Unduh Apidog dan uji endpoint Gemini sebelum menghubungkannya ke produksi.
FAQ
Berapa biaya Gemini 3.6 Flash per 1 juta token?
$1.50 untuk masukan dan $7.50 untuk keluaran. Pembacaan cache konteks berbiaya $0.15 per 1 juta token, sedangkan penyimpanan cache berbiaya $1.00 per 1 juta token per jam.
Apakah harga keluaran termasuk token berpikir?
Ya. Token berpikir ditagih sebagai bagian dari token keluaran pada tarif $7.50 per 1 juta token. Tidak ada biaya terpisah, tetapi lebih banyak penalaran berarti total keluaran dan biaya yang lebih besar.
Apakah ada tingkat gratis?
Ya, melalui Google AI Studio dengan batas kecepatan. Tingkat ini ditujukan untuk prototipe dan pengujian, bukan produksi. Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya, jadi gunakan kunci berbayar untuk data sensitif.
Apakah Gemini 3.6 Flash lebih murah daripada 3.5 Flash?
Ya. Tarif keluaran turun dari $9.00 menjadi $7.50 per 1 juta token. Selain itu, Gemini 3.6 Flash dilaporkan memakai sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Kombinasi keduanya dapat menurunkan biaya keluaran sekitar 31%.
Kapan sebaiknya menggunakan Flash-Lite?
Gunakan Flash-Lite ketika tugasnya sederhana dan volumenya tinggi, seperti klasifikasi, ekstraksi, routing, atau respons terstruktur singkat. Dengan tarif $0.30 untuk masukan dan $2.50 untuk keluaran, Flash-Lite sekitar 70% lebih murah untuk jumlah token yang sama.
Gemini 3.6 Flash menurunkan harga masukan menjadi $1.50 dan keluaran menjadi $7.50 per 1 juta token, sambil mengurangi kebutuhan token keluaran pada tugas yang sama. Untuk mengoptimalkan biaya, gunakan cache bagi konteks berulang, arahkan tugas sederhana ke Flash-Lite, dan ukur usageMetadata pada setiap request. Untuk konteks historis, lihat biaya API Gemini 3.0, lalu ukur penggunaan aktual Anda di Apidog.
Top comments (0)