DEV Community

Cover image for Gemini 3.6 Flash: Harga Sebenarnya di 2026
Walse
Walse

Posted on • Originally published at apidog.com

Gemini 3.6 Flash: Harga Sebenarnya di 2026

Gemini 3.6 Flash berbiaya $1.50 per 1 juta token masukan dan $7.50 per 1 juta token keluaran. Google merilis pembaruan ini pada 21 Juli 2026. Bagi developer yang memantau tagihan API, dampaknya jelas: model Flash utama menjadi lebih cepat sekaligus lebih murah dibanding model yang digantikannya.

Coba Apidog hari ini

Panduan ini membahas angka yang perlu Anda masukkan ke anggaran: tarif per token, biaya cache konteks, cakupan tingkat gratis, serta contoh perhitungan biaya bulanan. Semua angka merujuk pada dokumentasi harga API Gemini dan pengumuman peluncuran Google. Untuk pengenalan model, baca apa itu Gemini 3.6 Flash.

Catatan penamaan: model utama naik ke versi 3.6, sedangkan Flash-Lite tetap berada di versi 3.5. Keduanya dirilis dalam peluncuran yang sama, tetapi versinya berbeda.

Harga Gemini 3.6 Flash sekilas

Item Biaya
Masukan $1.50 per 1 juta token
Keluaran, termasuk token berpikir $7.50 per 1 juta token
Pembacaan masukan dari cache konteks $0.15 per 1 juta token
Penyimpanan cache konteks $1.00 per 1 juta token per jam
Tingkat gratis Ya, melalui Google AI Studio dengan batas kecepatan

Ada dua detail penting:

  1. Token berpikir sudah termasuk biaya keluaran. Tidak ada baris biaya terpisah, tetapi token yang digunakan model untuk bernalar tetap ditagih pada tarif keluaran $7.50 per 1 juta token.
  2. Cache konteks memiliki biaya baca dan biaya simpan. Token yang dibaca dari cache jauh lebih murah, tetapi cache tetap dikenai biaya penyimpanan per jam. Cache hanya menghemat biaya jika awalan prompt yang sama digunakan berulang kali.

Perbandingan dengan Gemini 3.5 Flash

Tarif keluaran turun dari $9.00 per 1 juta token pada Gemini 3.5 Flash menjadi $7.50 pada Gemini 3.6 Flash. Itu berarti penurunan sekitar 17% untuk setiap token keluaran.

Menurut halaman model DeepMind Flash, Gemini 3.6 Flash juga menghasilkan sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Model ini bernalar dalam langkah yang lebih sedikit dan melakukan lebih sedikit panggilan alat pada pekerjaan multi-langkah.

Artinya, penghematan datang dari dua arah:

  • Tarif per token lebih rendah.
  • Jumlah token keluaran lebih kecil.

Jika Anda masih menggunakan model lama sebagai dasar anggaran, bandingkan dengan harga Gemini 3.5 Flash. Untuk fitur dan benchmark, lihat Gemini 3.6 Flash vs 3.5 Flash.

Apa yang didapat dari tingkat gratis

Tingkat gratis tersedia melalui Google AI Studio. Anda dapat memanggil Gemini 3.6 Flash tanpa kartu kredit untuk membuat prototipe dan menguji integrasi.

Namun, gunakan tingkat gratis dengan batasan berikut:

  • Dibatasi kecepatan, sehingga tidak ditujukan untuk traffic produksi.
  • Cocok untuk prototipe, eksperimen, dan pengujian ringan.
  • Google dapat menggunakan data dari tingkat gratis untuk meningkatkan produknya.
  • Jangan kirim data sensitif, kepemilikan, atau data pelanggan ke tingkat gratis.

Saat aplikasi masuk ke produksi, gunakan kunci API berbayar agar ketentuan penggunaan data tingkat gratis tidak berlaku. Untuk langkah setup, baca cara menggunakan Gemini 3.6 Flash secara gratis.

Contoh perhitungan biaya

Misalkan Anda menjalankan agen yang banyak membaca dokumen tetapi menghasilkan jawaban singkat:

  • Masukan: 2 juta token per hari
  • Keluaran: 500 ribu token per hari

Perhitungannya pada Gemini 3.6 Flash:

Biaya masukan
= 2.000.000 / 1.000.000 × $1.50
= $3.00

Biaya keluaran
= 500.000 / 1.000.000 × $7.50
= $3.75

Total harian
= $3.00 + $3.75
= $6.75

Estimasi bulanan, 30 hari
= $6.75 × 30
= $202.50
Enter fullscreen mode Exit fullscreen mode

Dampak gabungan: tarif turun dan token lebih sedikit

Misalkan tugas yang sama pada Gemini 3.5 Flash menghasilkan 600 ribu token keluaran. Jika Gemini 3.6 Flash mengurangi keluaran sekitar 17%, jumlahnya menjadi sekitar 500 ribu token.

Bandingkan biaya keluarannya:

Gemini 3.5 Flash
= 600.000 / 1.000.000 × $9.00
= $5.40 per hari

Gemini 3.6 Flash
= 500.000 / 1.000.000 × $7.50
= $3.75 per hari
Enter fullscreen mode Exit fullscreen mode

Selisihnya:

$5.40 - $3.75 = $1.65 per hari
$1.65 × 30 = $49.50 per bulan
Enter fullscreen mode Exit fullscreen mode

Biaya keluaran turun sekitar 31%. Ini lebih besar daripada diskon harga 17% karena jumlah token keluarannya juga berkurang.

Flash-Lite lebih murah untuk tugas sederhana

Untuk tugas berkompleksitas rendah dan volume tinggi, gunakan Gemini 3.5 Flash-Lite:

Item Biaya Flash-Lite
Masukan $0.30 per 1 juta token
Keluaran $2.50 per 1 juta token
Pembacaan cache $0.03 per 1 juta token
Penyimpanan cache $1.00 per 1 juta token per jam

Flash-Lite juga berjalan cepat, sekitar 350 token keluaran per detik.

Untuk beban kerja yang sama—2 juta token masukan dan 500 ribu token keluaran per hari—perhitungannya adalah:

Masukan
= 2 × $0.30
= $0.60

Keluaran
= 0.5 × $2.50
= $1.25

Total harian
= $1.85

Estimasi bulanan
= $1.85 × 30
= $55.50
Enter fullscreen mode Exit fullscreen mode

Itu sekitar 70% lebih murah daripada Gemini 3.6 Flash untuk jumlah token yang identik.

Gunakan Flash-Lite untuk:

  • Klasifikasi
  • Ekstraksi data
  • Routing
  • Respons terstruktur singkat
  • Tugas bervolume tinggi dengan logika sederhana

Simpan Gemini 3.6 Flash untuk penalaran yang lebih sulit atau alur multi-langkah. Pelajari perbedaannya melalui apa itu Gemini 3.5 Flash-Lite dan Gemini 3.5 Flash-Lite vs 3.6 Flash.

Cara mengontrol dan mengukur biaya

Gunakan empat langkah berikut untuk menjaga biaya API tetap terkendali.

1. Cache konteks yang digunakan berulang

Jika setiap request memakai system prompt panjang atau dokumen referensi yang sama, gunakan cache konteks.

  • Masukan normal: $1.50 per 1 juta token
  • Masukan dari cache: $0.15 per 1 juta token
  • Penyimpanan cache: $1.00 per 1 juta token per jam

Cache paling masuk akal jika Anda menggunakan awalan prompt yang sama berkali-kali dalam periode cache aktif.

2. Pangkas prompt dan batasi keluaran

Keluaran lima kali lebih mahal daripada masukan. Namun, masukan yang tidak relevan juga akan menambah biaya pada skala besar.

Praktik yang bisa langsung diterapkan:

  • Hapus konteks yang tidak diperlukan.
  • Ringkas dokumen sebelum memasukkannya ke prompt.
  • Batasi token keluaran maksimum.
  • Minta format respons yang spesifik agar model tidak menulis terlalu panjang.

Contoh payload dengan batas keluaran:

{
  "contents": [
    {
      "parts": [
        {
          "text": "Ringkas dokumen berikut dalam maksimal lima poin."
        }
      ]
    }
  ],
  "generationConfig": {
    "maxOutputTokens": 500
  }
}
Enter fullscreen mode Exit fullscreen mode

3. Route tugas sederhana ke Flash-Lite

Jangan gunakan satu model untuk semua endpoint. Buat routing berdasarkan kompleksitas tugas:

Klasifikasi / ekstraksi / tagging      → Flash-Lite
Respons singkat dan terstruktur        → Flash-Lite
Analisis multi-langkah / penalaran     → Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Strategi model campuran biasanya lebih hemat daripada mengirim semua request ke model utama.

4. Ukur penggunaan token aktual

Jangan hanya mengandalkan estimasi. Setiap respons Gemini menyediakan usageMetadata, yang menunjukkan jumlah token aktual untuk request tersebut.

Contoh struktur yang perlu Anda log:

{
  "usageMetadata": {
    "promptTokenCount": 1200,
    "candidatesTokenCount": 450,
    "thoughtsTokenCount": 180
  }
}
Enter fullscreen mode Exit fullscreen mode

Simpan metrik ini per endpoint, per model, dan per versi prompt. Dengan begitu, Anda bisa mendeteksi perubahan prompt yang meningkatkan penggunaan token sebelum tagihan bulanan naik.

Di Apidog, Anda dapat membuat request POST ke API Gemini, menyimpan API key dalam environment variable, lalu menguji prompt nyata Anda. Periksa usageMetadata dari respons dan tambahkan assertion agar perubahan yang menaikkan token keluaran dapat gagal saat pengujian.

Anda juga dapat menjadwalkan pengujian API untuk mendeteksi regresi biaya secara rutin. Unduh Apidog dan uji endpoint Gemini sebelum menghubungkannya ke produksi.

FAQ

Berapa biaya Gemini 3.6 Flash per 1 juta token?

$1.50 untuk masukan dan $7.50 untuk keluaran. Pembacaan cache konteks berbiaya $0.15 per 1 juta token, sedangkan penyimpanan cache berbiaya $1.00 per 1 juta token per jam.

Apakah harga keluaran termasuk token berpikir?

Ya. Token berpikir ditagih sebagai bagian dari token keluaran pada tarif $7.50 per 1 juta token. Tidak ada biaya terpisah, tetapi lebih banyak penalaran berarti total keluaran dan biaya yang lebih besar.

Apakah ada tingkat gratis?

Ya, melalui Google AI Studio dengan batas kecepatan. Tingkat ini ditujukan untuk prototipe dan pengujian, bukan produksi. Google dapat menggunakan data tingkat gratis untuk meningkatkan produknya, jadi gunakan kunci berbayar untuk data sensitif.

Apakah Gemini 3.6 Flash lebih murah daripada 3.5 Flash?

Ya. Tarif keluaran turun dari $9.00 menjadi $7.50 per 1 juta token. Selain itu, Gemini 3.6 Flash dilaporkan memakai sekitar 17% lebih sedikit token keluaran untuk tugas yang sama. Kombinasi keduanya dapat menurunkan biaya keluaran sekitar 31%.

Kapan sebaiknya menggunakan Flash-Lite?

Gunakan Flash-Lite ketika tugasnya sederhana dan volumenya tinggi, seperti klasifikasi, ekstraksi, routing, atau respons terstruktur singkat. Dengan tarif $0.30 untuk masukan dan $2.50 untuk keluaran, Flash-Lite sekitar 70% lebih murah untuk jumlah token yang sama.

Gemini 3.6 Flash menurunkan harga masukan menjadi $1.50 dan keluaran menjadi $7.50 per 1 juta token, sambil mengurangi kebutuhan token keluaran pada tugas yang sama. Untuk mengoptimalkan biaya, gunakan cache bagi konteks berulang, arahkan tugas sederhana ke Flash-Lite, dan ukur usageMetadata pada setiap request. Untuk konteks historis, lihat biaya API Gemini 3.0, lalu ukur penggunaan aktual Anda di Apidog.

Top comments (0)