DEV Community

Cover image for Harga Gemini 3.8 Flash: Tarif Awal, Biaya Token Pemrosesan, dan Biaya Riil per Tugas
Walse
Walse

Posted on Originally published at apidog.com

Harga Gemini 3.8 Flash: Tarif Awal, Biaya Token Pemrosesan, dan Biaya Riil per Tugas

Harga Gemini 3.8 Flash: Tarif Sama, Konsumsi Token Lebih Tinggi

Gemini 3.8 Flash berharga $0.75 per juta token masukan dan $3.75 per juta token keluaran—tarif perkenalan yang sama dengan Gemini 3.7 Flash hingga 31 Desember 2026. Mulai 1 Januari 2027, tarifnya menjadi $1.50 dan $7.50. Penggandaan yang sama berlaku untuk 3.6 Flash dan 3.7 Flash. Jadi, rilis ini tidak mengubah harga per token, tetapi mengubah jumlah token yang digunakan model.

Coba Apidog hari ini

Gemini 3.8 Flash

Google menyebut Gemini 3.8 Flash “bekerja lebih keras”: model menjalankan lebih banyak langkah penalaran, memanggil alat secara iteratif, dan dapat menggunakan lebih banyak token untuk tugas yang panjang serta kompleks. Artificial Analysis mengukur dampaknya secara independen: Intelligence Index membutuhkan biaya $0.58 per tugas pada 3.8 Flash dengan tingkat pemikiran tinggi, dibandingkan $0.40 pada 3.7 Flash. Model baru menggunakan sekitar 30% lebih banyak token keluaran per tugas.

Dengan kata lain: harga eceran sama, tetapi tagihan per tugas bisa lebih tinggi.

Untuk gambaran umum model, baca apa itu Gemini 3.8 Flash.

Sekilas harga Gemini 3.8 Flash

Semua harga berikut berlaku per 1 juta token pada tingkat berbayar.

Tarif Perkenalan hingga 31 Desember 2026 Standar mulai 1 Januari 2027
Masukan: teks, gambar, video, audio, PDF $0.75 $1.50
Keluaran, termasuk token pemikiran $3.75 $7.50
Pembacaan cache konteks $0.075 $0.15
Penyimpanan cache per 1 juta token per jam $0.50 $1.00
Masukan Batch API, diskon 50% $0.375 $0.75
Keluaran Batch API, diskon 50% $1.875 $3.75
Penelusuran Google 5.000 permintaan gratis/bulan untuk seluruh Gemini 3.x, lalu $14 per 1.000 permintaan Sama
Tingkat gratis $0, dengan batas kecepatan; data digunakan untuk meningkatkan produk Google Sama

Tiga hal penting:

  1. Token pemikiran ditagih sebagai token keluaran dengan harga $3.75, bukan sebagai masukan seharga $0.75.
  2. Tarif perkenalan memiliki tanggal berakhir yang pasti.
  3. Tarif 3.6 dan 3.7 Flash juga berlipat ganda pada 1 Januari 2027. Beralih ke model lama tidak menghindarkan Anda dari kenaikan tersebut.

Rincian harga Gemini 3.7 Flash menunjukkan tarif yang sama pada model yang menggunakan lebih sedikit token per tugas.

Token pemikiran dihitung sebagai token keluaran

Gemini 3.8 Flash melakukan penalaran sebelum memberikan jawaban. Setiap token penalaran dihitung sebagai keluaran dan dilaporkan melalui usageMetadata.thoughtsTokenCount pada respons generateContent.

Respons juga memuat:

  • candidatesTokenCount: token jawaban yang terlihat
  • promptTokenCount: token masukan

thoughtsTokenCount dan candidatesTokenCount dikenakan tarif keluaran yang sama, yaitu $3.75 per juta token selama periode perkenalan.

Jumlah penalaran dikendalikan dengan:

thinking_level: low | medium | high
Enter fullscreen mode Exit fullscreen mode

Pada Gemini 3.8 Flash:

  • Nilai default adalah medium, bukan high seperti pada Gemini 3 Pro.
  • Nilai minimal sudah tidak tersedia dan menghasilkan kesalahan validasi.
  • Konfigurasi lama yang menggunakan minimal perlu dipetakan ke low.
  • thinking_level adalah tingkat usaha relatif, bukan anggaran token.
  • Anda tidak dapat membatasi token pemikiran secara langsung menggunakan anggaran bilangan bulat seperti thinking_budget pada model lama.

Lihat dokumentasi pemikiran Google dan panduan tingkat pemikiran Gemini 3.8 Flash untuk detail latensi dan biaya.

Contoh perhitungan

Misalkan satu permintaan:

  • 10.000 token masukan
  • 2.000 token keluaran yang terlihat
  • 6.000 token pemikiran

Dengan tarif perkenalan:

Masukan:
10.000 × $0.75 / 1.000.000 = $0.0075

Keluaran:
(2.000 + 6.000) × $3.75 / 1.000.000 = $0.03

Total:
$0.0375 per permintaan
Enter fullscreen mode Exit fullscreen mode

Token pemikiran menyumbang 75% dari biaya keluaran dan 60% dari total biaya permintaan.

Mulai 1 Januari 2027, permintaan yang sama berharga:

$0.015 + $0.06 = $0.075
Enter fullscreen mode Exit fullscreen mode

Jadi, pernyataan “harga Gemini 3.8 Flash sama dengan 3.7 Flash” benar untuk tarif per token, tetapi tidak menjelaskan perubahan konsumsi token.

Mengapa biaya per tugas naik?

Menurut pos peluncuran Google, Gemini 3.8 Flash menjalankan langkah penalaran tambahan dan memanggil alat secara iteratif pada tugas kompleks untuk memverifikasi pekerjaannya.

Dampaknya:

  • lebih banyak token pemikiran;
  • lebih banyak giliran pemanggilan alat dalam loop agen;
  • biaya per tugas lebih tinggi meskipun tarif per token tetap.

Mitigasi yang disarankan Google:

  • turunkan thinking_level;
  • atau tetap gunakan Gemini 3.7 Flash.

Artificial Analysis menguji sembilan evaluasi dalam Intelligence Index. Gemini 3.8 Flash mencetak 59 pada tingkat tinggi, dibandingkan 56 untuk Gemini 3.7 Flash pada tingkat yang sama. Rata-rata token keluaran Gemini 3.8 Flash sekitar 48.000 per tugas, naik 30%.

Konfigurasi Biaya per tugas, tarif perkenalan Waktu per tugas
Gemini 3.8 Flash, tinggi $0.58 2,5 menit
Gemini 3.8 Flash, sedang $0.41 Tidak dipublikasikan
Gemini 3.8 Flash, rendah $0.24 0,8 menit
Gemini 3.7 Flash, tinggi $0.40 2,2 menit

Cara membaca tabel:

  • Gemini 3.8 Flash pada tingkat tinggi berharga 45% lebih mahal per tugas daripada 3.7 Flash: $0.58 / $0.40 = 1.45.
  • Menurunkan tingkat 3.8 Flash dari tinggi ke sedang mengurangi biaya 29%: $0.41 / $0.58 = 0.71.
  • Tingkat rendah mengurangi biaya 59% dibandingkan tingkat tinggi: $0.24 / $0.58 = 0.41.
  • Tingkat sedang pada 3.8 Flash hanya berbeda sekitar satu sen dari tingkat tinggi pada 3.7 Flash.

Perbandingan Gemini 3.8 Flash dan 3.7 Flash membantu menentukan model berdasarkan beban kerja, bukan hanya tarif per token.

Artificial Analysis juga mencantumkan harga gabungan $0.58 per juta token dengan rasio masukan-keluaran 3:1. Kecocokan angka tersebut dengan biaya tingkat tinggi per tugas hanyalah kebetulan: $0.58 adalah tarif per token gabungan, sedangkan biaya per tugas bergantung pada jumlah token yang dipilih model.

Maksimalkan tarif perkenalan sebelum 31 Desember

“Memaksimalkan” bukan berarti mengunci harga melalui kontrak. Google menagih token berdasarkan tarif yang berlaku saat token dikonsumsi. Anda tidak dapat membayar di muka penggunaan tahun 2027 dengan harga tahun 2026, dan beralih ke Gemini 3.7 atau 3.6 Flash juga tidak menghindarkan Anda dari kenaikan.

Yang dapat dilakukan adalah memindahkan pekerjaan diskresioner ke periode perkenalan:

  1. Jalankan pengisian ulang dan pemrosesan dokumen sekali jalan melalui Batch API.

Contoh 100 juta token—75 juta masukan dan 25 juta keluaran—berharga:

   75 × $0.375 + 25 × $1.875
   = $28.13 + $46.88
   = $74.99
Enter fullscreen mode Exit fullscreen mode

Pada Januari, biaya yang sama menjadi $149.98.

  1. Buat set evaluasi dan baseline token sebelum harga berubah. Dengan begitu, tagihan Januari hanya memiliki satu variabel yang berubah.

  2. Tentukan tingkat pemikiran per rute. Rute yang tetap menggunakan medium secara default perlu diuji. Jika sebuah rute lolos evaluasi pada low, pertahankan konfigurasi tersebut sebelum Januari.

Jika harga menjadi faktor utama dalam memilih penyedia, lihat rangkuman penyedia API LLM termurah dan perbandingan Fable 5.1 dengan GPT-5.6 Sol.

Perbandingan dengan Flash-Lite, Sonnet 5, dan GPT-5.6 Luna

Tarif per 1 juta [REDACTED CREDENTIAL] Model Masukan Keluaran Catatan
Gemini 3.8 Flash, perkenalan $0.75 $3.75 Token pemikiran ditagih sebagai keluaran; pembacaan cache $0.075
Gemini 3.8 Flash, mulai 1 Januari $1.50 $7.50 Pembacaan cache $0.15
Gemini 3.5 Flash-Lite $0.30 $2.50 Sekitar 350 token/detik
Claude Sonnet 5 $2 $10 Permanen; kenaikan 1 September dibatalkan
GPT-5.6 Luna $1 $6

Pada tarif perkenalan, masukan Gemini 3.8 Flash 2,5 kali lebih mahal daripada Flash-Lite, sedangkan keluarannya 1,5 kali lebih mahal.

Dibandingkan Claude Sonnet 5, Gemini 3.8 Flash sekitar 2,7 kali lebih murah:

  • Masukan: $2 / $0.75
  • Keluaran: $10 / $3.75

Dibandingkan GPT-5.6 Luna:

  • Masukan: $0.75 vs $1
  • Keluaran: $3.75 vs $6

Mulai 1 Januari 2027, Gemini 3.8 Flash menjadi lebih mahal daripada Luna pada masukan maupun keluaran. Selisihnya dengan Sonnet 5 menyempit menjadi sekitar 1,3 kali:

  • $2 / $1.50
  • $10 / $7.50

Flash-Lite tetap lebih murah. Namun, perbandingan tarif per token hanya separuh analisis. Model yang menggunakan lebih sedikit token dapat lebih murah per tugas walaupun tarifnya lebih tinggi. Jalankan set tugas yang sama pada setiap kandidat dan bandingkan data penggunaan.

API Gemini 3.8 Flash menjelaskan cara membaca usageMetadata dari Interactions API dan generateContent lama.

Cegah regresi biaya dengan pengujian token di Apidog

Masalah utama Gemini 3.8 Flash bukan selalu jawaban yang salah. Model bisa memberikan jawaban benar sambil menggunakan 40% lebih banyak token setelah perubahan prompt atau tingkat pemikiran.

Perlakukan jumlah token seperti kode status: simpan baseline dan tegaskan batasnya.

1. Simpan API key sebagai variabel lingkungan

Buat GEMINI_API_KEY di lingkungan Apidog, lalu referensikan sebagai {{GEMINI_API_KEY}} pada header x-goog-api-key. Dengan begitu, kunci tidak disimpan di permintaan.

2. Kirim prompt acuan

Simpan permintaan POST ke endpoint berikut:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Gunakan prompt yang representatif dan tetapkan thinkingConfig.thinkingLevel secara eksplisit untuk setiap rute produksi.

3. Tegaskan batas penggunaan

Tambahkan skrip pascapemrosesan berikut:

const usage = pm.response.json().usageMetadata;

pm.test("token pemikiran dalam anggaran", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});

pm.test("keluaran terlihat dalam anggaran", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});

pm.test("biaya permintaan dalam anggaran", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;

  pm.expect(cost).to.be.below(0.05);
});
Enter fullscreen mode Exit fullscreen mode

4. Jadwalkan pengujian

Masukkan permintaan ke dalam skenario pengujian dan jalankan secara berkala. Dengan begitu, lonjakan token menjadi kegagalan yang terlihat pada hari yang sama.

Baca panduan penjadwalan pengujian API di Apidog untuk menyiapkan jadwal. Pada 1 Januari, perbarui dua konstanta tarif dalam skrip agar penegasan biaya tetap sesuai tagihan.

Skenario yang sama dapat digunakan untuk membandingkan Flash-Lite, Sonnet 5, dan Luna. Arahkan salinan permintaan ke setiap model, lalu bandingkan bidang penggunaan secara berdampingan. Unduh Apidog; paket gratis mencakup alur kerja ini.

FAQ

Apakah Gemini 3.8 Flash lebih mahal daripada 3.7 Flash?

Per token, tidak. Keduanya berharga $0.75 untuk masukan dan $3.75 untuk keluaran hingga 31 Desember 2026, lalu menjadi $1.50 dan $7.50.

Per tugas, ya. Artificial Analysis mengukur biaya $0.58 per tugas pada tingkat tinggi untuk 3.8 Flash, dibandingkan $0.40 untuk 3.7 Flash, karena model baru menghasilkan sekitar 30% lebih banyak token keluaran.

Apakah token pemikiran ditagih terpisah?

Tidak. Token pemikiran ditagih sebagai keluaran dengan harga $3.75 per juta token selama periode perkenalan dan muncul di usageMetadata.thoughtsTokenCount.

Anda mengendalikannya secara tidak langsung melalui thinking_level. Gemini 3.8 Flash tidak memiliki anggaran token tetap, dan nilai minimal menghasilkan kesalahan validasi.

Apakah Gemini 3.8 Flash memiliki tingkat gratis?

Ya. AI Studio tidak mengenakan biaya untuk masukan atau keluaran pada tingkat gratis, tetapi menerapkan batas kecepatan dan menggunakan data untuk meningkatkan produk Google.

Aplikasi Gemini untuk konsumen hanya menyediakan Gemini 3.8 Flash bagi pelanggan AI Pro dan Ultra. Lihat panduan penggunaan gratis Gemini 3.8 Flash.

Apa yang terjadi pada biaya pada 1 Januari 2027?

Tarif masukan, keluaran, pembacaan cache, penyimpanan cache, dan Batch API semuanya berlipat ganda. Jika konsumsi token per tugas tetap sama, tagihan juga berlipat ganda. Tarif Gemini 3.6 dan 3.7 Flash naik pada tanggal yang sama.

Tingkat pemikiran mana yang paling hemat?

Mulailah dari data Artificial Analysis:

  • low: $0.24 per tugas
  • medium: $0.41 per tugas
  • high: $0.58 per tugas

Jalankan evaluasi sendiri pada setiap tingkat, pilih tingkat terendah yang memenuhi kualitas, lalu tegaskan jumlah token agar konfigurasi tidak berubah tanpa terdeteksi.

Yang perlu dilakukan minggu ini

Gemini 3.8 Flash memiliki tarif seperti 3.7 Flash, tetapi konsumsi token seperti model yang lebih besar.

Lakukan langkah berikut:

  1. Perlakukan thinking_level sebagai pengaturan biaya.
  2. Tetapkan tingkat pemikiran per rute produksi.
  3. Pindahkan pekerjaan yang cocok untuk batch ke periode perkenalan sebelum 31 Desember.
  4. Buat baseline penggunaan token sekarang.
  5. Tambahkan pengujian Apidog untuk token pemikiran, token keluaran, dan biaya permintaan.
  6. Jadwalkan evaluasi ulang pada 1 Januari 2027.

Dengan cara ini, kenaikan harga Januari menjadi perubahan yang sudah diperhitungkan, bukan kejutan pada tagihan.

Top comments (0)