Harga Gemini 3.8 Flash: Tarif Sama, Konsumsi Token Lebih Tinggi
Gemini 3.8 Flash berharga $0.75 per juta token masukan dan $3.75 per juta token keluaran—tarif perkenalan yang sama dengan Gemini 3.7 Flash hingga 31 Desember 2026. Mulai 1 Januari 2027, tarifnya menjadi $1.50 dan $7.50. Penggandaan yang sama berlaku untuk 3.6 Flash dan 3.7 Flash. Jadi, rilis ini tidak mengubah harga per token, tetapi mengubah jumlah token yang digunakan model.
Google menyebut Gemini 3.8 Flash “bekerja lebih keras”: model menjalankan lebih banyak langkah penalaran, memanggil alat secara iteratif, dan dapat menggunakan lebih banyak token untuk tugas yang panjang serta kompleks. Artificial Analysis mengukur dampaknya secara independen: Intelligence Index membutuhkan biaya $0.58 per tugas pada 3.8 Flash dengan tingkat pemikiran tinggi, dibandingkan $0.40 pada 3.7 Flash. Model baru menggunakan sekitar 30% lebih banyak token keluaran per tugas.
Dengan kata lain: harga eceran sama, tetapi tagihan per tugas bisa lebih tinggi.
Untuk gambaran umum model, baca apa itu Gemini 3.8 Flash.
Sekilas harga Gemini 3.8 Flash
Semua harga berikut berlaku per 1 juta token pada tingkat berbayar.
| Tarif | Perkenalan hingga 31 Desember 2026 | Standar mulai 1 Januari 2027 |
|---|---|---|
| Masukan: teks, gambar, video, audio, PDF | $0.75 | $1.50 |
| Keluaran, termasuk token pemikiran | $3.75 | $7.50 |
| Pembacaan cache konteks | $0.075 | $0.15 |
| Penyimpanan cache per 1 juta token per jam | $0.50 | $1.00 |
| Masukan Batch API, diskon 50% | $0.375 | $0.75 |
| Keluaran Batch API, diskon 50% | $1.875 | $3.75 |
| Penelusuran Google | 5.000 permintaan gratis/bulan untuk seluruh Gemini 3.x, lalu $14 per 1.000 permintaan | Sama |
| Tingkat gratis | $0, dengan batas kecepatan; data digunakan untuk meningkatkan produk Google | Sama |
Tiga hal penting:
- Token pemikiran ditagih sebagai token keluaran dengan harga $3.75, bukan sebagai masukan seharga $0.75.
- Tarif perkenalan memiliki tanggal berakhir yang pasti.
- Tarif 3.6 dan 3.7 Flash juga berlipat ganda pada 1 Januari 2027. Beralih ke model lama tidak menghindarkan Anda dari kenaikan tersebut.
Rincian harga Gemini 3.7 Flash menunjukkan tarif yang sama pada model yang menggunakan lebih sedikit token per tugas.
Token pemikiran dihitung sebagai token keluaran
Gemini 3.8 Flash melakukan penalaran sebelum memberikan jawaban. Setiap token penalaran dihitung sebagai keluaran dan dilaporkan melalui usageMetadata.thoughtsTokenCount pada respons generateContent.
Respons juga memuat:
-
candidatesTokenCount: token jawaban yang terlihat -
promptTokenCount: token masukan
thoughtsTokenCount dan candidatesTokenCount dikenakan tarif keluaran yang sama, yaitu $3.75 per juta token selama periode perkenalan.
Jumlah penalaran dikendalikan dengan:
thinking_level: low | medium | high
Pada Gemini 3.8 Flash:
- Nilai default adalah
medium, bukanhighseperti pada Gemini 3 Pro. - Nilai
minimalsudah tidak tersedia dan menghasilkan kesalahan validasi. - Konfigurasi lama yang menggunakan
minimalperlu dipetakan kelow. -
thinking_leveladalah tingkat usaha relatif, bukan anggaran token. - Anda tidak dapat membatasi token pemikiran secara langsung menggunakan anggaran bilangan bulat seperti
thinking_budgetpada model lama.
Lihat dokumentasi pemikiran Google dan panduan tingkat pemikiran Gemini 3.8 Flash untuk detail latensi dan biaya.
Contoh perhitungan
Misalkan satu permintaan:
- 10.000 token masukan
- 2.000 token keluaran yang terlihat
- 6.000 token pemikiran
Dengan tarif perkenalan:
Masukan:
10.000 × $0.75 / 1.000.000 = $0.0075
Keluaran:
(2.000 + 6.000) × $3.75 / 1.000.000 = $0.03
Total:
$0.0375 per permintaan
Token pemikiran menyumbang 75% dari biaya keluaran dan 60% dari total biaya permintaan.
Mulai 1 Januari 2027, permintaan yang sama berharga:
$0.015 + $0.06 = $0.075
Jadi, pernyataan “harga Gemini 3.8 Flash sama dengan 3.7 Flash” benar untuk tarif per token, tetapi tidak menjelaskan perubahan konsumsi token.
Mengapa biaya per tugas naik?
Menurut pos peluncuran Google, Gemini 3.8 Flash menjalankan langkah penalaran tambahan dan memanggil alat secara iteratif pada tugas kompleks untuk memverifikasi pekerjaannya.
Dampaknya:
- lebih banyak token pemikiran;
- lebih banyak giliran pemanggilan alat dalam loop agen;
- biaya per tugas lebih tinggi meskipun tarif per token tetap.
Mitigasi yang disarankan Google:
- turunkan
thinking_level; - atau tetap gunakan Gemini 3.7 Flash.
Artificial Analysis menguji sembilan evaluasi dalam Intelligence Index. Gemini 3.8 Flash mencetak 59 pada tingkat tinggi, dibandingkan 56 untuk Gemini 3.7 Flash pada tingkat yang sama. Rata-rata token keluaran Gemini 3.8 Flash sekitar 48.000 per tugas, naik 30%.
| Konfigurasi | Biaya per tugas, tarif perkenalan | Waktu per tugas |
|---|---|---|
| Gemini 3.8 Flash, tinggi | $0.58 | 2,5 menit |
| Gemini 3.8 Flash, sedang | $0.41 | Tidak dipublikasikan |
| Gemini 3.8 Flash, rendah | $0.24 | 0,8 menit |
| Gemini 3.7 Flash, tinggi | $0.40 | 2,2 menit |
Cara membaca tabel:
- Gemini 3.8 Flash pada tingkat tinggi berharga 45% lebih mahal per tugas daripada 3.7 Flash:
$0.58 / $0.40 = 1.45. - Menurunkan tingkat 3.8 Flash dari tinggi ke sedang mengurangi biaya 29%:
$0.41 / $0.58 = 0.71. - Tingkat rendah mengurangi biaya 59% dibandingkan tingkat tinggi:
$0.24 / $0.58 = 0.41. - Tingkat sedang pada 3.8 Flash hanya berbeda sekitar satu sen dari tingkat tinggi pada 3.7 Flash.
Perbandingan Gemini 3.8 Flash dan 3.7 Flash membantu menentukan model berdasarkan beban kerja, bukan hanya tarif per token.
Artificial Analysis juga mencantumkan harga gabungan $0.58 per juta token dengan rasio masukan-keluaran 3:1. Kecocokan angka tersebut dengan biaya tingkat tinggi per tugas hanyalah kebetulan: $0.58 adalah tarif per token gabungan, sedangkan biaya per tugas bergantung pada jumlah token yang dipilih model.
Maksimalkan tarif perkenalan sebelum 31 Desember
“Memaksimalkan” bukan berarti mengunci harga melalui kontrak. Google menagih token berdasarkan tarif yang berlaku saat token dikonsumsi. Anda tidak dapat membayar di muka penggunaan tahun 2027 dengan harga tahun 2026, dan beralih ke Gemini 3.7 atau 3.6 Flash juga tidak menghindarkan Anda dari kenaikan.
Yang dapat dilakukan adalah memindahkan pekerjaan diskresioner ke periode perkenalan:
- Jalankan pengisian ulang dan pemrosesan dokumen sekali jalan melalui Batch API.
Contoh 100 juta token—75 juta masukan dan 25 juta keluaran—berharga:
75 × $0.375 + 25 × $1.875
= $28.13 + $46.88
= $74.99
Pada Januari, biaya yang sama menjadi $149.98.
Buat set evaluasi dan baseline token sebelum harga berubah. Dengan begitu, tagihan Januari hanya memiliki satu variabel yang berubah.
Tentukan tingkat pemikiran per rute. Rute yang tetap menggunakan
mediumsecara default perlu diuji. Jika sebuah rute lolos evaluasi padalow, pertahankan konfigurasi tersebut sebelum Januari.
Jika harga menjadi faktor utama dalam memilih penyedia, lihat rangkuman penyedia API LLM termurah dan perbandingan Fable 5.1 dengan GPT-5.6 Sol.
Perbandingan dengan Flash-Lite, Sonnet 5, dan GPT-5.6 Luna
| Tarif per 1 juta [REDACTED CREDENTIAL] Model | Masukan | Keluaran | Catatan |
|---|---|---|---|
| Gemini 3.8 Flash, perkenalan | $0.75 | $3.75 | Token pemikiran ditagih sebagai keluaran; pembacaan cache $0.075 |
| Gemini 3.8 Flash, mulai 1 Januari | $1.50 | $7.50 | Pembacaan cache $0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Sekitar 350 token/detik |
| Claude Sonnet 5 | $2 | $10 | Permanen; kenaikan 1 September dibatalkan |
| GPT-5.6 Luna | $1 | $6 | — |
Pada tarif perkenalan, masukan Gemini 3.8 Flash 2,5 kali lebih mahal daripada Flash-Lite, sedangkan keluarannya 1,5 kali lebih mahal.
Dibandingkan Claude Sonnet 5, Gemini 3.8 Flash sekitar 2,7 kali lebih murah:
- Masukan:
$2 / $0.75 - Keluaran:
$10 / $3.75
Dibandingkan GPT-5.6 Luna:
- Masukan:
$0.75vs$1 - Keluaran:
$3.75vs$6
Mulai 1 Januari 2027, Gemini 3.8 Flash menjadi lebih mahal daripada Luna pada masukan maupun keluaran. Selisihnya dengan Sonnet 5 menyempit menjadi sekitar 1,3 kali:
$2 / $1.50$10 / $7.50
Flash-Lite tetap lebih murah. Namun, perbandingan tarif per token hanya separuh analisis. Model yang menggunakan lebih sedikit token dapat lebih murah per tugas walaupun tarifnya lebih tinggi. Jalankan set tugas yang sama pada setiap kandidat dan bandingkan data penggunaan.
API Gemini 3.8 Flash menjelaskan cara membaca usageMetadata dari Interactions API dan generateContent lama.
Cegah regresi biaya dengan pengujian token di Apidog
Masalah utama Gemini 3.8 Flash bukan selalu jawaban yang salah. Model bisa memberikan jawaban benar sambil menggunakan 40% lebih banyak token setelah perubahan prompt atau tingkat pemikiran.
Perlakukan jumlah token seperti kode status: simpan baseline dan tegaskan batasnya.
1. Simpan API key sebagai variabel lingkungan
Buat GEMINI_API_KEY di lingkungan Apidog, lalu referensikan sebagai {{GEMINI_API_KEY}} pada header x-goog-api-key. Dengan begitu, kunci tidak disimpan di permintaan.
2. Kirim prompt acuan
Simpan permintaan POST ke endpoint berikut:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Gunakan prompt yang representatif dan tetapkan thinkingConfig.thinkingLevel secara eksplisit untuk setiap rute produksi.
3. Tegaskan batas penggunaan
Tambahkan skrip pascapemrosesan berikut:
const usage = pm.response.json().usageMetadata;
pm.test("token pemikiran dalam anggaran", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("keluaran terlihat dalam anggaran", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("biaya permintaan dalam anggaran", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
4. Jadwalkan pengujian
Masukkan permintaan ke dalam skenario pengujian dan jalankan secara berkala. Dengan begitu, lonjakan token menjadi kegagalan yang terlihat pada hari yang sama.
Baca panduan penjadwalan pengujian API di Apidog untuk menyiapkan jadwal. Pada 1 Januari, perbarui dua konstanta tarif dalam skrip agar penegasan biaya tetap sesuai tagihan.
Skenario yang sama dapat digunakan untuk membandingkan Flash-Lite, Sonnet 5, dan Luna. Arahkan salinan permintaan ke setiap model, lalu bandingkan bidang penggunaan secara berdampingan. Unduh Apidog; paket gratis mencakup alur kerja ini.
FAQ
Apakah Gemini 3.8 Flash lebih mahal daripada 3.7 Flash?
Per token, tidak. Keduanya berharga $0.75 untuk masukan dan $3.75 untuk keluaran hingga 31 Desember 2026, lalu menjadi $1.50 dan $7.50.
Per tugas, ya. Artificial Analysis mengukur biaya $0.58 per tugas pada tingkat tinggi untuk 3.8 Flash, dibandingkan $0.40 untuk 3.7 Flash, karena model baru menghasilkan sekitar 30% lebih banyak token keluaran.
Apakah token pemikiran ditagih terpisah?
Tidak. Token pemikiran ditagih sebagai keluaran dengan harga $3.75 per juta token selama periode perkenalan dan muncul di usageMetadata.thoughtsTokenCount.
Anda mengendalikannya secara tidak langsung melalui thinking_level. Gemini 3.8 Flash tidak memiliki anggaran token tetap, dan nilai minimal menghasilkan kesalahan validasi.
Apakah Gemini 3.8 Flash memiliki tingkat gratis?
Ya. AI Studio tidak mengenakan biaya untuk masukan atau keluaran pada tingkat gratis, tetapi menerapkan batas kecepatan dan menggunakan data untuk meningkatkan produk Google.
Aplikasi Gemini untuk konsumen hanya menyediakan Gemini 3.8 Flash bagi pelanggan AI Pro dan Ultra. Lihat panduan penggunaan gratis Gemini 3.8 Flash.
Apa yang terjadi pada biaya pada 1 Januari 2027?
Tarif masukan, keluaran, pembacaan cache, penyimpanan cache, dan Batch API semuanya berlipat ganda. Jika konsumsi token per tugas tetap sama, tagihan juga berlipat ganda. Tarif Gemini 3.6 dan 3.7 Flash naik pada tanggal yang sama.
Tingkat pemikiran mana yang paling hemat?
Mulailah dari data Artificial Analysis:
-
low: $0.24 per tugas -
medium: $0.41 per tugas -
high: $0.58 per tugas
Jalankan evaluasi sendiri pada setiap tingkat, pilih tingkat terendah yang memenuhi kualitas, lalu tegaskan jumlah token agar konfigurasi tidak berubah tanpa terdeteksi.
Yang perlu dilakukan minggu ini
Gemini 3.8 Flash memiliki tarif seperti 3.7 Flash, tetapi konsumsi token seperti model yang lebih besar.
Lakukan langkah berikut:
- Perlakukan
thinking_levelsebagai pengaturan biaya. - Tetapkan tingkat pemikiran per rute produksi.
- Pindahkan pekerjaan yang cocok untuk batch ke periode perkenalan sebelum 31 Desember.
- Buat baseline penggunaan token sekarang.
- Tambahkan pengujian Apidog untuk token pemikiran, token keluaran, dan biaya permintaan.
- Jadwalkan evaluasi ulang pada 1 Januari 2027.
Dengan cara ini, kenaikan harga Januari menjadi perubahan yang sudah diperhitungkan, bukan kejutan pada tagihan.

Top comments (0)