DEV Community

Cover image for Penjelasan Harga Gemini 3.7 Flash: Amankan Tarif Sebelum Naik Dua Kali Lipat
Walse
Walse

Posted on Originally published at apidog.com

Penjelasan Harga Gemini 3.7 Flash: Amankan Tarif Sebelum Naik Dua Kali Lipat

Google merilis Gemini 3.7 Flash pada 13 Agustus 2026, tiga minggu setelah 3.6 Flash, dan menyebutnya “model pekerja keras kami yang paling cerdas”. Bagi tim yang memantau tagihan API, angka paling penting bukan hanya benchmark: tarif pengantar sebesar $0.75 per 1 juta token input dan $3.75 per 1 juta token output berakhir pada 31 Desember 2026. Mulai 1 Januari 2027, kedua tarif tersebut naik 2x.

Coba Apidog hari ini

Kenaikan ini berlaku tanpa perubahan pada kode, trafik, atau prompt Anda. Chatbot yang saat ini menghabiskan sekitar $790 per bulan dapat menjadi $1.575 per bulan pada Januari. Saat menyusun anggaran Gemini 3.7 Flash, hitung biaya untuk tarif pengantar dan tarif standar.

Panduan ini membahas:

  • dua tingkatan harga;
  • cara menghitung biaya dari token aktual;
  • estimasi untuk chatbot, pemrosesan PDF, dan agen;
  • langkah praktis untuk menurunkan biaya sebelum harga naik;
  • cara melacak penggunaan token per endpoint.

Jika Anda belum membuat request pertama, ikuti panduan memulai cepat API Gemini 3.7 Flash. Setelah request berjalan, Apidog dapat menampilkan usageMetadata dari setiap respons untuk memverifikasi estimasi token Anda dengan trafik nyata.

TL;DR

  • Tarif pengantar berlaku hingga 31 Desember 2026: $0.75 / 1 juta token input dan $3.75 / 1 juta token output.
  • Mulai 1 Januari 2027, tarif menjadi $1.50 input dan $7.50 output per 1 juta token.
  • Harga pengantar adalah setengah dari biaya Gemini 3.6 Flash saat diluncurkan.
  • Gemini 3.7 Flash menerima teks, gambar, video, audio, dan PDF dalam jendela konteks 1 juta token, dengan batas output 64 ribu token.
  • Chatbot dengan 10.000 request per hari diperkirakan menghabiskan sekitar $26,25/hari pada tarif pengantar dan $52,50/hari pada tarif standar.
  • Pengungkit biaya utama: batasi output, cache konteks statis, batch pekerjaan non-interaktif, dan arahkan tugas ringan ke model lebih kecil.

Dua tingkatan harga

Gemini 3.7 Flash menggunakan diskon pengantar dengan batas waktu, bukan harga permanen.

Tingkatan Jendela waktu Input per 1 juta token Output per 1 juta token
Pengantar 13 Agustus 2026–31 Desember 2026 $0.75 $3.75
Standar Mulai 1 Januari 2027 $1.50 $7.50

Ada dua implikasi langsung:

  1. Buat baseline biaya sekarang. Tarif pengantar adalah setengah dari biaya Gemini 3.6 Flash saat peluncuran. Jika Anda mempertimbangkan upgrade, gunakan panduan migrasi Gemini 3.6 ke 3.7 Flash untuk menjalankan uji regresi sebelum memindahkan trafik.
  2. Prioritaskan pengurangan output. Token output berharga 5x token input pada kedua tingkatan. Memotong respons dari 2.000 token menjadi 500 token biasanya lebih berdampak daripada memangkas sedikit teks dari system prompt.

Harga ini berlaku untuk Gemini API yang ditagih melalui kunci AI Studio. Vertex AI menggunakan penagihan Google Cloud dan SKU tersendiri. Konfirmasikan harga saat ini, caching, dan batch processing di halaman harga resmi Gemini API sebelum menetapkan anggaran produksi.

Cara menghitung biaya request

Gunakan rumus berikut untuk menghitung biaya berdasarkan token yang terukur:

biaya_input  = (jumlah_token_input / 1_000_000) × tarif_input
biaya_output = (jumlah_token_output / 1_000_000) × tarif_output
biaya_total  = biaya_input + biaya_output
Enter fullscreen mode Exit fullscreen mode

Contoh request chatbot pada tarif pengantar:

  • Input: 2.000 token
  • Output: 300 token
input  = (2.000 / 1.000.000) × $0.75 = $0.0015
output = (300 / 1.000.000) × $3.75 = $0.001125
total  = $0.002625 per request
Enter fullscreen mode Exit fullscreen mode

Pada tarif standar, biaya request yang sama menjadi sekitar $0.00525.

Jangan hanya mengandalkan perkiraan karakter atau panjang prompt. Ambil angka aktual dari:

{
  "usageMetadata": {
    "promptTokenCount": 2000,
    "candidatesTokenCount": 300
  }
}
Enter fullscreen mode Exit fullscreen mode

Berapa biaya beban kerja nyata?

Berikut tiga profil beban kerja. Ganti volume request dan jumlah token dengan data endpoint Anda sendiri.

Beban kerja 1: chatbot dukungan pelanggan

Asumsi:

  • 10.000 request per hari;
  • 2.000 token input per request;
  • 300 token output per request.
Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 20 juta $15.00 $30.00
Output 3 juta $11.25 $22.50
Total 23 juta $26.25 $52.50

Dalam 30 hari, estimasinya:

  • Tarif pengantar: sekitar $788/bulan
  • Tarif standar: sekitar $1.575/bulan

Untuk endpoint chat, mulai dengan batas output eksplisit:

{
  "generationConfig": {
    "maxOutputTokens": 500
  }
}
Enter fullscreen mode Exit fullscreen mode

Jika respons dukungan biasanya cukup dalam 300–500 token, jangan biarkan endpoint menggunakan batas output maksimum 64 ribu token.

Beban kerja 2: pipeline dokumen PDF

Gemini 3.7 Flash membaca PDF secara native. Skor benchmark GDP.pdf meningkat dari 22.0% menjadi 34.0% dibandingkan 3.6 Flash, sehingga ekstraksi dan ringkasan dokumen merupakan salah satu beban kerja yang relevan.

Asumsi:

  • 500 dokumen per hari;
  • 40.000 token input per dokumen;
  • 1.000 token output untuk ringkasan terstruktur.
Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 20 juta $15.00 $30.00
Output 0.5 juta $1.88 $3.75
Total 20.5 juta $16.88 $33.75

Estimasi bulanan:

  • Tarif pengantar: sekitar $506/bulan
  • Tarif standar: sekitar $1.013/bulan

Pada pola ini, input mendominasi biaya. Fokus optimasi sebaiknya pada:

  • menghapus halaman atau lampiran yang tidak relevan;
  • menyimpan dokumen kebijakan atau instruksi berulang di cache;
  • memproses dokumen secara batch jika tidak memerlukan respons real-time.

Beban kerja 3: loop agen

Agen dapat meningkatkan biaya dengan cepat karena konteks dan jumlah panggilan bertambah pada setiap langkah.

Asumsi:

  • 200 tugas per hari;
  • 12 panggilan model per tugas;
  • 8.000 token input per panggilan;
  • 400 token output per panggilan.
Item Token harian Biaya pengantar/hari Biaya standar/hari
Input 19.2 juta $14.40 $28.80
Output 0.96 juta $3.60 $7.20
Total 20.16 juta $18.00 $36.00

Estimasi bulanan:

  • Tarif pengantar: $540/bulan
  • Tarif standar: $1.080/bulan

Untuk agen, pantau dua metrik per tugas:

jumlah_panggilan_model
total_token_input
Enter fullscreen mode Exit fullscreen mode

Tugas yang tumbuh dari 12 menjadi 20 panggilan akan menjadi sekitar 67% lebih mahal jika pola token per panggilan tetap sama. Tambahkan batas iterasi dan hentikan loop ketika tool call tidak lagi menghasilkan progres.

Batas output 64 ribu token juga menentukan biaya terburuk per panggilan:

  • sekitar $0.24 pada tarif pengantar;
  • sekitar $0.48 pada tarif standar.

Batas ini tidak membuat retry loop murah. Retry yang terus menghasilkan output panjang tetap dapat menghabiskan anggaran dengan cepat.

Posisi harga Gemini 3.7 Flash

Perbandingan harga lintas penyedia berubah cepat, jadi gunakan informasi ini sebagai posisi pasar, bukan daftar harga permanen.

Gemini 3.7 Flash berada di kelas model pekerja keras: lebih murah daripada model perintis seperti lini Gemini Pro, model Claude yang lebih besar, atau tingkatan unggulan OpenAI, tetapi membawa skor benchmark yang tumpang tindih dengan model unggulan sebelumnya. Google melaporkan 65.3% pada DeepSWE v1.1 dan Elo Arena WebDev 1588.

Untuk keputusan implementasi, jangan memilih model hanya dari benchmark. Uji endpoint Anda sendiri:

  1. Siapkan dataset request representatif.
  2. Jalankan request pada model kandidat.
  3. Ukur kualitas respons, token input, token output, latency, dan error rate.
  4. Hitung biaya per request dan biaya per tugas yang berhasil.
  5. Rute setiap kelas tugas ke model termurah yang tetap memenuhi kualitas minimum.

Penyedia tingkat anggaran juga dapat mengubah harga. DeepSeek, misalnya, menaikkan tarif API dan mendorong banyak tim mengevaluasi ulang anggaran token mereka, seperti dibahas dalam panduan peningkatan harga dan optimasi biaya DeepSeek.

Untuk prototipe kecil, kenaikan 2x mungkin tidak material. Namun, pipeline yang menghabiskan $10.000 per bulan dan naik menjadi $20.000 per bulan perlu masuk dalam proyeksi keuangan sebelum Januari.

Lima cara memangkas pengeluaran token

1. Batasi token output per endpoint

Atur maxOutputTokens ke nilai minimum yang dibutuhkan endpoint.

{
  "generationConfig": {
    "maxOutputTokens": 500
  }
}
Enter fullscreen mode Exit fullscreen mode

Contoh batas awal yang dapat diuji:

Endpoint Batas awal yang disarankan
Balasan dukungan pelanggan 500
Klasifikasi 100
Ekstraksi JSON singkat 300
Ringkasan dokumen 1.000–2.000
Langkah perencanaan agen 500–1.000

Jalankan evaluasi kualitas setelah menerapkan batas. Jika respons mulai terpotong, naikkan secara bertahap, bukan langsung ke puluhan ribu token.

2. Cache konteks statis

Jika setiap request mengirim ulang system prompt, kebijakan, dokumentasi produk, atau instruksi yang sama, Anda membayar ulang token yang identik.

Contoh pola yang perlu dicache:

[system prompt 1.500 token]
[kebijakan perusahaan 1.500 token]
[pesan pengguna dinamis]
Enter fullscreen mode Exit fullscreen mode

Untuk chatbot dengan awalan statis 1.500 token dari total 2.000 token input, caching dapat memangkas sebagian besar biaya input berulang. Periksa konfigurasi dan tarif terbaru di dokumentasi Gemini API.

3. Batch pekerjaan non-interaktif

Gunakan batch processing untuk pekerjaan yang tidak membutuhkan respons instan, misalnya:

  • ringkasan PDF harian;
  • ekstraksi metadata dokumen;
  • klasifikasi arsip;
  • evaluasi dataset;
  • pembuatan deskripsi produk dalam jumlah besar.

Pisahkan antrean interaktif dan non-interaktif:

request pengguna langsung  -> endpoint real-time
dokumen masuk / pekerjaan malam -> antrean batch
Enter fullscreen mode Exit fullscreen mode

Pendekatan ini menukar latency dengan tarif diskon untuk workload yang memang tidak sensitif terhadap waktu respons.

4. Sesuaikan ukuran model per rute

Tidak setiap request membutuhkan Gemini 3.7 Flash. Gunakan model yang lebih ringan untuk tugas sederhana seperti:

  • klasifikasi intent;
  • routing;
  • ekstraksi field pendek;
  • validasi format;
  • tagging;
  • deteksi bahasa.

Pertahankan Gemini 3.7 Flash untuk tugas yang benar-benar membutuhkan kemampuan lebih tinggi:

  • perencanaan multi-langkah;
  • debugging;
  • reasoning berbasis dokumen panjang;
  • rantai tool call;
  • ekstraksi kompleks dari PDF.

Buat aturan routing yang eksplisit:

jika tugas = klasifikasi sederhana -> model ringan
jika tugas = respons dukungan standar -> model ringan atau Flash-Lite
jika tugas = analisis dokumen kompleks -> Gemini 3.7 Flash
jika tugas = loop agen / debugging -> Gemini 3.7 Flash
Enter fullscreen mode Exit fullscreen mode

5. Prototipe di tingkatan gratis

Gunakan kuota gratis AI Studio untuk menyempurnakan:

  • system prompt;
  • format JSON;
  • skema respons;
  • batas output;
  • test case;
  • fallback behavior.

Dengan begitu, token berbayar baru digunakan setelah prompt dan kontrak respons stabil. Panduan akses API Gemini gratis membahas cakupan jalur gratis dan batasnya.

Lacak pengeluaran per endpoint dengan Apidog

Estimasi berguna untuk perencanaan. Pengukuran per request diperlukan untuk menjaga biaya tetap terkendali.

Setiap respons Gemini menyertakan usageMetadata. Anda dapat menggunakan data ini untuk membuat pengujian regresi token bersama pengujian API biasa.

Di Apidog, gunakan alur kerja berikut:

  1. Simpan satu request untuk setiap endpoint produksi, misalnya chat, ringkasan dokumen, dan langkah agen.
  2. Simpan API key di environment variable, bukan langsung di request.
   GEMINI_API_KEY
Enter fullscreen mode Exit fullscreen mode
  1. Kirim payload realistis dan ekstrak token dari respons:
   {
     "usageMetadata": {
       "promptTokenCount": 2450,
       "candidatesTokenCount": 420
     }
   }
Enter fullscreen mode Exit fullscreen mode
  1. Tambahkan assertion untuk batas token endpoint. Contohnya, endpoint chat tidak boleh melebihi 2.500 token input:
   usageMetadata.promptTokenCount <= 2500
Enter fullscreen mode Exit fullscreen mode
  1. Jalankan ulang skenario setiap kali system prompt, schema, tool definition, atau konteks berubah.

Dengan pola ini, regresi token akan gagal di pipeline pengujian sebelum masuk ke produksi. Misalnya, perubahan prompt yang menaikkan input dari 2.000 menjadi 2.500 token meningkatkan biaya input endpoint sebesar 25%.

Kalikan token aktual tersebut dengan tarif aktif:

biaya_request =
  (promptTokenCount / 1_000_000 × tarif_input) +
  (candidatesTokenCount / 1_000_000 × tarif_output)
Enter fullscreen mode Exit fullscreen mode

Tim yang sudah menggunakan assertion untuk API testing dapat menerapkan pola yang sama pada biaya token. Untuk struktur skenario pengujian yang lebih luas, lihat panduan pengujian API untuk insinyur QA.

FAQ

Kapan harga Gemini 3.7 Flash naik dua kali lipat?

Pada 1 Januari 2027. Tarif pengantar $0.75 per 1 juta token input dan $3.75 per 1 juta token output berlaku hingga 31 Desember 2026. Setelah itu, tarif menjadi $1.50 dan $7.50.

Apakah Gemini 3.7 Flash lebih murah dari Gemini 3.6 Flash?

Saat peluncuran, ya. Harga pengantar 3.7 Flash adalah setengah dari harga peluncuran 3.6 Flash, sementara benchmark meningkat secara keseluruhan. DeepSWE v1.1, misalnya, meningkat dari 49.0% menjadi 65.3%.

Untuk spesifikasi dan benchmark berdampingan, lihat referensi cepat Gemini 3.7 Flash.

Apakah harga pengantar berlaku di Vertex AI?

Tarif dalam panduan ini adalah tarif Gemini API melalui kunci AI Studio. Vertex AI menggunakan penagihan Google Cloud, SKU, dan ketentuan tersendiri. Periksa konsol billing GCP dan halaman harga resmi sebelum mengasumsikan tarifnya sama.

Apa yang dihitung sebagai token input?

Semua konten yang dikirim ke model dihitung sebagai input, termasuk:

  • teks;
  • gambar;
  • video;
  • audio;
  • halaman PDF;
  • system prompt;
  • riwayat percakapan;
  • hasil tool call.

Gunakan usageMetadata dari respons untuk melihat jumlah token aktual setelah request diproses.

Bagaimana cara memperkirakan token sebelum mengirim request?

Gunakan endpoint countTokens untuk mengukur payload tanpa menghasilkan respons, atau kirim sejumlah request representatif lalu baca usageMetadata.

Selalu ukur payload nyata. Estimasi tokenizer dari penyedia atau keluarga model lain tidak selalu relevan.

Posisi Gemini 3.7 Flash dalam stack Anda

Gemini 3.7 Flash menawarkan harga pengantar yang rendah, tetapi tanggal kenaikan tarifnya sudah diketahui. Gunakan periode ini untuk mengumpulkan data, bukan hanya memindahkan trafik.

Langkah praktisnya:

  1. Pindahkan workload kandidat ke Gemini 3.7 Flash.
  2. Ukur token input dan output aktual per endpoint.
  3. Hitung biaya pada tarif pengantar dan tarif standar.
  4. Terapkan batas output dan assertion token.
  5. Cache konteks statis dan batch workload non-interaktif.
  6. Rute tugas sederhana ke model yang lebih ringan.
  7. Gunakan data tersebut untuk menyusun proyeksi biaya Januari.

Unduh Apidog untuk menyimpan request Gemini, environment, assertion token, dan pemeriksaan biaya dalam satu workspace—agar tagihan Januari menjadi angka yang sudah Anda prediksi, bukan kejutan yang baru ditemukan.

Top comments (0)