DEV Community

Cover image for Gemini 3.8 Flash vs 3.7 Flash: Perbedaan dan Haruskah Anda Upgrade?
Walse
Walse

Posted on Originally published at apidog.com

Gemini 3.8 Flash vs 3.7 Flash: Perbedaan dan Haruskah Anda Upgrade?

Gemini 3.8 Flash vs Gemini 3.7 Flash: Apakah Upgrade Ini Layak?

Google merilis Gemini 3.8 Flash pada 2 September 2026, tiga minggu setelah Gemini 3.7 Flash dan enam minggu setelah 3.6 Flash. Harga perkenalan, konteks 1 juta token, dan kecepatannya kurang lebih sama. Perubahan utamanya ada pada cara model bekerja: Gemini 3.8 Flash menggunakan langkah penalaran yang lebih kecil, memverifikasi hasilnya sendiri, dan memanggil alat secara berulang. Hasilnya, skor tolok ukur meningkat—tetapi setiap tugas juga dapat menggunakan lebih banyak token.

Coba Apidog hari ini

Jadi, pertanyaan yang tepat bukan sekadar “apakah Gemini 3.8 Flash lebih baik?”. Di atas kertas, jawabannya ya. Pertanyaannya adalah apakah kualitas tambahan sepadan dengan biaya token ekstra pada beban kerja Anda, serta apakah perubahan yang bersifat merusak akan memengaruhi kode yang sudah ada.

Perbandingan ini merangkum perbedaan, biaya, perubahan API, dan rekomendasi berdasarkan beban kerja. Sumbernya mencakup postingan peluncuran Google, dokumentasi model terbaru Gemini, dan pengujian independen Artificial Analysis. Untuk spesifikasi lengkap, lihat apa itu Gemini 3.8 Flash.

Google juga menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh” dan belum mengumumkan tanggal penghentian. Anda tidak harus segera bermigrasi.

Perbandingan singkat

Atribut Gemini 3.8 Flash Gemini 3.7 Flash
ID model gemini-3.8-flash gemini-3.7-flash
Dirilis 2 September 2026 13 Agustus 2026
Dasar “Berdasarkan Gemini 3.7 Flash” (kartu model) t/a
Konteks / keluaran maksimum 1.048.576 / 65.536 token Sama
Harga masukan hingga 31 Desember 2026 $0,75 per juta token $0,75 per juta token
Harga keluaran hingga 31 Desember 2026 $3,75 per juta token, termasuk pemikiran $3,75 per juta token, termasuk pemikiran
Harga standar mulai 1 Januari 2027 $1,50 / $7,50 per juta token $1,50 / $7,50 per juta token
Pembacaan cache konteks $0,075 per juta token selama periode perkenalan Sama
Batch Diskon 50%, tingkat token antrean sama Sama
Tingkat pemikiran low, medium (default), high low, medium, high
Tingkat pemikiran minimal Kesalahan validasi Diterima; petakan ke low saat migrasi
Batas pengetahuan Maret 2026 Tidak lagi disebutkan di dokumentasi 3.8
Kecepatan keluaran Artificial Analysis Sekitar 300 token/detik; terukur 302,1 Menurut Google, kurang lebih sama
Indeks Kecerdasan Artificial Analysis 59, tinggi 56, tinggi
Status dukungan Saat ini Tetap didukung penuh, tanpa tanggal penghentian

Apa yang tetap sama?

Harga

Kedua model berada pada baris harga yang sama di halaman harga Google:

  • Masukan: $0,75 per juta token hingga 31 Desember 2026
  • Keluaran: $3,75 per juta token hingga 31 Desember 2026
  • Mulai 1 Januari 2027: $1,50 untuk masukan dan $7,50 untuk keluaran
  • Pembacaan cache, diskon batch, dan 5.000 permintaan grounding Google Search gratis per bulan tetap berlaku

Referensi spesifikasi dan harga Gemini 3.7 Flash juga masih dapat digunakan sebagai referensi harga Gemini 3.8 Flash secara baris per baris.

Konteks dan modalitas

Batasnya tidak berubah:

  • Masukan maksimum: 1.048.576 token
  • Keluaran maksimum: 65.536 token
  • Masukan: teks, gambar, video, audio, dan PDF
  • Keluaran: teks

Kedua model tidak mendukung pembuatan audio, pembuatan gambar, atau Live API.

Kecepatan

Logan Kilpatrick dari Google menggambarkan Gemini 3.8 Flash sebagai model dengan “harga yang sama dengan 3.7, kecepatannya kurang lebih sama”.

Artificial Analysis mengukur:

  • Throughput keluaran: 302,1 token/detik pada tingkat high
  • Waktu hingga token pertama: 13,30 detik pada pengujian yang sama

Waktu hingga token pertama lebih lama karena model menyelesaikan penalaran sebelum mulai menulis.

Permukaan API

Interactions API menjadi jalur utama Google untuk Gemini 3.x. Endpoint generateContent lama juga “tetap didukung penuh” tanpa tanggal penghentian.

Secara umum, kode Gemini 3.7 Flash dapat dijalankan dengan gemini-3.8-flash hanya dengan mengganti string model. Namun, periksa dua perubahan yang bersifat merusak di bagian migrasi.

Apa yang meningkat?

Google memosisikan Gemini 3.8 Flash sebagai “model Flash kami yang paling cerdas”, khususnya untuk:

  • Rekayasa perangkat lunak jangka panjang
  • Agen otonom
  • Alur kerja perusahaan yang kompleks
  • Tugas panjang dan padat dokumen

Desain yang mendasarinya adalah penalaran tambahan, pemanggilan alat berulang, langkah penalaran yang lebih kecil, dan verifikasi hasil selama proses berlangsung.

Tolok ukur Google

Google menerbitkan tiga perbandingan numerik di halaman DeepMind Flash:

Tolok ukur Gemini 3.8 Flash Gemini 3.7 Flash Perubahan
Vals Finance Agent v2 61,4% 59,0% +2,4
HLE-Verified 54,9% 53,6% +1,3
Harvey Legal Agent Benchmark 10,0% 8,8% +1,2

Peningkatannya moderat tetapi konsisten. Pada ketiga baris tersebut, Gemini 3.8 Flash juga mengungguli model yang lebih besar dalam tabel Google, termasuk Claude Opus 5 dengan skor 58,6% pada Vals Finance dan 54,4% pada HLE-Verified.

Lihat juga perbandingan Gemini 3.8 Flash dengan Claude Fable 5.1 dan GPT-5.6 Sol.

Hasil Artificial Analysis

Dalam ulasan Artificial Analysis, Gemini 3.8 Flash memperoleh skor 59 pada Indeks Kecerdasan dengan tingkat high.

Perbandingannya:

  • Gemini 3.7 Flash: 56
  • Gemini 3.6 Flash: 52
  • Gemini 3.8 Flash: 59

Pada skor tersebut, Gemini 3.8 Flash setara dengan GPT-5.6 Sol pada xhigh dan Grok 4.6 pada medium, serta satu poin di atas Claude Fable 5.1 pada medium.

Yang lebih relevan untuk agen adalah evaluasi penggunaan alat τ³-Banking:

  • Gemini 3.8 Flash: 45%
  • Peningkatan dibandingkan Gemini 3.7 Flash: +12 poin

Jika agen Anda benar-benar memanggil alat, metrik ini lebih berguna daripada indeks kecerdasan umum.

Tugas panjang dan padat dokumen

Google menyatakan bahwa Gemini 3.8 Flash “menyelesaikan lebih dari tiga kali lipat tugas dibandingkan Gemini 3.7 Flash” pada alur kerja panjang dan padat dokumen.

Ini merupakan evaluasi internal tanpa alat uji publik. Anggap sebagai arahan, bukan jaminan. Namun, klaim tersebut selaras dengan desain model: verifikasi tambahan paling membantu ketika satu kesalahan dapat menggagalkan pekerjaan yang terdiri dari puluhan langkah.

Pengkodean

Pada DeepSWE v1.1:

  • Gemini 3.7 Flash: 65,3%
  • Gemini 3.6 Flash: 49,0%

Google menyatakan bahwa Gemini 3.8 Flash mengungguli sebagian besar model frontier yang lebih besar dengan sebagian kecil biayanya. Namun, persentase pasti Gemini 3.8 Flash hanya muncul pada tabel gambar kartu model, bukan pada teks publikasi.

Angka untuk SWE-Bench Pro, Terminal-bench, dan OSWorld juga tidak dipublikasikan dalam teks. Jika tolok ukur tersebut menentukan keputusan Anda, uji sendiri di repositori dan toolchain Anda.

Keamanan dan resistensi injeksi

Google melaporkan “lompatan signifikan” pada pengujian injeksi prompt Gray Swan, tetapi tidak memberikan angka lengkap.

Kartu model Gemini 3.8 Flash menunjukkan perubahan berikut dibandingkan Gemini 3.7 Flash:

  • Keamanan multibahasa: +5,4 poin
  • Keamanan teks-ke-teks: -0,4 poin
  • Penolakan tidak beralasan: +1,1 poin

Angka terakhir menunjukkan sedikit peningkatan dalam mencegah penolakan berlebihan.

Berapa biaya tambahannya?

Harga per token tidak berubah. Yang berubah adalah biaya per tugas.

Google menyatakan bahwa Gemini 3.8 Flash dapat menggunakan lebih banyak token pada tugas yang panjang dan kompleks, terutama pada tingkat usaha yang lebih tinggi.

Artificial Analysis mengukur rata-rata sekitar 48.000 token keluaran per tugas untuk Gemini 3.8 Flash—sekitar 30% lebih banyak daripada Gemini 3.7 Flash.

Konfigurasi Biaya per tugas Waktu per tugas
Gemini 3.7 Flash, high $0,40 2,2 menit
Gemini 3.8 Flash, low $0,24 0,8 menit
Gemini 3.8 Flash, medium $0,41 Tidak dipublikasikan
Gemini 3.8 Flash, high $0,58 2,5 menit

Tiga kesimpulan penting:

  1. Gemini 3.8 Flash pada high sekitar 45% lebih mahal per tugas dibandingkan Gemini 3.7 Flash pada high, serta membutuhkan waktu 14% lebih lama.
  2. Gemini 3.8 Flash pada medium—tingkat default—hanya berbeda sekitar $0,01 dari Gemini 3.7 Flash pada high.
  3. Gemini 3.8 Flash pada low adalah opsi termurah dan tercepat dalam pengujian tersebut.

Untuk analisis volume harian, lihat rincian harga Gemini 3.8 Flash.

Intinya: jika Anda membayar berdasarkan tugas, peningkatan ini tidak gratis. thinkingLevel adalah kontrol utama untuk menentukan keseimbangan kualitas, biaya, dan latensi. Panduan tingkat pemikiran Gemini 3.8 Flash menjelaskan perbedaan tiap tingkat.

Perubahan yang bersifat merusak

Dua perubahan berikut dapat langsung memengaruhi kode Gemini 3.7 Flash.

1. thinking_level: "minimal" tidak lagi valid

Gemini 3.8 Flash hanya menerima:

  • low
  • medium
  • high

Jika konfigurasi Gemini 3.7 Flash menggunakan minimal, petakan nilainya ke low:

{
  "thinkingConfig": {
    "thinkingLevel": "low"
  }
}
Enter fullscreen mode Exit fullscreen mode

Tanpa perubahan tersebut, API akan mengembalikan kesalahan validasi.

2. Respons fungsi harus menyertakan call_id dan name

Setiap function_result pada Interactions API membutuhkan kedua bidang tersebut.

Pada endpoint generateContent lama, setiap functionResponse harus menyertakan id yang cocok dan name.

Respons yang hanya mengembalikan nama fungsi dapat gagal pada giliran kedua dalam perulangan alat.

Selain itu, periksa kembali aturan Gemini 3 berikut saat migrasi:

  • Pertahankan temperature pada nilai default 1.0. Google memperingatkan bahwa nilai yang lebih rendah dapat menyebabkan perulangan atau penurunan kinerja.
  • Gunakan thinking_level, bukan integer thinking_budget.
  • Hapus candidate_count.
  • Teruskan tanda tangan pemikiran kembali persis seperti yang diterima.

Detail lengkap tersedia dalam panduan migrasi Gemini 3.7 ke 3.8 Flash.

Matriks keputusan berdasarkan beban kerja

Beban kerja Rekomendasi Alasan
Agen multi-langkah dengan pemanggilan alat Tingkatkan ke medium atau high +12 poin pada τ³-Banking; perulangan alat adalah inti desain 3.8
Ekstraksi dan tinjauan dokumen panjang Tingkatkan Klaim Google tentang penyelesaian tugas 3x menargetkan skenario ini
Pengkodean agen dalam toolchain pengujian Tingkatkan, lalu ukur Angka DeepSWE 3.8 tidak dipublikasikan dalam teks
Agen keuangan, hukum, dan penelitian Tingkatkan Ketiga tolok ukur Google yang dipublikasikan menguntungkan 3.8
Klasifikasi, ekstraksi, dan chat volume tinggi Tetap di 3.7 atau gunakan 3.8 pada low Biaya per tugas lebih penting; low lebih murah daripada 3.7 pada high
Endpoint yang sensitif terhadap latensi Gunakan 3.8 pada low 0,8 menit per tugas dibandingkan 2,2 menit untuk 3.7 pada high
Menggunakan tingkat pemikiran minimal Migrasikan terlebih dahulu minimal menyebabkan kesalahan validasi
Pipeline batch dengan anggaran sangat ketat Tetap di 3.7 hingga diuji ulang Harga per token sama, tetapi token keluaran meningkat sekitar 30%

Polanya jelas: semakin sulit, panjang, dan agentic tugasnya, semakin banyak token yang digunakan Gemini 3.8 Flash. Untuk tugas pendek dan berulang, tingkat pemikiran atau model lama dapat memberikan biaya yang lebih baik.

Uji kedua model dengan skenario yang sama di Apidog

Angka Artificial Analysis bukan angka dari workload Anda. Sebelum mengganti model di produksi, jalankan prompt Anda sendiri pada kedua model dan bandingkan jumlah tokennya.

Apidog dapat digunakan untuk membuat pengujian ini dalam beberapa langkah.

1. Siapkan variabel dan request

Atur GEMINI_API_KEY sebagai environment variable di Apidog.

Tambahkan request POST ke endpoint berikut:

https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Enter fullscreen mode Exit fullscreen mode

Gunakan x-goog-api-key dan ambil nilainya dari variabel GEMINI_API_KEY.

Jadikan model sebagai variabel skenario. Gunakan body yang sama pada kedua pengujian:

{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
Enter fullscreen mode Exit fullscreen mode

2. Buat skenario perbandingan

Gunakan dua langkah:

  1. Jalankan request dengan model = gemini-3.7-flash
  2. Jalankan request yang sama dengan model = gemini-3.8-flash

Pada setiap langkah, tambahkan assertion untuk:

  • usageMetadata.candidatesTokenCount
  • usageMetadata.thoughtsTokenCount
  • Jalur JSON lain yang dibaca aplikasi Anda

Tetapkan batas assertion sesuai anggaran token Anda.

3. Jalankan pada prompt emas

Gunakan dataset berisi 10–20 prompt emas yang mewakili workload produksi.

Laporan pengujian akan menampilkan respons dan hasil assertion dari kedua model dalam satu proses. Dengan begitu, peningkatan token sekitar 30% dapat dibandingkan langsung dengan workload Anda sendiri.

Setelah hasilnya sesuai, jadwalkan skenario pengujian. Jika jumlah token pemikiran tiba-tiba meningkat setelah pembaruan model, pengujian akan gagal lebih awal daripada menunggu tagihan meningkat.

Anda dapat mengunduh Apidog; paket gratis mencakup alur kerja ini.

FAQ

Apakah Gemini 3.8 Flash lebih cepat daripada 3.7 Flash?

Tidak secara umum. Google menyebut kecepatannya “kurang lebih sama”, sementara Artificial Analysis mengukur sekitar 300 token keluaran per detik pada tingkat high.

Karena Gemini 3.8 Flash menggunakan lebih banyak langkah penalaran, waktu per tugas dalam pengujian Artificial Analysis sedikit meningkat:

  • Gemini 3.7 Flash, high: 2,2 menit
  • Gemini 3.8 Flash, high: 2,5 menit
  • Gemini 3.8 Flash, low: 0,8 menit

Apakah Gemini 3.8 Flash lebih mahal daripada 3.7 Flash?

Tidak jika dihitung per token. Keduanya berharga $0,75 untuk masukan dan $3,75 untuk keluaran hingga 31 Desember 2026, kemudian naik menjadi $1,50 dan $7,50.

Namun, biaya per tugas lebih tinggi. Artificial Analysis mengukur:

  • Gemini 3.7 Flash, high: $0,40 per tugas
  • Gemini 3.8 Flash, high: $0,58 per tugas

Perbedaannya berasal dari penggunaan token keluaran yang sekitar 30% lebih tinggi.

Apakah Google akan menghentikan Gemini 3.7 Flash?

Belum ada tanggal penghentian. Google menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh”, sehingga Anda masih dapat menggunakannya.

Postingan tentang Gemini 3.7 Flash tetap menjadi referensi untuk model tersebut.

Apa yang rusak saat beralih ke Gemini 3.8 Flash?

Dua hal utama:

  1. thinking_level: "minimal" mengembalikan kesalahan 400 INVALID_ARGUMENT.
  2. Respons fungsi harus menyertakan ID panggilan dan nama fungsi:
    • call_id pada Interactions API
    • id dan name pada endpoint generateContent lama

Bagaimana lompatan ini dibandingkan dengan Gemini 3.6 ke 3.7?

Gemini 3.7 Flash merupakan lompatan yang lebih besar:

  • DeepSWE: 49,0% menjadi 65,3%
  • Indeks Artificial Analysis: 52 menjadi 56

Gemini 3.8 Flash menambahkan tiga poin pada indeks tersebut dan mengubah cara model menggunakan token untuk verifikasi serta pemanggilan alat.

Untuk generasi sebelumnya, baca Gemini 3.6 Flash vs 3.5 Flash.

Kesimpulan

Tingkatkan ke Gemini 3.8 Flash jika workload Anda:

  • Bersifat agentic
  • Banyak menggunakan tool calling
  • Memproses dokumen panjang
  • Membutuhkan verifikasi multi-langkah

Di area tersebut, Google dan Artificial Analysis sama-sama menunjukkan peningkatan.

Tetap gunakan Gemini 3.7 Flash—atau gunakan Gemini 3.8 Flash pada tingkat low—jika Anda menjalankan panggilan pendek dan berulang dengan biaya per tugas sebagai metrik utama.

Apa pun pilihan Anda:

  1. Petakan minimal ke low.
  2. Pastikan respons fungsi menyertakan ID panggilan dan nama fungsi.
  3. Uji kedua model dengan prompt produksi Anda sendiri.
  4. Pantau candidatesTokenCount dan thoughtsTokenCount.
  5. Jadwalkan pengujian regresi agar kenaikan penggunaan token terdeteksi sebelum memengaruhi tagihan.

Top comments (0)