Gemini 3.8 Flash vs Gemini 3.7 Flash: Apakah Upgrade Ini Layak?
Google merilis Gemini 3.8 Flash pada 2 September 2026, tiga minggu setelah Gemini 3.7 Flash dan enam minggu setelah 3.6 Flash. Harga perkenalan, konteks 1 juta token, dan kecepatannya kurang lebih sama. Perubahan utamanya ada pada cara model bekerja: Gemini 3.8 Flash menggunakan langkah penalaran yang lebih kecil, memverifikasi hasilnya sendiri, dan memanggil alat secara berulang. Hasilnya, skor tolok ukur meningkat—tetapi setiap tugas juga dapat menggunakan lebih banyak token.
Jadi, pertanyaan yang tepat bukan sekadar “apakah Gemini 3.8 Flash lebih baik?”. Di atas kertas, jawabannya ya. Pertanyaannya adalah apakah kualitas tambahan sepadan dengan biaya token ekstra pada beban kerja Anda, serta apakah perubahan yang bersifat merusak akan memengaruhi kode yang sudah ada.
Perbandingan ini merangkum perbedaan, biaya, perubahan API, dan rekomendasi berdasarkan beban kerja. Sumbernya mencakup postingan peluncuran Google, dokumentasi model terbaru Gemini, dan pengujian independen Artificial Analysis. Untuk spesifikasi lengkap, lihat apa itu Gemini 3.8 Flash.
Google juga menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh” dan belum mengumumkan tanggal penghentian. Anda tidak harus segera bermigrasi.
Perbandingan singkat
| Atribut | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| ID model | gemini-3.8-flash |
gemini-3.7-flash |
| Dirilis | 2 September 2026 | 13 Agustus 2026 |
| Dasar | “Berdasarkan Gemini 3.7 Flash” (kartu model) | t/a |
| Konteks / keluaran maksimum | 1.048.576 / 65.536 token | Sama |
| Harga masukan hingga 31 Desember 2026 | $0,75 per juta token | $0,75 per juta token |
| Harga keluaran hingga 31 Desember 2026 | $3,75 per juta token, termasuk pemikiran | $3,75 per juta token, termasuk pemikiran |
| Harga standar mulai 1 Januari 2027 | $1,50 / $7,50 per juta token | $1,50 / $7,50 per juta token |
| Pembacaan cache konteks | $0,075 per juta token selama periode perkenalan | Sama |
| Batch | Diskon 50%, tingkat token antrean sama | Sama |
| Tingkat pemikiran |
low, medium (default), high
|
low, medium, high
|
| Tingkat pemikiran minimal | Kesalahan validasi | Diterima; petakan ke low saat migrasi |
| Batas pengetahuan | Maret 2026 | Tidak lagi disebutkan di dokumentasi 3.8 |
| Kecepatan keluaran Artificial Analysis | Sekitar 300 token/detik; terukur 302,1 | Menurut Google, kurang lebih sama |
| Indeks Kecerdasan Artificial Analysis | 59, tinggi | 56, tinggi |
| Status dukungan | Saat ini | Tetap didukung penuh, tanpa tanggal penghentian |
Apa yang tetap sama?
Harga
Kedua model berada pada baris harga yang sama di halaman harga Google:
- Masukan: $0,75 per juta token hingga 31 Desember 2026
- Keluaran: $3,75 per juta token hingga 31 Desember 2026
- Mulai 1 Januari 2027: $1,50 untuk masukan dan $7,50 untuk keluaran
- Pembacaan cache, diskon batch, dan 5.000 permintaan grounding Google Search gratis per bulan tetap berlaku
Referensi spesifikasi dan harga Gemini 3.7 Flash juga masih dapat digunakan sebagai referensi harga Gemini 3.8 Flash secara baris per baris.
Konteks dan modalitas
Batasnya tidak berubah:
- Masukan maksimum: 1.048.576 token
- Keluaran maksimum: 65.536 token
- Masukan: teks, gambar, video, audio, dan PDF
- Keluaran: teks
Kedua model tidak mendukung pembuatan audio, pembuatan gambar, atau Live API.
Kecepatan
Logan Kilpatrick dari Google menggambarkan Gemini 3.8 Flash sebagai model dengan “harga yang sama dengan 3.7, kecepatannya kurang lebih sama”.
Artificial Analysis mengukur:
- Throughput keluaran: 302,1 token/detik pada tingkat
high - Waktu hingga token pertama: 13,30 detik pada pengujian yang sama
Waktu hingga token pertama lebih lama karena model menyelesaikan penalaran sebelum mulai menulis.
Permukaan API
Interactions API menjadi jalur utama Google untuk Gemini 3.x. Endpoint generateContent lama juga “tetap didukung penuh” tanpa tanggal penghentian.
Secara umum, kode Gemini 3.7 Flash dapat dijalankan dengan gemini-3.8-flash hanya dengan mengganti string model. Namun, periksa dua perubahan yang bersifat merusak di bagian migrasi.
Apa yang meningkat?
Google memosisikan Gemini 3.8 Flash sebagai “model Flash kami yang paling cerdas”, khususnya untuk:
- Rekayasa perangkat lunak jangka panjang
- Agen otonom
- Alur kerja perusahaan yang kompleks
- Tugas panjang dan padat dokumen
Desain yang mendasarinya adalah penalaran tambahan, pemanggilan alat berulang, langkah penalaran yang lebih kecil, dan verifikasi hasil selama proses berlangsung.
Tolok ukur Google
Google menerbitkan tiga perbandingan numerik di halaman DeepMind Flash:
| Tolok ukur | Gemini 3.8 Flash | Gemini 3.7 Flash | Perubahan |
|---|---|---|---|
| Vals Finance Agent v2 | 61,4% | 59,0% | +2,4 |
| HLE-Verified | 54,9% | 53,6% | +1,3 |
| Harvey Legal Agent Benchmark | 10,0% | 8,8% | +1,2 |
Peningkatannya moderat tetapi konsisten. Pada ketiga baris tersebut, Gemini 3.8 Flash juga mengungguli model yang lebih besar dalam tabel Google, termasuk Claude Opus 5 dengan skor 58,6% pada Vals Finance dan 54,4% pada HLE-Verified.
Lihat juga perbandingan Gemini 3.8 Flash dengan Claude Fable 5.1 dan GPT-5.6 Sol.
Hasil Artificial Analysis
Dalam ulasan Artificial Analysis, Gemini 3.8 Flash memperoleh skor 59 pada Indeks Kecerdasan dengan tingkat high.
Perbandingannya:
- Gemini 3.7 Flash: 56
- Gemini 3.6 Flash: 52
- Gemini 3.8 Flash: 59
Pada skor tersebut, Gemini 3.8 Flash setara dengan GPT-5.6 Sol pada xhigh dan Grok 4.6 pada medium, serta satu poin di atas Claude Fable 5.1 pada medium.
Yang lebih relevan untuk agen adalah evaluasi penggunaan alat τ³-Banking:
- Gemini 3.8 Flash: 45%
- Peningkatan dibandingkan Gemini 3.7 Flash: +12 poin
Jika agen Anda benar-benar memanggil alat, metrik ini lebih berguna daripada indeks kecerdasan umum.
Tugas panjang dan padat dokumen
Google menyatakan bahwa Gemini 3.8 Flash “menyelesaikan lebih dari tiga kali lipat tugas dibandingkan Gemini 3.7 Flash” pada alur kerja panjang dan padat dokumen.
Ini merupakan evaluasi internal tanpa alat uji publik. Anggap sebagai arahan, bukan jaminan. Namun, klaim tersebut selaras dengan desain model: verifikasi tambahan paling membantu ketika satu kesalahan dapat menggagalkan pekerjaan yang terdiri dari puluhan langkah.
Pengkodean
Pada DeepSWE v1.1:
- Gemini 3.7 Flash: 65,3%
- Gemini 3.6 Flash: 49,0%
Google menyatakan bahwa Gemini 3.8 Flash mengungguli sebagian besar model frontier yang lebih besar dengan sebagian kecil biayanya. Namun, persentase pasti Gemini 3.8 Flash hanya muncul pada tabel gambar kartu model, bukan pada teks publikasi.
Angka untuk SWE-Bench Pro, Terminal-bench, dan OSWorld juga tidak dipublikasikan dalam teks. Jika tolok ukur tersebut menentukan keputusan Anda, uji sendiri di repositori dan toolchain Anda.
Keamanan dan resistensi injeksi
Google melaporkan “lompatan signifikan” pada pengujian injeksi prompt Gray Swan, tetapi tidak memberikan angka lengkap.
Kartu model Gemini 3.8 Flash menunjukkan perubahan berikut dibandingkan Gemini 3.7 Flash:
- Keamanan multibahasa: +5,4 poin
- Keamanan teks-ke-teks: -0,4 poin
- Penolakan tidak beralasan: +1,1 poin
Angka terakhir menunjukkan sedikit peningkatan dalam mencegah penolakan berlebihan.
Berapa biaya tambahannya?
Harga per token tidak berubah. Yang berubah adalah biaya per tugas.
Google menyatakan bahwa Gemini 3.8 Flash dapat menggunakan lebih banyak token pada tugas yang panjang dan kompleks, terutama pada tingkat usaha yang lebih tinggi.
Artificial Analysis mengukur rata-rata sekitar 48.000 token keluaran per tugas untuk Gemini 3.8 Flash—sekitar 30% lebih banyak daripada Gemini 3.7 Flash.
| Konfigurasi | Biaya per tugas | Waktu per tugas |
|---|---|---|
Gemini 3.7 Flash, high
|
$0,40 | 2,2 menit |
Gemini 3.8 Flash, low
|
$0,24 | 0,8 menit |
Gemini 3.8 Flash, medium
|
$0,41 | Tidak dipublikasikan |
Gemini 3.8 Flash, high
|
$0,58 | 2,5 menit |
Tiga kesimpulan penting:
- Gemini 3.8 Flash pada
highsekitar 45% lebih mahal per tugas dibandingkan Gemini 3.7 Flash padahigh, serta membutuhkan waktu 14% lebih lama. - Gemini 3.8 Flash pada
medium—tingkat default—hanya berbeda sekitar $0,01 dari Gemini 3.7 Flash padahigh. - Gemini 3.8 Flash pada
lowadalah opsi termurah dan tercepat dalam pengujian tersebut.
Untuk analisis volume harian, lihat rincian harga Gemini 3.8 Flash.
Intinya: jika Anda membayar berdasarkan tugas, peningkatan ini tidak gratis. thinkingLevel adalah kontrol utama untuk menentukan keseimbangan kualitas, biaya, dan latensi. Panduan tingkat pemikiran Gemini 3.8 Flash menjelaskan perbedaan tiap tingkat.
Perubahan yang bersifat merusak
Dua perubahan berikut dapat langsung memengaruhi kode Gemini 3.7 Flash.
1. thinking_level: "minimal" tidak lagi valid
Gemini 3.8 Flash hanya menerima:
lowmediumhigh
Jika konfigurasi Gemini 3.7 Flash menggunakan minimal, petakan nilainya ke low:
{
"thinkingConfig": {
"thinkingLevel": "low"
}
}
Tanpa perubahan tersebut, API akan mengembalikan kesalahan validasi.
2. Respons fungsi harus menyertakan call_id dan name
Setiap function_result pada Interactions API membutuhkan kedua bidang tersebut.
Pada endpoint generateContent lama, setiap functionResponse harus menyertakan id yang cocok dan name.
Respons yang hanya mengembalikan nama fungsi dapat gagal pada giliran kedua dalam perulangan alat.
Selain itu, periksa kembali aturan Gemini 3 berikut saat migrasi:
- Pertahankan
temperaturepada nilai default1.0. Google memperingatkan bahwa nilai yang lebih rendah dapat menyebabkan perulangan atau penurunan kinerja. - Gunakan
thinking_level, bukan integerthinking_budget. - Hapus
candidate_count. - Teruskan tanda tangan pemikiran kembali persis seperti yang diterima.
Detail lengkap tersedia dalam panduan migrasi Gemini 3.7 ke 3.8 Flash.
Matriks keputusan berdasarkan beban kerja
| Beban kerja | Rekomendasi | Alasan |
|---|---|---|
| Agen multi-langkah dengan pemanggilan alat | Tingkatkan ke medium atau high
|
+12 poin pada τ³-Banking; perulangan alat adalah inti desain 3.8 |
| Ekstraksi dan tinjauan dokumen panjang | Tingkatkan | Klaim Google tentang penyelesaian tugas 3x menargetkan skenario ini |
| Pengkodean agen dalam toolchain pengujian | Tingkatkan, lalu ukur | Angka DeepSWE 3.8 tidak dipublikasikan dalam teks |
| Agen keuangan, hukum, dan penelitian | Tingkatkan | Ketiga tolok ukur Google yang dipublikasikan menguntungkan 3.8 |
| Klasifikasi, ekstraksi, dan chat volume tinggi | Tetap di 3.7 atau gunakan 3.8 pada low
|
Biaya per tugas lebih penting; low lebih murah daripada 3.7 pada high
|
| Endpoint yang sensitif terhadap latensi | Gunakan 3.8 pada low
|
0,8 menit per tugas dibandingkan 2,2 menit untuk 3.7 pada high
|
Menggunakan tingkat pemikiran minimal
|
Migrasikan terlebih dahulu |
minimal menyebabkan kesalahan validasi |
| Pipeline batch dengan anggaran sangat ketat | Tetap di 3.7 hingga diuji ulang | Harga per token sama, tetapi token keluaran meningkat sekitar 30% |
Polanya jelas: semakin sulit, panjang, dan agentic tugasnya, semakin banyak token yang digunakan Gemini 3.8 Flash. Untuk tugas pendek dan berulang, tingkat pemikiran atau model lama dapat memberikan biaya yang lebih baik.
Uji kedua model dengan skenario yang sama di Apidog
Angka Artificial Analysis bukan angka dari workload Anda. Sebelum mengganti model di produksi, jalankan prompt Anda sendiri pada kedua model dan bandingkan jumlah tokennya.
Apidog dapat digunakan untuk membuat pengujian ini dalam beberapa langkah.
1. Siapkan variabel dan request
Atur GEMINI_API_KEY sebagai environment variable di Apidog.
Tambahkan request POST ke endpoint berikut:
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Gunakan x-goog-api-key dan ambil nilainya dari variabel GEMINI_API_KEY.
Jadikan model sebagai variabel skenario. Gunakan body yang sama pada kedua pengujian:
{
"contents": [
{
"parts": [
{
"text": "{{golden_prompt}}"
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
}
}
}
2. Buat skenario perbandingan
Gunakan dua langkah:
- Jalankan request dengan
model=gemini-3.7-flash - Jalankan request yang sama dengan
model=gemini-3.8-flash
Pada setiap langkah, tambahkan assertion untuk:
usageMetadata.candidatesTokenCountusageMetadata.thoughtsTokenCount- Jalur JSON lain yang dibaca aplikasi Anda
Tetapkan batas assertion sesuai anggaran token Anda.
3. Jalankan pada prompt emas
Gunakan dataset berisi 10–20 prompt emas yang mewakili workload produksi.
Laporan pengujian akan menampilkan respons dan hasil assertion dari kedua model dalam satu proses. Dengan begitu, peningkatan token sekitar 30% dapat dibandingkan langsung dengan workload Anda sendiri.
Setelah hasilnya sesuai, jadwalkan skenario pengujian. Jika jumlah token pemikiran tiba-tiba meningkat setelah pembaruan model, pengujian akan gagal lebih awal daripada menunggu tagihan meningkat.
Anda dapat mengunduh Apidog; paket gratis mencakup alur kerja ini.
FAQ
Apakah Gemini 3.8 Flash lebih cepat daripada 3.7 Flash?
Tidak secara umum. Google menyebut kecepatannya “kurang lebih sama”, sementara Artificial Analysis mengukur sekitar 300 token keluaran per detik pada tingkat high.
Karena Gemini 3.8 Flash menggunakan lebih banyak langkah penalaran, waktu per tugas dalam pengujian Artificial Analysis sedikit meningkat:
- Gemini 3.7 Flash,
high: 2,2 menit - Gemini 3.8 Flash,
high: 2,5 menit - Gemini 3.8 Flash,
low: 0,8 menit
Apakah Gemini 3.8 Flash lebih mahal daripada 3.7 Flash?
Tidak jika dihitung per token. Keduanya berharga $0,75 untuk masukan dan $3,75 untuk keluaran hingga 31 Desember 2026, kemudian naik menjadi $1,50 dan $7,50.
Namun, biaya per tugas lebih tinggi. Artificial Analysis mengukur:
- Gemini 3.7 Flash,
high: $0,40 per tugas - Gemini 3.8 Flash,
high: $0,58 per tugas
Perbedaannya berasal dari penggunaan token keluaran yang sekitar 30% lebih tinggi.
Apakah Google akan menghentikan Gemini 3.7 Flash?
Belum ada tanggal penghentian. Google menyatakan bahwa Gemini 3.7 Flash “tetap didukung penuh”, sehingga Anda masih dapat menggunakannya.
Postingan tentang Gemini 3.7 Flash tetap menjadi referensi untuk model tersebut.
Apa yang rusak saat beralih ke Gemini 3.8 Flash?
Dua hal utama:
-
thinking_level: "minimal"mengembalikan kesalahan400 INVALID_ARGUMENT. - Respons fungsi harus menyertakan ID panggilan dan nama fungsi:
-
call_idpada Interactions API -
iddannamepada endpointgenerateContentlama
-
Bagaimana lompatan ini dibandingkan dengan Gemini 3.6 ke 3.7?
Gemini 3.7 Flash merupakan lompatan yang lebih besar:
- DeepSWE: 49,0% menjadi 65,3%
- Indeks Artificial Analysis: 52 menjadi 56
Gemini 3.8 Flash menambahkan tiga poin pada indeks tersebut dan mengubah cara model menggunakan token untuk verifikasi serta pemanggilan alat.
Untuk generasi sebelumnya, baca Gemini 3.6 Flash vs 3.5 Flash.
Kesimpulan
Tingkatkan ke Gemini 3.8 Flash jika workload Anda:
- Bersifat agentic
- Banyak menggunakan tool calling
- Memproses dokumen panjang
- Membutuhkan verifikasi multi-langkah
Di area tersebut, Google dan Artificial Analysis sama-sama menunjukkan peningkatan.
Tetap gunakan Gemini 3.7 Flash—atau gunakan Gemini 3.8 Flash pada tingkat low—jika Anda menjalankan panggilan pendek dan berulang dengan biaya per tugas sebagai metrik utama.
Apa pun pilihan Anda:
- Petakan
minimalkelow. - Pastikan respons fungsi menyertakan ID panggilan dan nama fungsi.
- Uji kedua model dengan prompt produksi Anda sendiri.
- Pantau
candidatesTokenCountdanthoughtsTokenCount. - Jadwalkan pengujian regresi agar kenaikan penggunaan token terdeteksi sebelum memengaruhi tagihan.
Top comments (0)