DEV Community

Cover image for Apa Itu Gemini 3.8 Flash
Walse
Walse

Posted on Originally published at apidog.com

Apa Itu Gemini 3.8 Flash

Gemini 3.8 Flash: Model Flash yang “Bekerja Lebih Keras”

Gemini 3.8 Flash adalah model tingkat Flash terbaru Google, dirilis pada 2 September 2026 bersama kembaran keamanan berpagar bernama Gemini 3.8 Flash Cyber. Ini merupakan rilis Flash ketiga dalam enam minggu, setelah Gemini 3.6 Flash pada 21 Juli dan Gemini 3.7 Flash pada 13 Agustus. Harga perkenalannya sama dengan 3.7 Flash: $0,75 per juta token input dan $3,75 per juta token output hingga 31 Desember 2026. Google menyebutnya “model Flash kami yang paling cerdas, direkayasa untuk rekayasa perangkat lunak jangka panjang, agen otonom, dan alur kerja perusahaan yang kompleks.”

Coba Apidog hari ini

Gemini 3.8 Flash

Perubahan terbesar bukan harga atau jendela konteks, melainkan perilaku model. Gemini 3.8 Flash dirancang untuk “bekerja lebih keras” pada tugas sulit: mengambil langkah penalaran yang lebih kecil, memverifikasi hasil selama proses, dan memanggil alat secara berulang.

Hasilnya adalah performa agen yang lebih baik—dengan konsekuensi penggunaan token yang lebih tinggi. Artificial Analysis mengukur sekitar 30% lebih banyak token output dibandingkan 3.7 Flash.

Jika Anda menganggarkan berdasarkan token, harganya tetap sama. Jika Anda menganggarkan berdasarkan tugas, tagihannya dapat meningkat.

Sekilas Gemini 3.8 Flash

Spesifikasi Nilai
ID model API gemini-3.8-flash — stabil, tanpa sufiks pratinjau
Dirilis 2 September 2026
Berdasarkan Gemini 3.7 Flash, menurut kartu model DeepMind
Jendela konteks 1.048.576 token input
Output maksimum 65.536 token
Modalitas input Teks, gambar, video, audio, PDF
Modalitas output Teks saja
Tingkat pemikiran low, medium (default), high; minimal mengembalikan error
Harga perkenalan $0,75 input / $3,75 output per juta token hingga 31 Desember 2026
Harga standar $1,50 input / $7,50 output per juta token mulai 1 Januari 2027
Caching konteks $0,075 per juta token tersimpan pada harga perkenalan; $0,15 pada harga standar
API Batch Diskon 50%: $0,375 / $1,875 pada harga perkenalan
Batas pengetahuan Maret 2026
Ketersediaan pengembang Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Ketersediaan konsumen Aplikasi Gemini untuk pelanggan AI Pro dan Ultra, Mode AI di Penelusuran, Gemini di Google Spreadsheet
Status Gemini 3.7 Flash Tetap didukung penuh; belum memiliki tanggal penghentian

Ada tiga detail yang perlu diperhatikan:

  1. Tingkat pemikiran default adalah medium, bukan high seperti pada Gemini 3 Pro. Prompt yang sebelumnya disesuaikan untuk Pro mungkin bernalar lebih rendah jika tingkatnya tidak diatur secara eksplisit.
  2. Tingkat minimal menghasilkan error validasi, bukan diam-diam dipetakan ke low.
  3. Batas pengetahuan model adalah Maret 2026. Kartu model memperingatkan bahwa pada beberapa domain, pengetahuan mungkin terbatas hingga Januari 2025.

Apa yang berubah pada Gemini 3.8 Flash?

Flash adalah model pekerja keras Google: dirancang untuk menjalankan sebagian besar traffic produksi, sementara Pro menangani masalah yang paling sulit.

Google menyebut 3.8 Flash sebagai “model pekerja keras paling cerdas yang pernah ada”. Namun, kartu model DeepMind menyatakan bahwa model ini berbasis Gemini 3.7 Flash, bukan model dasar yang sepenuhnya baru. Kerangka kerja yang lebih tepat adalah penerus yang disempurnakan, khususnya untuk:

  • Rekayasa perangkat lunak jangka panjang
  • Agen otonom
  • Pemanggilan alat berulang
  • Alur kerja perusahaan yang kompleks
  • Tugas yang membutuhkan verifikasi bertahap

Urutan rilisnya cukup cepat:

  • Gemini 3.6 Flash: 21 Juli 2026, harga $1,50 / $7,50
  • Gemini 3.7 Flash: 13 Agustus 2026, harga perkenalan $0,75 / $3,75
  • Gemini 3.8 Flash: 2 September 2026, harga perkenalan $0,75 / $3,75

Google menyebutnya sebagai rilis Flash ketiga dalam enam minggu. Artificial Analysis menghitungnya sebagai model Flash keempat dalam waktu kurang dari empat bulan karena turut memasukkan Gemini 3.5 Flash-Lite.

Tidak ada Gemini 3.8 Pro, Gemini 4, atau Flash-Lite baru yang dirilis bersamaan dengan model ini. Google juga belum mengumumkan kapan pembaruan Pro berikutnya akan hadir.

Desain “bekerja lebih keras” dan biayanya

Pada tugas kompleks, Gemini 3.8 Flash:

  • Menjalankan langkah penalaran tambahan
  • Mengambil langkah penalaran yang lebih kecil
  • Memverifikasi hasil selama proses
  • Memanggil alat secara berulang

Google secara eksplisit menyatakan bahwa model dapat menggunakan lebih banyak token pada tugas yang lebih panjang dan kompleks, terutama pada tingkat upaya yang lebih tinggi.

Artificial Analysis mengukur rata-rata sekitar 48.000 token output per tugas pada tingkat high, atau 30% lebih tinggi daripada Gemini 3.7 Flash. Karena harga per token tidak berubah, biaya rata-rata per tugas meningkat:

Model Tingkat Biaya per tugas Waktu per tugas
Gemini 3.7 Flash high $0,40 2,2 menit
Gemini 3.8 Flash high $0,58 2,5 menit
Gemini 3.8 Flash medium $0,41
Gemini 3.8 Flash low $0,24 0,8 menit

Ini menjadikan thinking_level sebagai keputusan routing, bukan pengaturan global:

  • Gunakan low untuk endpoint sensitif terhadap latensi.
  • Gunakan medium untuk sebagian besar alur agen.
  • Gunakan high untuk tugas yang membutuhkan penalaran dan verifikasi maksimal.

Kecepatan dasarnya kurang lebih sama dengan Gemini 3.7 Flash. Artificial Analysis mengukur 302,1 token output per detik pada tingkat high. Waktu hingga token pertama sebesar 13,30 detik mencerminkan waktu berpikir model sebelum menghasilkan jawaban, bukan semata-mata masalah jaringan.

Apa yang dikatakan tolok ukur?

Google menerbitkan tiga tabel tolok ukur di halaman DeepMind Flash:

Tolok ukur 3.8 Flash 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Agen Keuangan Vals v2 61,4% 59,0% 58,6% 53,8% 54,4% 53,9%
Tolok Ukur Agen Hukum Harvey 10,0% 8,8% 6,7% 2,5% 0,8% 5,0%
HLE-Terverifikasi 54,9% 53,6% 54,4% 54,5% 51,1% 31,0%

Peningkatan dibandingkan 3.7 Flash adalah 2,4, 1,2, dan 1,3 poin persentase. Angkanya memang tidak besar, tetapi pada tolok ukur keuangan dan hukum, model Flash dengan harga lebih rendah mengungguli Opus 5 dan GPT-5.6 Sol.

Claude Fable 5.1, yang dirilis sehari sebelumnya, tidak tercantum dalam tabel Google. Perbandingan terdekat menggunakan hasil Claude Opus 5 dan Sonnet 5.

Google juga menyampaikan beberapa klaim tanpa angka dalam format teks:

  • Pada DeepSWE v1.1, Gemini 3.8 Flash “mengungguli sebagian besar model perbatasan yang lebih besar” dengan sebagian kecil biayanya. Persentase lengkap hanya tersedia pada tabel gambar kartu model; Gemini 3.7 Flash tercatat 65,3%.
  • Pada alur kerja jangka panjang yang sarat dokumen, evaluasi internal menyatakan model menyelesaikan lebih dari tiga kali jumlah tugas dibandingkan Gemini 3.7 Flash.
  • Pada injeksi prompt Gray Swan, Google melaporkan “lompatan signifikan” tanpa memberikan angka.
  • Hasil SWE-Bench Pro, Terminal-bench, dan OSWorld untuk 3.8 Flash belum dipublikasikan dalam bentuk teks.

Hasil independen Artificial Analysis juga menunjukkan peningkatan:

  • Indeks Kecerdasan: 59 untuk 3.8 Flash (high), dibandingkan 56 untuk 3.7 Flash dan 52 untuk 3.6 Flash.
  • Skor tersebut menyamai GPT-5.6 Sol (xhigh) dan Grok 4.6 (medium).
  • τ³-Banking: 45%, atau 12 poin lebih tinggi daripada 3.7 Flash.

Harga: sama per token, lebih mahal per tugas

Item Hingga 31 Desember 2026 Mulai 1 Januari 2027
Input $0,75 / 1 juta token $1,50 / 1 juta token
Output, termasuk pemikiran $3,75 / 1 juta token $7,50 / 1 juta token
Input tersimpan/cached $0,075 / 1 juta token $0,15 / 1 juta token
Penyimpanan cache $0,50 / 1 juta token per jam $1,00 / 1 juta token per jam
Input/output Batch $0,375 / $1,875 $0,75 / $3,75

Token pemikiran dihitung sebagai token output. Token tersebut ditagih menggunakan tarif output dan dilaporkan terpisah melalui:

usageMetadata.thoughtsTokenCount
Enter fullscreen mode Exit fullscreen mode

Akibatnya, jawaban singkat pada tingkat high dapat lebih mahal daripada jawaban panjang pada tingkat low.

Penyelarasan Google Search memiliki meteran terpisah: 5.000 permintaan gratis per bulan yang dibagikan di semua model Gemini 3.x, kemudian $14 per 1.000 permintaan.

Tingkat gratis dengan batasan tarif tersedia di AI Studio dan API. Google menyatakan bahwa data pada tingkat gratis digunakan untuk meningkatkan produk mereka. Batas tarif per model dapat dilihat di AI Studio.

Tingkat akses meningkat berdasarkan penggunaan akun penagihan:

  • Tingkat 1: setelah menautkan akun penagihan
  • Tingkat 2: setelah pembelanjaan $100 dan tiga hari
  • Tingkat 3: setelah pembelanjaan $1.000 dan 30 hari

Untuk pekerjaan yang dapat ditunda, API Batch menawarkan diskon 50%.

Cara memanggil Gemini 3.8 Flash

Google kini memposisikan Interactions API sebagai jalur utama untuk Gemini 3.x. generateContent dianggap sebagai API warisan, tetapi masih didukung penuh dan belum memiliki tanggal penghentian.

Permintaan Interactions API minimal:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Jelaskan caching HTTP dalam 3 kalimat.","generation_config":{"thinking_level":"medium"}}'
Enter fullscreen mode Exit fullscreen mode

Untuk percakapan multi-giliran, teruskan previous_interaction_id agar server menyimpan status percakapan.

Pemanggilan fungsi menggunakan langkah berikut:

  1. Deklarasikan alat dengan skema JSON.
  2. Terima langkah function_call.
  3. Jalankan fungsi di aplikasi Anda.
  4. Kirim function_result dengan call_id dan name.
  5. Ulangi sampai model mengembalikan jawaban akhir.

Pada Gemini 3.8 Flash, call_id dan name diperlukan. API generateContent lama menggunakan ejaan bidang id, sehingga perpindahan endpoint perlu diuji secara khusus.

Checklist migrasi dari Gemini 3.7 Flash

Perubahan yang paling sering menyebabkan error:

  • minimal tidak didukung dan harus diganti dengan low, medium, atau high.
  • thinking_budget diganti menjadi thinking_level.
  • candidate_count tidak didukung.
  • Biarkan temperature pada nilai default 1.0. Google memperingatkan bahwa menurunkannya dapat menyebabkan perulangan atau performa yang menurun.

Uji JSON sebelum dan sesudah migrasi dengan panduan migrasi agar perubahan konfigurasi terlihat jelas.

Apa yang tidak dapat dilakukan Gemini 3.8 Flash?

Model ini tidak mendukung:

  • Pembuatan audio
  • Live API
  • Pembuatan gambar
  • Segmentasi gambar

Output-nya hanya teks, meskipun input mendukung teks, gambar, video, audio, dan PDF.

Jika produk membutuhkan suara atau gambar real-time, Gemini 3.8 Flash sebaiknya diposisikan sebagai lapisan penalaran dan pemanggilan alat, bukan seluruh tumpukan.

Untuk teks berthroughput tinggi dengan biaya rendah tanpa penalaran berat, Gemini 3.5 Flash-Lite tetap tersedia dengan harga $0,30 / $2,50 per juta token.

Fitur yang tetap didukung mencakup:

  • Pemanggilan fungsi
  • Output terstruktur
  • Caching konteks
  • Eksekusi kode
  • Grounding Google Search dan Maps
  • API Batch
  • Computer Use dalam pratinjau

Gemini 3.8 Flash Cyber: kembaran berpagar

Gemini 3.8 Flash Cyber dirilis pada hari yang sama, tetapi tidak tersedia melalui pendaftaran umum.

Akses hanya diberikan melalui Program Fairwind, yang ditujukan untuk:

  • Otoritas pemerintah tepercaya
  • Operator infrastruktur penting
  • Pemelihara perangkat lunak

Program ini memerlukan pemeriksaan latar belakang dan persyaratan keamanan seperti MFA anti-phishing. Tidak tersedia API publik, harga publik, atau opsi self-hosting. Model ini menggantikan uji coba terbatas Gemini 3.5 Flash Cyber.

Menurut klaim Google:

  • Tingkat keberhasilan penemuan kerentanan dunia nyata lebih dari 70% di 20 bahasa pemrograman.
  • Tim keamanan Chrome menemukan 2,6 kali lebih banyak patch yang benar untuk kerentanan Chrome dibandingkan model komersial terbaik yang jauh lebih besar.

Klaim tersebut berasal dari Google. Penjelasan Program Fairwind mencakup kelayakan dan kewajiban bagi peserta—serta menjelaskan mengapa sebagian besar tim tidak akan mendapatkan akses langsung.

Menguji Gemini 3.8 Flash di Apidog

Karena perbedaan utama Gemini 3.8 Flash adalah biaya per tugas, pengujian sebaiknya tidak berhenti pada pemeriksaan “apakah request berhasil”.

Gunakan Apidog untuk:

  1. Menyimpan GEMINI_API_KEY sebagai environment variable.
  2. Menyimpan request untuk Interactions API dan generateContent.
  3. Memastikan status HTTP 200.
  4. Memvalidasi bidang JSON yang benar-benar digunakan aplikasi.
  5. Menetapkan batas atas pada usageMetadata.thoughtsTokenCount.
  6. Menjalankan prompt yang sama pada tingkat low, medium, dan high.
  7. Membandingkan token dan waktu eksekusi untuk workflow Anda sendiri.

Dengan cara ini, Anda mendapatkan biaya aktual per tingkat, bukan hanya rata-rata dari Artificial Analysis.

Respons streaming dirender sebagai SSE. Ini berguna ketika Anda perlu men-debug ringkasan pemikiran dengan includeThoughts: true. Anda juga dapat menjadwalkan skenario harian sehingga regresi jumlah token menggagalkan assertion sebelum muncul di faktur.

Pertanyaan yang Sering Diajukan

Apakah Gemini 3.8 Flash model baru atau pembaruan untuk 3.7 Flash?

Kartu model DeepMind menyatakan bahwa Gemini 3.8 Flash berbasis Gemini 3.7 Flash. Anggaplah model ini sebagai penerus yang disempurnakan dengan harga, kecepatan, dan jendela konteks yang sama, tetapi dengan lebih banyak langkah penalaran dan pemanggilan alat pada tugas sulit.

Gemini 3.7 Flash tetap didukung penuh tanpa tanggal penghentian.

Mengapa Gemini 3.8 Flash menggunakan lebih banyak token?

Sesuai desain. Google menyatakan bahwa model dapat menggunakan lebih banyak token pada tugas yang lebih panjang dan kompleks. Artificial Analysis mengukur sekitar 30% lebih banyak token output pada indeks mereka.

Gunakan medium atau low pada rute yang tidak membutuhkan penalaran tambahan.

Berapa jendela konteks Gemini 3.8 Flash?

Model ini mendukung 1.048.576 token input dan 65.536 token output. Caching konteks dikenai biaya $0,075 per juta token tersimpan hingga 31 Desember 2026.

Dapatkah saya menggunakan Gemini 3.8 Flash di aplikasi Gemini gratis?

Liputan peluncuran mencantumkan aplikasi Gemini untuk dan 57 untuk Claude Fable 5.1.

Claude Fable 5.1 berharga $10 / $50 per juta token—sekitar 13 kali tarif perkenalan Gemini 3.8 Flash untuk input dan output. Namun, selisihnya menyempit jika token per tugas turut dihitung.

Kesimpulan

Gemini 3.8 Flash adalah model pekerja keras yang sengaja menghabiskan lebih banyak waktu dan token untuk menyelesaikan tugas sulit.

Pertukaran utamanya jelas:

  • Peningkatan beberapa poin pada tolok ukur keagenan
  • Kenaikan 12 poin pada evaluasi penggunaan alat
  • Sekitar 30% lebih banyak token output pada penalaran tinggi
  • Biaya per token yang tetap sama hingga akhir 2026

Jika agen Anda mengalami kendala pada Gemini 3.7 Flash, Gemini 3.8 Flash layak diuji. Jika traffic Anda sensitif terhadap latensi, gunakan low atau tetap gunakan 3.7 Flash yang masih didukung penuh.

Mulailah dari panduan API, kirim request pertama melalui Apidog, dan tambahkan assertion untuk jumlah token. Biarkan data dari workflow Anda—bukan hanya klaim peluncuran—menentukan tingkat pemikiran untuk setiap rute.

Referensi

Top comments (0)