DEV Community

Cover image for Gemini 3.8 Flash: Perbandingan Level Pemikiran Rendah, Sedang, Tinggi (dan Mengapa Level Minimal Ditiadakan)
Walse
Walse

Posted on Originally published at apidog.com

Gemini 3.8 Flash: Perbandingan Level Pemikiran Rendah, Sedang, Tinggi (dan Mengapa Level Minimal Ditiadakan)

Mengatur thinking_level di Gemini 3.8 Flash

Gemini 3.8 Flash memiliki tiga tingkat berpikir: low, medium, dan high. Pengaturan ini menentukan seberapa banyak penalaran internal yang dilakukan model sebelum menjawab, sekaligus memengaruhi latensi, jumlah token keluaran, dan biaya. Gemini 3.8 Flash dirancang untuk “bekerja lebih keras” pada tugas kompleks, sehingga pemilihan tingkat lebih penting dibandingkan Gemini 3.7 Flash. Untuk konteks peluncuran, baca ikhtisar Gemini 3.8 Flash. Panduan ini berfokus pada pengaturan tingkat berpikir.

Coba Apidog hari ini

Dua hal sering membingungkan saat migrasi:

  • Tingkat default Gemini 3.8 Flash adalah medium, bukan high. Gemini 3 Pro menggunakan high secara default.
  • minimal, yang masih digunakan oleh konfigurasi Gemini 3.7 Flash, tidak didukung di Gemini 3.8 Flash. Permintaan gagal pada tahap validasi sebelum token dihasilkan.

Keduanya dijelaskan dalam dokumentasi terbaru Gemini 3.8 Flash.

Berikut pembahasan tiap tingkat, estimasi biaya, konfigurasi pada dua bentuk API, strategi routing, dan cara menguji ketiganya sebelum diterapkan.

Ringkasan tingkat berpikir

Tingkat Panduan Google Biaya per tugas (AA) Waktu per tugas (AA) Gunakan untuk
low Meminimalkan latensi dan biaya; instruksi sederhana, chat, rute throughput tinggi $0.24 0,8 menit Chat, klasifikasi, pencarian transkrip
medium (default) Kode kompleks dan pekerjaan agenik $0.41 Tidak dipublikasikan dalam teks Sebagian besar rute, Tanya Jawab video umum
high Penalaran maksimum untuk masalah multi-langkah $0.58 2,5 menit Tanya Jawab visual padat, video lebih dari 60 menit, perencanaan kritis
minimal Tidak didukung di 3.8 Flash n/a n/a Jangan gunakan; petakan ke low

Biaya dan waktu tersebut adalah rata-rata Artificial Analysis dari Intelligence Index pada setiap tingkat, menggunakan harga perkenalan Google. Angka ini bukan data Google dan mengukur benchmark, bukan prompt Anda. Gunakan sebagai rasio awal, lalu ukur rute sendiri melalui Artificial Analysis.

Apa yang dilakukan setiap tingkat?

Respons Gemini 3.8 Flash dapat berisi token berpikir—penalaran yang dibuat model sebelum jawaban terlihat. Token ini ditagihkan sebagai token keluaran: $3.75 per juta token hingga 31 Desember 2026 dan $7.50 mulai 1 Januari 2027. API melaporkannya secara terpisah melalui usageMetadata.thoughtsTokenCount.

  • low menjaga penalaran tetap singkat. Token pertama tiba lebih cepat dan biaya keluaran lebih rendah. Cocok untuk instruksi sederhana, chat, dan endpoint throughput tinggi.
  • medium adalah titik keseimbangan sekaligus default. Google merekomendasikannya untuk kode kompleks dan tugas agenik.
  • high meminta model bernalar sedalam mungkin. Gunakan untuk masalah multi-langkah yang paling sulit.

Pada Gemini 3.8 Flash, model dapat menjalankan langkah penalaran tambahan, memanggil alat berulang kali, dan memverifikasi pekerjaan selama proses. Google juga menyatakan bahwa model dapat menggunakan lebih banyak token pada tugas yang panjang dan kompleks, terutama pada tingkat usaha lebih tinggi.

Jika penggunaan token meningkat, Google menyarankan menurunkan thinking_level. Alternatif lainnya adalah tetap menggunakan Gemini 3.7 Flash, yang masih didukung penuh.

thinking_level adalah enum, bukan anggaran token. thinking_budget dari model sebelumnya sudah tidak tersedia di Gemini 3, sehingga Anda tidak dapat meminta “maksimal 2.000 token berpikir”. Pilih tingkat, lalu ukur dampaknya pada prompt Anda.

Default-nya medium, bukan high

Jika kolom tingkat berpikir tidak dikirim, Gemini 3.8 Flash berjalan pada medium. Akibatnya:

  • Tim yang terbiasa dengan Gemini 3 Pro dapat mengira model berjalan pada high.
  • Tim yang menghapus thinking_budget saat migrasi dari Gemini 3.7 Flash akan mendapatkan medium pada semua rute, termasuk chat yang seharusnya memakai low.

Tetapkan thinking_level secara eksplisit pada setiap permintaan dan simpan pengaturannya dalam konfigurasi per rute. Dengan begitu, perubahan default dari Google tidak mengubah profil biaya Anda secara diam-diam.

minimal tidak didukung

minimal tersedia di Gemini 3.7 Flash, tetapi tidak ada dalam daftar tingkat yang didukung Gemini 3.8 Flash. Halaman model Gemini 3.8 Flash hanya mencantumkan low, medium, dan high.

Permintaan REST dengan minimal ditolak menggunakan HTTP 400 INVALID_ARGUMENT:

Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.

SDK dapat membungkus error tersebut dalam kelas pengecualian sendiri. Karena itu, cocokkan berdasarkan status HTTP 400 atau kode INVALID_ARGUMENT, bukan teks pesan.

Sebelum

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
Enter fullscreen mode Exit fullscreen mode

Setelah

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}
Enter fullscreen mode Exit fullscreen mode

Panduan migrasi Google memetakan minimal langsung ke low. Lihat panduan migrasi Gemini 3.7 ke 3.8 Flash.

Hindari dua pendekatan berikut:

  1. Mencari thinking_budget untuk mendapatkan batas token yang lebih kecil. Parameter tersebut tidak didukung pada Gemini 3.
  2. Menurunkan temperature untuk “menenangkan” model. Google merekomendasikan temperature default 1.0 pada semua model Gemini 3 karena nilai lebih rendah dapat menyebabkan pengulangan atau keluaran yang menurun kualitasnya.

Biaya setiap tingkat

Harga per token tidak berubah berdasarkan tingkat berpikir. Harga Gemini 3.8 Flash adalah $0.75 per juta token masukan dan $3.75 per juta token keluaran pada tarif perkenalan, lalu menjadi $1.50 dan $7.50 mulai 1 Januari 2027. Detail caching, Batch API, dan perubahan harga tersedia di halaman harga Google.

Perbedaan biaya berasal dari jumlah token yang dihasilkan:

Model dan tingkat Biaya per tugas Waktu per tugas
Gemini 3.8 Flash low $0.24 0,8 menit
Gemini 3.8 Flash medium $0.41 Tidak dipublikasikan dalam teks
Gemini 3.8 Flash high $0.58 2,5 menit
Gemini 3.7 Flash high $0.40 2,2 menit

Sumber: Artificial Analysis Intelligence Index, menggunakan harga perkenalan.

Tiga kesimpulan praktis:

  • low membutuhkan sekitar 41% biaya high dan sekitar sepertiga waktunya.
  • medium pada 3.8 Flash memiliki biaya yang hampir sama dengan high pada 3.7 Flash: $0.41 dibandingkan $0.40.
  • high pada 3.8 Flash sekitar 45% lebih mahal per tugas dibandingkan high pada 3.7 Flash, meskipun harga per token sama. Penyebabnya adalah keluaran token yang sekitar 30% lebih banyak, rata-rata 48 ribu token per tugas benchmark.

Skor Intelligence Index Artificial Analysis sebesar 59 untuk Gemini 3.8 Flash diukur pada high. Skor untuk medium dan low tidak dipublikasikan dalam teks, jadi jangan menganggap hubungan kualitas dan biaya bersifat linear. Uji evaluasi Anda sendiri. Untuk contoh 1.000 tugas per hari dan batas harga 31 Desember, baca harga Gemini 3.8 Flash.

Mengatur thinking_level di Interactions API

Interactions API adalah antarmuka utama Google untuk Gemini 3.x. Tingkat berpikir berada di generation_config dengan format snake_case.

cURL

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Enter fullscreen mode Exit fullscreen mode

Python

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

thinking_level adalah pengaturan tingkat permintaan. Tetapkan pada setiap panggilan, termasuk giliran berikutnya yang menggunakan previous_interaction_id.

Respons dikembalikan sebagai daftar langkah eksekusi—pemikiran dan pemanggilan alat—yang berakhir pada model_output. SDK menyediakan teks akhirnya melalui output_text. Untuk konfigurasi multi-giliran dan streaming, lihat cara menggunakan Gemini 3.8 Flash API.

Mengaturnya di generateContent

Kode Gemini yang sudah ada biasanya masih menggunakan generateContent. Google menyebutnya API warisan, tetapi tetap mendukungnya tanpa tanggal penghentian.

Pada API ini, pengaturan berada satu tingkat lebih dalam dan menggunakan camelCase.

cURL

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Enter fullscreen mode Exit fullscreen mode

Python

from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
print(response.usage_metadata.thoughts_token_count)
Enter fullscreen mode Exit fullscreen mode

includeThoughts: true menambahkan ringkasan pemikiran ke respons melalui bagian dengan thought: true. Ini berguna saat melakukan kalibrasi, tetapi biasanya tidak diperlukan di produksi.

Untuk mengukur biaya, pantau usageMetadata.thoughtsTokenCount, yaitu jumlah token berpikir yang ditagihkan sebagai keluaran.

Strategi per rute

Perlakukan tingkat berpikir sebagai keputusan routing, bukan pengaturan global:

  • Chat, autocomplete, dan permintaan interaktif: low
  • Klasifikasi, ekstraksi, dan pencarian transkrip: low, setelah memastikan akurasi melalui evaluasi
  • Agen pengodean dan loop alat: medium; gunakan high hanya untuk langkah perencanaan kritis, lalu turunkan kembali
  • Alur kerja dokumen berat dan batch: high, terutama jika tidak interaktif dan dapat menggunakan Batch API dengan diskon 50%
  • Video:
    • Tanya Jawab visual padat atau video lebih dari 60 menit: high
    • Tanya Jawab video umum: medium
    • Pencarian transkrip: low

Pada Gemini 3.8 Flash, loop alat dapat menjalankan lebih banyak giliran secara default. Menggunakan high di seluruh loop dapat meningkatkan biaya dengan cepat.

Jika low masih terlalu mahal atau lambat, pertimbangkan Gemini 3.7 Flash atau model Flash-Lite. Panduan Gemini 3.1 Flash-Lite membahas komprominya. Gemini 3.5 Flash-Lite saat ini memiliki harga $0.30 per juta token masukan dan $2.50 per juta token keluaran.

Simpan tingkat dalam konfigurasi per rute dan letakkan gemini-3.7-flash di balik feature flag. Jika jumlah token meningkat setelah pembaruan, Anda dapat mengganti tingkat atau model tanpa deployment kode.

Menguji ketiga tingkat di Apidog

Tabel Artificial Analysis memberi rasio. Hanya prompt Anda yang dapat memberikan angka aktual. Gunakan Apidog untuk mengirim satu prompt emas pada ketiga tingkat.

  1. Simpan API key sebagai variabel lingkungan.

    Buat GEMINI_API_KEY di environment Apidog dan gunakan {{GEMINI_API_KEY}} pada header x-goog-api-key. Tambahkan variabel THINKING_LEVEL.

  2. Simpan satu request.

    Gunakan POST ke:

   /v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Isi konfigurasi dengan:

   {
     "thinkingConfig": {
       "thinkingLevel": "{{THINKING_LEVEL}}"
     }
   }
Enter fullscreen mode Exit fullscreen mode
  1. Buat skenario tiga langkah.

    Impor request yang sama tiga kali dan gunakan nilai low, medium, serta high.

  2. Validasi metrik penting.

    Pada setiap langkah, pastikan status 200 dan usageMetadata.thoughtsTokenCount tersedia. Tetapkan baseline setelah eksekusi pertama, lalu batasi token dan waktu respons low sesuai kebutuhan rute.

  3. Bandingkan tingkat penalaran.

    Simpan jumlah token setiap langkah dalam variabel pascapemrosesan. Pastikan high menggunakan setidaknya sebanyak token low. Jika urutannya terbalik, model atau default mungkin telah berubah.

  4. Tambahkan pengujian negatif.

    Kirim thinkingLevel: "minimal" dan pastikan respons bukan 200. Pengujian ini akan mendeteksi konfigurasi lama setelah Anda mengganti model.

  5. Jadwalkan pengujian.

    Jalankan skenario setiap hari agar regresi konfigurasi atau perubahan perilaku muncul sebagai eksekusi gagal, bukan tagihan mendadak. Ikuti panduan menjadwalkan tes API di Apidog.

Untuk respons streaming, gunakan skenario yang sama dengan rendering SSE. Lihat cara menguji API LLM streaming melalui SSE. Anda juga dapat mengunduh Apidog; paket gratis mendukung skenario ini.

FAQ

Apakah tingkat berpikir mengubah harga per token?

Tidak. Gemini 3.8 Flash tetap mengenakan $0.75 per juta token masukan dan $3.75 per juta token keluaran pada tarif perkenalan. Tingkat berpikir hanya mengubah jumlah token keluaran yang digunakan untuk penalaran.

Bisakah saya menetapkan anggaran token berpikir?

Tidak. Pada Gemini 3, thinking_budget digantikan enum thinking_level, dan Gemini 3.8 Flash hanya menerima low, medium, serta high. Terapkan batas atas melalui pengujian, peringatan, dan observabilitas.

Tingkat apa yang digunakan untuk skor Artificial Analysis 59?

high. Artificial Analysis menjalankan Intelligence Index pada high. Biaya dan waktu untuk tingkat lain tersedia, tetapi skor indeks medium dan low tidak dipublikasikan dalam teks.

Haruskah temperature diturunkan untuk mengurangi penalaran?

Tidak. Pertahankan nilai default 1.0 sesuai panduan Google. Gunakan thinking_level untuk mengontrol kedalaman penalaran.

Bagaimana jika low masih terlalu lambat atau mahal?

Gunakan Gemini 3.7 Flash, yang masih didukung penuh, atau pindahkan rute ke Flash-Lite. Baca perbandingan Gemini 3.8 Flash dan Gemini 3.7 Flash untuk melihat kapan token tambahan menghasilkan peningkatan kualitas.

Pilih tingkat per rute, lalu ukur

Gemini 3.8 Flash memiliki tiga tingkat berpikir dan secara default menggunakan lebih banyak penalaran dibandingkan pendahulunya. Tetapkan thinking_level secara eksplisit pada setiap rute, petakan minimal ke low, dan pantau usageMetadata.thoughtsTokenCount.

Angka Artificial Analysis—$0.24, $0.41, dan $0.58 per tugas—memberi gambaran kurva biaya. Pengujian tiga langkah di Apidog memberi angka aktual untuk prompt Anda sebelum perubahan harga 31 Desember 2026 membuat optimasi semakin penting.

Top comments (0)