Mengatur thinking_level di Gemini 3.8 Flash
Gemini 3.8 Flash memiliki tiga tingkat berpikir: low, medium, dan high. Pengaturan ini menentukan seberapa banyak penalaran internal yang dilakukan model sebelum menjawab, sekaligus memengaruhi latensi, jumlah token keluaran, dan biaya. Gemini 3.8 Flash dirancang untuk “bekerja lebih keras” pada tugas kompleks, sehingga pemilihan tingkat lebih penting dibandingkan Gemini 3.7 Flash. Untuk konteks peluncuran, baca ikhtisar Gemini 3.8 Flash. Panduan ini berfokus pada pengaturan tingkat berpikir.
Dua hal sering membingungkan saat migrasi:
- Tingkat default Gemini 3.8 Flash adalah
medium, bukanhigh. Gemini 3 Pro menggunakanhighsecara default. -
minimal, yang masih digunakan oleh konfigurasi Gemini 3.7 Flash, tidak didukung di Gemini 3.8 Flash. Permintaan gagal pada tahap validasi sebelum token dihasilkan.
Keduanya dijelaskan dalam dokumentasi terbaru Gemini 3.8 Flash.
Berikut pembahasan tiap tingkat, estimasi biaya, konfigurasi pada dua bentuk API, strategi routing, dan cara menguji ketiganya sebelum diterapkan.
Ringkasan tingkat berpikir
| Tingkat | Panduan Google | Biaya per tugas (AA) | Waktu per tugas (AA) | Gunakan untuk |
|---|---|---|---|---|
low |
Meminimalkan latensi dan biaya; instruksi sederhana, chat, rute throughput tinggi | $0.24 | 0,8 menit | Chat, klasifikasi, pencarian transkrip |
medium (default) |
Kode kompleks dan pekerjaan agenik | $0.41 | Tidak dipublikasikan dalam teks | Sebagian besar rute, Tanya Jawab video umum |
high |
Penalaran maksimum untuk masalah multi-langkah | $0.58 | 2,5 menit | Tanya Jawab visual padat, video lebih dari 60 menit, perencanaan kritis |
minimal |
Tidak didukung di 3.8 Flash | n/a | n/a | Jangan gunakan; petakan ke low
|
Biaya dan waktu tersebut adalah rata-rata Artificial Analysis dari Intelligence Index pada setiap tingkat, menggunakan harga perkenalan Google. Angka ini bukan data Google dan mengukur benchmark, bukan prompt Anda. Gunakan sebagai rasio awal, lalu ukur rute sendiri melalui Artificial Analysis.
Apa yang dilakukan setiap tingkat?
Respons Gemini 3.8 Flash dapat berisi token berpikir—penalaran yang dibuat model sebelum jawaban terlihat. Token ini ditagihkan sebagai token keluaran: $3.75 per juta token hingga 31 Desember 2026 dan $7.50 mulai 1 Januari 2027. API melaporkannya secara terpisah melalui usageMetadata.thoughtsTokenCount.
-
lowmenjaga penalaran tetap singkat. Token pertama tiba lebih cepat dan biaya keluaran lebih rendah. Cocok untuk instruksi sederhana, chat, dan endpoint throughput tinggi. -
mediumadalah titik keseimbangan sekaligus default. Google merekomendasikannya untuk kode kompleks dan tugas agenik. -
highmeminta model bernalar sedalam mungkin. Gunakan untuk masalah multi-langkah yang paling sulit.
Pada Gemini 3.8 Flash, model dapat menjalankan langkah penalaran tambahan, memanggil alat berulang kali, dan memverifikasi pekerjaan selama proses. Google juga menyatakan bahwa model dapat menggunakan lebih banyak token pada tugas yang panjang dan kompleks, terutama pada tingkat usaha lebih tinggi.
Jika penggunaan token meningkat, Google menyarankan menurunkan thinking_level. Alternatif lainnya adalah tetap menggunakan Gemini 3.7 Flash, yang masih didukung penuh.
thinking_leveladalah enum, bukan anggaran token.thinking_budgetdari model sebelumnya sudah tidak tersedia di Gemini 3, sehingga Anda tidak dapat meminta “maksimal 2.000 token berpikir”. Pilih tingkat, lalu ukur dampaknya pada prompt Anda.
Default-nya medium, bukan high
Jika kolom tingkat berpikir tidak dikirim, Gemini 3.8 Flash berjalan pada medium. Akibatnya:
- Tim yang terbiasa dengan Gemini 3 Pro dapat mengira model berjalan pada
high. - Tim yang menghapus
thinking_budgetsaat migrasi dari Gemini 3.7 Flash akan mendapatkanmediumpada semua rute, termasuk chat yang seharusnya memakailow.
Tetapkan thinking_level secara eksplisit pada setiap permintaan dan simpan pengaturannya dalam konfigurasi per rute. Dengan begitu, perubahan default dari Google tidak mengubah profil biaya Anda secara diam-diam.
minimal tidak didukung
minimal tersedia di Gemini 3.7 Flash, tetapi tidak ada dalam daftar tingkat yang didukung Gemini 3.8 Flash. Halaman model Gemini 3.8 Flash hanya mencantumkan low, medium, dan high.
Permintaan REST dengan minimal ditolak menggunakan HTTP 400 INVALID_ARGUMENT:
Thinking level MINIMAL is not supported for this model. Please retry with other thinking level.
SDK dapat membungkus error tersebut dalam kelas pengecualian sendiri. Karena itu, cocokkan berdasarkan status HTTP 400 atau kode INVALID_ARGUMENT, bukan teks pesan.
Sebelum
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Setelah
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Panduan migrasi Google memetakan minimal langsung ke low. Lihat panduan migrasi Gemini 3.7 ke 3.8 Flash.
Hindari dua pendekatan berikut:
- Mencari
thinking_budgetuntuk mendapatkan batas token yang lebih kecil. Parameter tersebut tidak didukung pada Gemini 3. - Menurunkan
temperatureuntuk “menenangkan” model. Google merekomendasikantemperaturedefault1.0pada semua model Gemini 3 karena nilai lebih rendah dapat menyebabkan pengulangan atau keluaran yang menurun kualitasnya.
Biaya setiap tingkat
Harga per token tidak berubah berdasarkan tingkat berpikir. Harga Gemini 3.8 Flash adalah $0.75 per juta token masukan dan $3.75 per juta token keluaran pada tarif perkenalan, lalu menjadi $1.50 dan $7.50 mulai 1 Januari 2027. Detail caching, Batch API, dan perubahan harga tersedia di halaman harga Google.
Perbedaan biaya berasal dari jumlah token yang dihasilkan:
| Model dan tingkat | Biaya per tugas | Waktu per tugas |
|---|---|---|
Gemini 3.8 Flash low
|
$0.24 | 0,8 menit |
Gemini 3.8 Flash medium
|
$0.41 | Tidak dipublikasikan dalam teks |
Gemini 3.8 Flash high
|
$0.58 | 2,5 menit |
Gemini 3.7 Flash high
|
$0.40 | 2,2 menit |
Sumber: Artificial Analysis Intelligence Index, menggunakan harga perkenalan.
Tiga kesimpulan praktis:
-
lowmembutuhkan sekitar 41% biayahighdan sekitar sepertiga waktunya. -
mediumpada 3.8 Flash memiliki biaya yang hampir sama denganhighpada 3.7 Flash: $0.41 dibandingkan $0.40. -
highpada 3.8 Flash sekitar 45% lebih mahal per tugas dibandingkanhighpada 3.7 Flash, meskipun harga per token sama. Penyebabnya adalah keluaran token yang sekitar 30% lebih banyak, rata-rata 48 ribu token per tugas benchmark.
Skor Intelligence Index Artificial Analysis sebesar 59 untuk Gemini 3.8 Flash diukur pada high. Skor untuk medium dan low tidak dipublikasikan dalam teks, jadi jangan menganggap hubungan kualitas dan biaya bersifat linear. Uji evaluasi Anda sendiri. Untuk contoh 1.000 tugas per hari dan batas harga 31 Desember, baca harga Gemini 3.8 Flash.
Mengatur thinking_level di Interactions API
Interactions API adalah antarmuka utama Google untuk Gemini 3.x. Tingkat berpikir berada di generation_config dengan format snake_case.
cURL
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Python
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
thinking_level adalah pengaturan tingkat permintaan. Tetapkan pada setiap panggilan, termasuk giliran berikutnya yang menggunakan previous_interaction_id.
Respons dikembalikan sebagai daftar langkah eksekusi—pemikiran dan pemanggilan alat—yang berakhir pada model_output. SDK menyediakan teks akhirnya melalui output_text. Untuk konfigurasi multi-giliran dan streaming, lihat cara menggunakan Gemini 3.8 Flash API.
Mengaturnya di generateContent
Kode Gemini yang sudah ada biasanya masih menggunakan generateContent. Google menyebutnya API warisan, tetapi tetap mendukungnya tanpa tanggal penghentian.
Pada API ini, pengaturan berada satu tingkat lebih dalam dan menggunakan camelCase.
cURL
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' -X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Python
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true menambahkan ringkasan pemikiran ke respons melalui bagian dengan thought: true. Ini berguna saat melakukan kalibrasi, tetapi biasanya tidak diperlukan di produksi.
Untuk mengukur biaya, pantau usageMetadata.thoughtsTokenCount, yaitu jumlah token berpikir yang ditagihkan sebagai keluaran.
Strategi per rute
Perlakukan tingkat berpikir sebagai keputusan routing, bukan pengaturan global:
-
Chat, autocomplete, dan permintaan interaktif:
low -
Klasifikasi, ekstraksi, dan pencarian transkrip:
low, setelah memastikan akurasi melalui evaluasi -
Agen pengodean dan loop alat:
medium; gunakanhighhanya untuk langkah perencanaan kritis, lalu turunkan kembali -
Alur kerja dokumen berat dan batch:
high, terutama jika tidak interaktif dan dapat menggunakan Batch API dengan diskon 50% -
Video:
- Tanya Jawab visual padat atau video lebih dari 60 menit:
high - Tanya Jawab video umum:
medium - Pencarian transkrip:
low
- Tanya Jawab visual padat atau video lebih dari 60 menit:
Pada Gemini 3.8 Flash, loop alat dapat menjalankan lebih banyak giliran secara default. Menggunakan high di seluruh loop dapat meningkatkan biaya dengan cepat.
Jika low masih terlalu mahal atau lambat, pertimbangkan Gemini 3.7 Flash atau model Flash-Lite. Panduan Gemini 3.1 Flash-Lite membahas komprominya. Gemini 3.5 Flash-Lite saat ini memiliki harga $0.30 per juta token masukan dan $2.50 per juta token keluaran.
Simpan tingkat dalam konfigurasi per rute dan letakkan gemini-3.7-flash di balik feature flag. Jika jumlah token meningkat setelah pembaruan, Anda dapat mengganti tingkat atau model tanpa deployment kode.
Menguji ketiga tingkat di Apidog
Tabel Artificial Analysis memberi rasio. Hanya prompt Anda yang dapat memberikan angka aktual. Gunakan Apidog untuk mengirim satu prompt emas pada ketiga tingkat.
Simpan API key sebagai variabel lingkungan.
BuatGEMINI_API_KEYdi environment Apidog dan gunakan{{GEMINI_API_KEY}}pada headerx-goog-api-key. Tambahkan variabelTHINKING_LEVEL.Simpan satu request.
GunakanPOSTke:
/v1beta/models/gemini-3.8-flash:generateContent
Isi konfigurasi dengan:
{
"thinkingConfig": {
"thinkingLevel": "{{THINKING_LEVEL}}"
}
}
Buat skenario tiga langkah.
Impor request yang sama tiga kali dan gunakan nilailow,medium, sertahigh.Validasi metrik penting.
Pada setiap langkah, pastikan status200danusageMetadata.thoughtsTokenCounttersedia. Tetapkan baseline setelah eksekusi pertama, lalu batasi token dan waktu responslowsesuai kebutuhan rute.Bandingkan tingkat penalaran.
Simpan jumlah token setiap langkah dalam variabel pascapemrosesan. Pastikanhighmenggunakan setidaknya sebanyak tokenlow. Jika urutannya terbalik, model atau default mungkin telah berubah.Tambahkan pengujian negatif.
KirimthinkingLevel: "minimal"dan pastikan respons bukan200. Pengujian ini akan mendeteksi konfigurasi lama setelah Anda mengganti model.Jadwalkan pengujian.
Jalankan skenario setiap hari agar regresi konfigurasi atau perubahan perilaku muncul sebagai eksekusi gagal, bukan tagihan mendadak. Ikuti panduan menjadwalkan tes API di Apidog.
Untuk respons streaming, gunakan skenario yang sama dengan rendering SSE. Lihat cara menguji API LLM streaming melalui SSE. Anda juga dapat mengunduh Apidog; paket gratis mendukung skenario ini.
FAQ
Apakah tingkat berpikir mengubah harga per token?
Tidak. Gemini 3.8 Flash tetap mengenakan $0.75 per juta token masukan dan $3.75 per juta token keluaran pada tarif perkenalan. Tingkat berpikir hanya mengubah jumlah token keluaran yang digunakan untuk penalaran.
Bisakah saya menetapkan anggaran token berpikir?
Tidak. Pada Gemini 3, thinking_budget digantikan enum thinking_level, dan Gemini 3.8 Flash hanya menerima low, medium, serta high. Terapkan batas atas melalui pengujian, peringatan, dan observabilitas.
Tingkat apa yang digunakan untuk skor Artificial Analysis 59?
high. Artificial Analysis menjalankan Intelligence Index pada high. Biaya dan waktu untuk tingkat lain tersedia, tetapi skor indeks medium dan low tidak dipublikasikan dalam teks.
Haruskah temperature diturunkan untuk mengurangi penalaran?
Tidak. Pertahankan nilai default 1.0 sesuai panduan Google. Gunakan thinking_level untuk mengontrol kedalaman penalaran.
Bagaimana jika low masih terlalu lambat atau mahal?
Gunakan Gemini 3.7 Flash, yang masih didukung penuh, atau pindahkan rute ke Flash-Lite. Baca perbandingan Gemini 3.8 Flash dan Gemini 3.7 Flash untuk melihat kapan token tambahan menghasilkan peningkatan kualitas.
Pilih tingkat per rute, lalu ukur
Gemini 3.8 Flash memiliki tiga tingkat berpikir dan secara default menggunakan lebih banyak penalaran dibandingkan pendahulunya. Tetapkan thinking_level secara eksplisit pada setiap rute, petakan minimal ke low, dan pantau usageMetadata.thoughtsTokenCount.
Angka Artificial Analysis—$0.24, $0.41, dan $0.58 per tugas—memberi gambaran kurva biaya. Pengujian tiga langkah di Apidog memberi angka aktual untuk prompt Anda sebelum perubahan harga 31 Desember 2026 membuat optimasi semakin penting.
Top comments (0)