DEV Community

Cover image for Apa Itu Gemini 3.5 Flash-Lite?
Walse
Walse

Posted on • Originally published at apidog.com

Apa Itu Gemini 3.5 Flash-Lite?

Google memperbarui tier Flash pada 21 Juli 2026, dan Gemini 3.5 Flash-Lite adalah varian paling hemat. Model ini ditujukan untuk beban kerja bervolume tinggi dan sensitif terhadap latensi, seperti klasifikasi, ekstraksi data, balasan chat singkat, dan jawaban retrieval sederhana. Jika aplikasi Anda memproses jutaan permintaan kecil setiap hari, Flash-Lite dirancang untuk jalur permintaan utama tersebut.

Coba Apidog hari ini

Pembaruan ini merilis tiga model sekaligus. Agar tidak salah memilih model, pahami dulu perbedaannya, lalu uji endpoint-nya dengan payload dan asersi yang sesuai kebutuhan produksi.

Apa itu Gemini 3.5 Flash-Lite?

Gemini 3.5 Flash-Lite adalah model terkecil dan termurah dalam keluarga Gemini Google. Model ini dioptimalkan untuk kecepatan dan volume, bukan penalaran paling kompleks. Google mencatat kecepatan sekitar 350 token output per detik, sehingga respons tetap terasa cepat saat beban meningkat.

Gunakan ID model berikut saat memanggil Gemini API:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Gemini 3.5 Flash-Lite

Gunakan Flash-Lite untuk tugas berulang yang membutuhkan respons cepat, misalnya:

  • Mengklasifikasikan tiket dukungan.
  • Mengekstrak field dari dokumen atau teks tidak terstruktur.
  • Menjawab pertanyaan singkat dari konteks retrieval.
  • Menjalankan widget chat dengan latensi rendah.
  • Memproses batch permintaan sederhana dalam jumlah besar.

Use cases Gemini 3.5 Flash-Lite

Flash-Lite dirilis bersama dua model lain:

  • Gemini 3.6 Flash: model utama dengan kemampuan penalaran dan coding yang lebih kuat.
  • Gemini 3.5 Flash-Lite: model hemat untuk throughput tinggi.
  • Gemini 3.5 Flash Cyber: model keamanan berbatas.

Lihat ringkasan peluncuran di blog Google dan detail keluarga model di halaman DeepMind Flash.

Tunggu, mengapa 3.5 dan bukan 3.6?

Model utama yang baru adalah Gemini 3.6 Flash, tetapi Flash-Lite dan Flash Cyber tetap menggunakan label 3.5. Jadi, satu peluncuran memiliki tiga model dengan dua nomor versi.

Ini bukan typo. Nomor versi mengikuti lini model, bukan tanggal peluncuran. Gemini 3.6 Flash mendapat peningkatan generasi lebih besar, sedangkan Flash-Lite tetap berada di lini 3.5.

Jangan tertukar dengan model generasi sebelumnya, Gemini 3.1 Flash-Lite. Keduanya memiliki nama keluarga yang sama, tetapi merupakan model berbeda.

Selalu verifikasi ID model di kode dan konfigurasi deployment Anda:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Spesifikasi dan harga

Semua harga berikut dihitung per satu juta token melalui Gemini API.

Atribut Nilai
ID model gemini-3.5-flash-lite
Harga input $0.30 / 1M token
Harga output $2.50 / 1M token
Kecepatan ~350 token output/detik
Tingkat gratis Ya, melalui Google AI Studio dengan batas laju
Penyimpanan konteks $0.03 / 1M token + $1.00 / 1M/jam penyimpanan

Dengan harga input $0,30 dan output $2,50, Flash-Lite adalah tier termurah yang dipublikasikan dalam jajaran Gemini saat ini. Sebagai perbandingan, Gemini 3.6 Flash berharga $1,50 untuk input dan $7,50 untuk output.

Untuk volume besar, selisih ini penting. Misalnya, gunakan Flash-Lite untuk permintaan klasifikasi singkat dan hanya eskalasikan permintaan kompleks ke model yang lebih kuat.

Konfirmasi harga terbaru di dokumentasi harga Gemini API, karena Google memperbarui halaman tersebut secara langsung.

Penyimpanan konteks dapat membantu jika Anda memakai prompt sistem atau dokumen referensi yang sama berulang kali. Anda membayar biaya penyimpanan token dan biaya per jam, tetapi token yang disimpan lebih murah saat digunakan kembali.

Seberapa baik kinerjanya?

Gemini 3.5 Flash-Lite mencetak 54% pada Terminal-Bench 2.1, naik dari 31% pada pendahulunya. Peningkatan ini membuat tier Lite lebih berguna untuk tugas yang sebelumnya sulit ditangani model hemat.

Flash-Lite cocok untuk:

  • Klasifikasi kategori.
  • Ekstraksi data terstruktur dari teks tidak teratur.
  • Respons chat singkat.
  • Retrieval-augmented generation (RAG) sederhana.
  • Asisten ringan yang harus tetap responsif.

Namun, jangan gunakan Flash-Lite sebagai default untuk semua pekerjaan. Model ini mengorbankan kualitas demi biaya dan kecepatan. Untuk coding agen yang kompleks, rangkaian tool call panjang, atau penalaran multi-langkah, gunakan Gemini 3.6 Flash atau model yang lebih besar.

Prinsip praktisnya:

Tugas sederhana + volume tinggi + latensi rendah -> Gemini 3.5 Flash-Lite
Tugas kompleks + coding + penalaran multi-langkah -> Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Di mana Google menggunakan Flash-Lite

Google mengintegrasikan Flash-Lite ke Google Search. Ini menunjukkan bahwa model tersebut ditujukan untuk skala besar, dengan kebutuhan throughput tinggi dan biaya per permintaan yang rendah.

Bagi pengembang, karakteristik yang sama relevan untuk endpoint produksi yang sibuk, seperti:

  • Pipeline klasifikasi tiket.
  • Moderasi atau pengelompokan input sederhana.
  • Ekstraksi metadata dokumen.
  • FAQ berbasis retrieval.
  • Chat assistant dengan jawaban singkat.

Flash-Lite vs Gemini 3.6 Flash: mana yang harus dipilih?

Pilih Flash-Lite jika tugas Anda sederhana, sering dipanggil, dan sensitif terhadap biaya atau latensi. Pilih Gemini 3.6 Flash jika tugas membutuhkan penalaran lebih kuat, coding, atau workflow agen multi-langkah.

Kebutuhan Pilihan
Klasifikasi volume tinggi Gemini 3.5 Flash-Lite
Ekstraksi field dari dokumen Gemini 3.5 Flash-Lite
Chat singkat Gemini 3.5 Flash-Lite
RAG sederhana Gemini 3.5 Flash-Lite
Coding kompleks Gemini 3.6 Flash
Tool calling berurutan Gemini 3.6 Flash
Penalaran multi-langkah Gemini 3.6 Flash

Pola implementasi yang praktis adalah routing berdasarkan kesulitan:

  1. Kirim semua permintaan standar ke Flash-Lite.
  2. Validasi apakah respons memenuhi format dan kualitas minimum.
  3. Eskalasikan permintaan yang gagal, ambigu, atau kompleks ke Gemini 3.6 Flash.
  4. Catat tingkat eskalasi untuk mengevaluasi kualitas prompt dan biaya.

Dengan pendekatan ini, sebagian besar traffic tetap murah, sementara tugas sulit tetap mendapat model yang lebih kuat.

Lihat perbandingan lebih lengkap di Gemini 3.5 Flash-Lite vs 3.6 Flash.

Cara mengakses dan mengujinya

Flash-Lite tersedia melalui Gemini API. Cara tercepat untuk memulai:

  1. Buka Google AI Studio.
  2. Buat atau ambil API key.
  3. Gunakan model gemini-3.5-flash-lite.
  4. Uji prompt dengan input representatif dari aplikasi Anda.
  5. Pindahkan traffic produksi ke API key berbayar jika membutuhkan volume lebih besar.

Tingkat gratis cocok untuk pengujian dan penggunaan ringan, tetapi memiliki batas laju. Google juga dapat menggunakan data tingkat gratis untuk meningkatkan produknya, jadi jangan kirim data sensitif melalui key gratis.

Lihat referensi endpoint dan format request di dokumentasi Gemini API.

Saat menguji, gunakan payload sederhana terlebih dahulu dan tetapkan output yang terstruktur. Contohnya, untuk klasifikasi tiket dukungan:

{
  "contents": [
    {
      "parts": [
        {
          "text": "Klasifikasikan tiket berikut ke salah satu kategori: billing, technical, account.\n\nTiket: Saya tidak bisa masuk ke akun saya."
        }
      ]
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Setelah request berfungsi, tambahkan validasi untuk hal-hal yang benar-benar digunakan aplikasi Anda:

  • Status respons HTTP.
  • Waktu respons.
  • Field JSON yang wajib ada.
  • Format output.
  • Nilai kategori yang valid.
  • Perubahan struktur respons setelah pembaruan API.

Dengan Apidog, Anda dapat membuat request POST ke endpoint Gemini, menyimpan API key sebagai environment variable, lalu menambahkan asersi untuk status code dan field JSON.

Contoh pemeriksaan yang sebaiknya dibuat:

Status code harus 200
Respons harus memiliki field candidates
Output tidak boleh kosong
Nilai kategori harus termasuk daftar kategori yang diizinkan
Enter fullscreen mode Exit fullscreen mode

Selanjutnya, simpan request tersebut sebagai regression test dan jadwalkan pengujian API agar perubahan respons, batas laju, atau perilaku endpoint dapat terdeteksi sebelum memengaruhi pengguna.

Apidog tidak menjalankan model atau menggantikan Gemini API. Apidog adalah klien untuk memanggil, memvalidasi, dan memantau endpoint Gemini bersama API lain dalam stack Anda.

FAQ

Apakah Gemini 3.5 Flash-Lite sama dengan Gemini 3.6 Flash?

Tidak. Keduanya adalah model berbeda dari pembaruan 21 Juli 2026 yang sama. Flash-Lite adalah tier termurah dan tercepat untuk pekerjaan sederhana bervolume tinggi. Gemini 3.6 Flash adalah model utama dengan penalaran dan kemampuan coding yang lebih kuat.

Mengapa versinya 3.5, bukan 3.6?

Google meningkatkan Flash utama ke 3.6, tetapi mempertahankan Flash-Lite dan model Flash Cyber pada label 3.5. Nomor versi mengikuti lini model, bukan tanggal peluncuran.

Apakah ini Gemini 3.1 Flash-Lite yang lama?

Tidak. Gemini 3.5 Flash-Lite adalah model yang lebih baru. Selalu periksa ID model berikut agar tidak salah konfigurasi:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Apakah Gemini 3.5 Flash-Lite gratis?

Ada tingkat gratis melalui Google AI Studio dengan batas laju. Tingkat ini cocok untuk pengujian dan penggunaan ringan. Untuk volume produksi, gunakan API key berbayar.

Untuk apa Flash-Lite paling cocok?

Gunakan untuk klasifikasi, ekstraksi, balasan chat singkat, dan RAG sederhana dengan volume tinggi. Untuk coding agen yang sulit atau penalaran multi-langkah panjang, Gemini 3.6 Flash lebih sesuai.

Top comments (0)