Google, 21 Temmuz 2026'da Flash katmanını yeniledi ve Gemini 3.5 Flash-Lite bu serinin bütçe dostu seçeneği oldu. Şu anda kullanılabilen en ucuz ve en hızlı Gemini modeli olarak; sınıflandırma, metin çıkarma, kısa sohbet yanıtları ve basit bilgi alma destekli yanıtlar gibi yüksek hacimli, gecikmeye duyarlı işler için tasarlanmıştır. Günde milyonlarca küçük istek gönderiyorsanız, maliyet ve verim açısından hedef model Flash-Lite'tır.
Bu yenilemede üç model yayımlandı: Gemini 3.6 Flash, Gemini 3.5 Flash-Lite ve Gemini 3.5 Flash Cyber. İsimlendirme kafa karıştırıcı olabilir; önce modeli konumlandıralım, ardından fiyatlandırma, kullanım senaryoları ve API test adımlarına bakalım.
Gemini 3.5 Flash-Lite nedir?
Gemini 3.5 Flash-Lite, Gemini ailesindeki en küçük ve en düşük maliyetli modeldir. Derin muhakeme yerine hız, düşük gecikme ve yüksek istek hacmi için ayarlanmıştır. Google, yaklaşık 350 çıktı belirteci/saniye hız belirtiyor.
Gemini API'de şu model kimliğini kullanın:
gemini-3.5-flash-lite
Bu modeli şu iş yüklerine yönlendirin:
- Destek biletlerini etiketleme
- Serbest metinden yapılandırılmış alan çıkarma
- Kısa bağlamdan soru yanıtlama
- Hafif sohbet asistanları
- Basit RAG yanıtları
- Yüksek frekanslı içerik sınıflandırma
Flash-Lite, üç modellik Flash yenilemesinin parçasıdır:
- Gemini 3.6 Flash: Genel amaçlı iş yükü modeli
- Gemini 3.5 Flash-Lite: Hız ve maliyet odaklı model
- Gemini 3.5 Flash Cyber: Güvenlik odaklı model
Google'ın duyurusunu Google blogunda ve model ayrıntılarını DeepMind Flash sayfasında inceleyebilirsiniz.
Neden biri 3.5, diğeri 3.6?
Yeni genel amaçlı model Gemini 3.6 Flash iken Flash-Lite ve Cyber varyantları 3.5 etiketini koruyor. Bu bir yazım hatası değildir.
Google burada lansman tarihinden çok model hattını takip eden karışık bir sürümleme kullanıyor:
- İş yükü modeli daha büyük bir nesilsel güncelleme aldığı için 3.6
- Lite ve Cyber varyantları önceki hatla hizalı kaldığı için 3.5
Ayrıca Gemini 3.5 Flash-Lite, eski nesil Gemini 3.1 Flash-Lite ile aynı model değildir. Yeni modeli kullandığınızdan emin olmak için API çağrılarında şu kimliği doğrulayın:
gemini-3.5-flash-lite
Özellikler ve fiyatlandırma
Fiyatlar Gemini API üzerinden milyon belirteç başınadır.
| Özellik | Değer |
|---|---|
| Model kimliği | gemini-3.5-flash-lite |
| Giriş fiyatı | $0.30 / 1M belirteç |
| Çıkış fiyatı | $2.50 / 1M belirteç |
| Hız | ~350 çıktı belirteci/saniye |
| Ücretsiz katman | Evet, Google AI Studio'da hız sınırlamalı |
| Bağlam önbellekleme | $0.03 / 1M belirteç + $1.00 / 1M/saat depolama |
Flash-Lite'ın $0.30 giriş ve $2.50 çıkış fiyatı, yayımlanmış Gemini serisindeki en düşük fiyat seviyesidir. Karşılaştırma için Gemini 3.6 Flash:
- Giriş: $1.50 / 1M belirteç
- Çıkış: $7.50 / 1M belirteç
Bu nedenle Flash-Lite, girişte yaklaşık beşte bir; çıkışta ise yaklaşık üçte bir maliyetle çalışır. Milyonlarca kısa istekte bu fark doğrudan bütçeye yansır.
Güncel değerleri Gemini API fiyatlandırma belgelerinden doğrulayın.
Bağlam önbellekleme ne zaman kullanılmalı?
Aynı sistem istemini veya uzun referans belgesini tekrar tekrar gönderiyorsanız bağlam önbellekleme kullanın. Örneğin:
- Sabit sistem talimatları
- Uzun ürün katalogları
- Sık kullanılan politika belgeleri
- Tekrarlanan RAG bağlamı
Önbelleğe alma için küçük bir belirteç ve depolama ücreti ödersiniz; ancak sonraki kullanımlarda önbelleğe alınmış giriş daha düşük maliyetli olur.
Ne kadar iyi performans gösteriyor?
Gemini 3.5 Flash-Lite, Terminal-Bench 2.1'de %54 puan alıyor. Önceki sürümün %31 sonucuna göre bu belirgin bir artış.
Pratikte güçlü olduğu alanlar şunlardır:
- Metin sınıflandırma
- Bilgi çıkarma
- Kısa sohbet yanıtları
- Basit RAG
- Etiketleme ve yönlendirme
- Kısa, yapılandırılmış çıktı üretimi
Ancak modelin sınırlarını doğru belirlemek önemlidir. Flash-Lite şu senaryolarda ilk tercih olmamalıdır:
- Karmaşık aracılı kodlama
- Uzun, çok adımlı araç zincirleri
- Derin muhakeme gerektiren görevler
- Büyük ve karmaşık kod tabanlarını analiz etme
Bu tür işler için Gemini 3.6 Flash veya daha büyük bir model seçin. Yanlış model seçimi, ilk bakışta sağladığınız maliyet avantajını hatalı yanıtlar nedeniyle kaybettirebilir.
Google Flash-Lite'ı nerede kullanıyor?
Google, Flash-Lite'ı yalnızca geliştiricilere sunmuyor; modeli Google Arama'ya da entegre ediyor. Bu, modelin yüksek trafikte gecikme veya bütçe sorununa yol açmadan çalışabilecek hız ve maliyet profilinde olduğunu gösterir.
Aynı özellikler üretim sistemleri için de önemlidir:
- Yüksek istek hacmi
- Düşük çağrı maliyeti
- Hızlı yanıt süresi
- Basit ve tekrarlayan görevlerde yeterli kalite
Arama ölçeğine uygun bir model, doğru sınırlar içinde kullanıldığında sınıflandırma veya veri çıkarma hattınız için de uygun olabilir.
Flash-Lite ve Gemini 3.6 Flash: hangisini seçmelisiniz?
Kısa karar kuralı:
- İş basit, yüksek hacimli ve gecikmeye duyarlıysa Flash-Lite kullanın.
- İş güçlü muhakeme, kodlama veya çok adımlı araç kullanımı gerektiriyorsa Gemini 3.6 Flash kullanın.
| Gereksinim | Önerilen model |
|---|---|
| Sınıflandırma | Gemini 3.5 Flash-Lite |
| Metin çıkarma | Gemini 3.5 Flash-Lite |
| Kısa sohbet yanıtları | Gemini 3.5 Flash-Lite |
| Basit RAG | Gemini 3.5 Flash-Lite |
| Karmaşık kodlama | Gemini 3.6 Flash |
| Çok adımlı ajan iş akışları | Gemini 3.6 Flash |
| Derin muhakeme | Gemini 3.6 Flash |
Üretimde iyi bir yaklaşım, istekleri zorluğa göre yönlendirmektir:
- Varsayılan olarak kolay ve sık gelen istekleri Flash-Lite'a gönderin.
- Karmaşık, başarısız olan veya yüksek güven gerektiren istekleri 3.6 Flash'a aktarın.
- Her iki rotanın gecikme, maliyet ve hata oranını izleyin.
Gemini 3.6 Flash fiyatlandırması, daha güçlü yetenek için neden daha yüksek maliyet ödendiğini gösterir. Ayrıntılı model karşılaştırması için Gemini 3.5 Flash-Lite vs 3.6 Flash yazısına bakın.
Nasıl erişilir ve test edilir?
Flash-Lite, Gemini API üzerinden kullanılır. Başlamak için:
- Google AI Studio üzerinden API anahtarı oluşturun.
- Model kimliğini
gemini-3.5-flash-liteolarak ayarlayın. - İlk isteklerinizi ücretsiz katmanda test edin.
- Üretim hacmi için ücretli API anahtarına geçin.
- Hassas verileri ücretsiz katmanda kullanmayın.
Ücretsiz katman hız sınırlamalıdır. Google ayrıca ücretsiz katman verilerini ürünlerini geliştirmek için kullanabilir. Bu nedenle hassas içerik ve üretim verileri için ücretli anahtar kullanın.
Tam entegrasyon referansı için Gemini API belgelerine bakın.
API isteğini regresyon testine dönüştürün
İsteğiniz çalıştıktan sonra yalnızca yanıt alıp almadığını değil, yanıtın beklediğiniz biçimde kalıp kalmadığını da doğrulayın. Fiyatlar, hız limitleri ve API yanıt şemaları zamanla değişebilir.
Apidog ile şu akışı uygulayabilirsiniz:
- Gemini uç noktasına bir
POSTisteği oluşturun. - API anahtarını ortam değişkeni olarak saklayın.
- Anahtarı istek gövdesine veya kaynak koda yazmayın.
- HTTP durum kodu için doğrulama ekleyin.
- Beklediğiniz JSON alanları için iddialar tanımlayın.
- İsteği kaydedilmiş regresyon testine dönüştürün.
Örneğin doğrulamak istediğiniz temel noktalar şunlardır:
- HTTP durum kodu başarılı mı?
- Yanıt beklenen JSON alanlarını içeriyor mu?
- Model adı beklenen değer mi?
- Yanıt boş mu?
- Yanıt süresi kabul edilen sınırda mı?
Bu testi planlı olarak çalıştırabilir, bozuk yanıtları veya davranış değişikliklerini kullanıcılarınızdan önce tespit edebilirsiniz.
Apidog modeli çalıştırmaz ve Gemini API'nin yerini almaz. Gemini uç noktanızı çağırmak, doğrulamak, test etmek ve izlemek için kullanılan API istemcisidir.
Sıkça Sorulan Sorular
Gemini 3.5 Flash-Lite, Gemini 3.6 Flash ile aynı mı?
Hayır. İkisi de 21 Temmuz 2026 yenilemesinde tanıtıldı, ancak farklı modellerdir. Flash-Lite; basit, hızlı ve yüksek hacimli işler için düşük maliyetli seçenektir. Gemini 3.6 Flash ise daha güçlü muhakeme ve kodlama yetenekleri sunar.
Neden biri 3.5, diğeri 3.6?
Google karışık sürümleme kullanıyor. Genel amaçlı Flash modeli 3.6'ya yükselirken Flash-Lite ve Cyber modeli 3.5 etiketiyle kaldı. Sürüm numarası lansman tarihini değil, model hattını izliyor.
Bu model eski Gemini 3.1 Flash-Lite mı?
Hayır. Gemini 3.5 Flash-Lite daha yeni bir modeldir. Eski 3.1 Flash-Lite önceki nesle aittir. API çağrınızda gemini-3.5-flash-lite model kimliğini kullandığınızı doğrulayın.
Gemini 3.5 Flash-Lite ücretsiz mü?
Google AI Studio üzerinden hız sınırlamalı ücretsiz katman vardır. Bu katman test ve hafif kullanım için uygundur. Üretim hacmi için ücretli API anahtarına geçmelisiniz.
Flash-Lite en iyi hangi işler için kullanılır?
Yüksek hacimli sınıflandırma, metin çıkarma, kısa sohbet yanıtları ve basit RAG işleri için uygundur. Zorlu aracılı kodlama veya uzun çok adımlı muhakeme gerektiren görevlerde Gemini 3.6 Flash daha iyi bir seçimdir.


Top comments (0)