DEV Community

Cover image for Gemini 3.7 Flash'tan 3.8 Flash'a API Geçiş Rehberi
Tobias Hoffmann
Tobias Hoffmann

Posted on Originally published at apidog.com

Gemini 3.7 Flash'tan 3.8 Flash'a API Geçiş Rehberi

Gemini 3.8 Flash'a Geçiş: 3.7 Flash Kullanıcıları İçin 9 Maddelik Kontrol Listesi

Google, Gemini 3.8 Flash'ı 3.7 Flash'tan üç hafta sonra, 2 Eylül 2026'da, aynı başlangıç fiyatıyla ve yaklaşık aynı hızla piyasaya sürdü. Model kimliği gemini-3.8-flash; önizleme eki yok ve model kartı modeli “Gemini 3.7 Flash'a dayalı” olarak tanımlıyor. Basit bir sohbet istemi için geçiş çoğunlukla tek satırlık bir değişikliktir. Ancak düşünme parametrelerini, örneklemeyi veya araç döngülerini kullanan ekiplerin kontrol etmesi gereken dokuz madde vardır; bunlardan ikisi 3.7 Flash'ta görülmeyen hatalara yol açabilir.

Bugün Apidog'u deneyin

Bu rehber, Google'ın Gemini 3.8 Flash'taki Yenilikler sayfası ve Gemini 3 geliştirici rehberindeki bilgilerden derlenmiştir. Google'ın Gemini 3.x için birincil kabul ettiği Etkileşimler API'si ile 3.7 Flash kodlarının çoğunun hâlâ kullandığı eski generateContent uç noktası birlikte ele alınır. Örnekleri Apidog'a yapıştırıp üretime geçmeden önce canlı uç noktada çalıştırabilirsiniz. Önce modelin genel görünümünü incelemek isterseniz Gemini 3.8 Flash nedir ile başlayın.

Önce çerçeveyi anlayın

Google, 3.8 Flash'ın tasarım gereği “daha çok çalıştığını” belirtiyor: karmaşık görevlerde daha küçük akıl yürütme adımları atıyor, sonuçlarını doğruluyor ve araçları yinelemeli olarak çağırıyor. Kazanımların önemli bölümü buradan geliyor. Bu nedenle geçiş yalnızca bir yapılandırma değişikliği değil, aynı zamanda bir token bütçesi incelemesidir.

Ne değişir, ne değişmez?

Alan 3.7 Flash 3.8 Flash
Model kimliği gemini-3.7-flash gemini-3.8-flash
Bağlam / çıkış 1.048.576 / 65.536 Aynı
Fiyat (31 Aralık 2026'ya kadar tanıtım) 1M başına 0,75 $ / 3,75 $ Aynı; 1 Ocak 2027'den itibaren her ikisi için 1,50 $ / 7,50 $
Düşünme seviyeleri low, medium, high Aynı; minimal doğrulama hatası döndürür, varsayılan medium'dur
Görev başına token Temel Ortalama %30 daha fazla çıkış tokeni (Artificial Analysis)
Fonksiyon sonuçları call_id + name Her ikisi de zorunlu
Destek durumu “Tamamen desteklenmeye devam ediyor”, sona erme tarihi yok Mevcut

Fiyatlandırma kaynağı Google Gemini API fiyatlandırma sayfasıdır. Sayfadaki 3.6, 3.7 ve 3.8 Flash fiyat satırları aynıdır.

Adım 0: Geçiş gerekli mi?

Geçiş zorunlu değil. Google'ın lansman yazısı Gemini 3.7 Flash'ın “tamamen desteklenmeye devam ettiğini” belirtiyor ve bir sona erme tarihi yayınlamıyor.

Token başına fiyat değişmedi; fark kullanım miktarından kaynaklanıyor. Artificial Analysis, yüksek düşünme seviyesinde 3.8 Flash'ın endekslerinde görev başına yaklaşık 48 bin çıkış tokeni kullandığını, bunun 3.7 Flash'tan %30 fazla olduğunu ve görev başına maliyeti aynı oranlarda 0,40 $'dan 0,58 $'a çıkardığını ölçtü. Endeks puanları 56'dan 59'a yükselirken, τ³-Banking araç kullanım doğruluğu 12 puan artarak %45'e ulaştı.

Takas basit: görev başına daha fazla token karşılığında daha yüksek yetenek. İş yükünüz kısa ve gecikmeye duyarlıysa veya 3.7 Flash'ta değerlendirmeleri zaten geçiyorsa mevcut modelde kalabilirsiniz. Geçiş kararı için 3.8 Flash ve 3.7 Flash karşılaştırmasına bakın.

Adım 1: Model kimliğini iki API şeklinde değiştirin

Etkileşimler API'si

{"model": "gemini-3.7-flash", "input": "..."}
{"model": "gemini-3.8-flash", "input": "..."}
Enter fullscreen mode Exit fullscreen mode
{"model": "gemini-3.8-flash", "input": "..."}
Enter fullscreen mode Exit fullscreen mode

Eski generateContent uç noktası

Bu uç nokta hâlâ destekleniyor ve sona erme tarihi yok:

POST /v1beta/models/gemini-3.7-flash:generateContent
POST /v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Python SDK

client.interactions.create(
    model="gemini-3.8-flash",
    input=...,
    generation_config={"thinking_level": "medium"},
)

client.models.generate_content(
    model="gemini-3.8-flash",
    contents=...,
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)
Enter fullscreen mode Exit fullscreen mode

Etkileşimler API'sini daha önce kullanmadıysanız 3.8 Flash API rehberi iki API şeklini de uçtan uca gösterir. 3.7 Flash API rehberi ise yalnızca generateContent akışını kapsar.

Dokuz maddelik geçiş kontrol listesi

1. thinking_level: "minimal" değerini low ile değiştirin

3.8 Flash yalnızca low, medium ve high kabul eder. minimal gönderirseniz doğrulama hatası alırsınız. Değer gönderilmezse varsayılan medium olur. Gemini 3 Pro'nun varsayılanı high olduğu için Pro yapılandırmasını kopyalayıp eşleştiğini varsaymayın.

Önce — Etkileşimler API'si:

{"generation_config": {"thinking_level": "minimal"}}
Enter fullscreen mode Exit fullscreen mode

Sonra:

{"generation_config": {"thinking_level": "low"}}
Enter fullscreen mode Exit fullscreen mode

Eski API şekli:

{"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}}
Enter fullscreen mode Exit fullscreen mode

Google'ın düşünme dokümantasyonu, low seviyesini gecikme ayarı; medium seviyesini ise karmaşık kod ve ajanik çalışmalar için varsayılan olarak tanımlar. minimal için doğrudan karşılık low'dur. Rota başına doğru seviye için düşünme seviyeleri rehberine bakın.

2. temperature, top_p ve top_k değerlerini kaldırın

Google, tüm Gemini 3 modellerinde sıcaklığın varsayılan 1.0 değerinde bırakılmasını öneriyor. Daha düşük değerler döngülere veya performans düşüşüne neden olabilir. 3.7 Flash yapılandırmalarında önceki nesillerden kalan temperature: 0.2 gibi değerleri silin.

Önce:

{"generationConfig": {"temperature": 0.2, "topP": 0.9, "topK": 40}}
Enter fullscreen mode Exit fullscreen mode

Sonra:

{"generationConfig": {"thinkingConfig": {"thinkingLevel": "medium"}}}
Enter fullscreen mode Exit fullscreen mode

Tekrarlanabilir JSON için düşük sıcaklık kullanıyorsanız örnekleme ayarlarını değiştirmek yerine yapılandırılmış çıktıları kullanın. 3.8 Flash yapılandırılmış çıktıları destekler ve şemaya uyan yanıtlar üretir.

3. thinking_budget yerine thinking_level kullanın

thinking_budget bir tam sayı token sınırıydı. thinking_level ise bir dize numaralandırmasıdır; aralarında aritmetik bir eşleşme yoktur.

  • Gecikmeye duyarlı rotalar: low
  • Varsayılan rotalar: medium
  • En zor, çok adımlı rotalar: high

Önce:

{"generationConfig": {"thinkingConfig": {"thinkingBudget": 4096}}}
Enter fullscreen mode Exit fullscreen mode

Sonra:

{"generationConfig": {"thinkingConfig": {"thinkingLevel": "low"}}}
Enter fullscreen mode Exit fullscreen mode

Düşünme tokenleri hâlâ çıkış tokeni olarak faturalandırılır ve usageMetadata.thoughtsTokenCount alanında raporlanır. Bu nedenle maliyet kontrolü sabit bir limitten seviye seçimine ve regresyon doğrulamalarına kayar.

4. candidate_count değerini kaldırın

Gemini 3 ve sonrası birden fazla aday desteklemez. candidateCount anahtarını ve candidates[1] veya sonrasını kullanan kodu kaldırın.

Önce:

{"generationConfig": {"candidateCount": 2}}
Enter fullscreen mode Exit fullscreen mode

Sonra:

{"generationConfig": {}}
Enter fullscreen mode Exit fullscreen mode

En iyi adayı seçmek için çoklu örnekleme yapıyorsanız, 3.8 Flash'ta bunun karşılığı tek yanıtta daha yüksek bir düşünme seviyesi ve doğrulamadır.

5. Her fonksiyon sonucuna call_id ve name ekleyin

Bu, ikinci kritik kırılma noktasıdır. 3.8 Flash'a gönderdiğiniz her fonksiyon sonucu hem çağrı kimliğini hem de fonksiyon adını taşımalıdır. Yalnızca adı geri gönderen kod, araç sonucu aşamasında başarısız olur.

Etkileşimler API'si:

{
  "previous_interaction_id": "<function_call adımındaki id>",
  "input": [{
    "type": "function_result",
    "name": "get_weather",
    "call_id": "<function_call adımındaki idleşmelidir. Kanonik örnekler için [fonksiyon çağırma referansına](https://ai.google.dev/gemini-api/docs/function-calling), iki aşamalı akış ve 3.8 Flash'ın neden daha fazla araç çağrısı yaptığı için [3.8 Flash fonksiyon çağırma rehberine](https://apidog.com/tr/blog/gemini-3-8-flash-function-calling?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) bakın.

### 6. Düşünce imzalarını olduğu gibi geri gönderin

Gemini 3 modelleri yanıt bölümlerine düşünce imzaları ekler. Sonraki adımı kendiniz oluşturuyorsanız yalnızca metni değil, tüm bölüm türlerini ve imzaları değiştirmeden geri gönderin. İmzaları kaldırmak veya yeniden serileştirmek modelin sonraki adımdaki sürekliliğini bozabilir.

Etkileşimler API'sinde `previous_interaction_id` göndererek sunucu tarafı geçmişi kullanabilirsiniz. `store: false` ayarlarsanız geçmişi yeniden siz taşırsınız; düşünce bloklarını ve imzalarını da geri göndermeniz gerekir.

Eski `generateContent` şeklinde geçmiş her zaman istemci tarafındadır. Son yanıttan kesilmiş bir kopyayla `contents` oluşturan kodları özellikle denetleyin.

### 7. Token bütçesini rota bazında artırın

Bu değişiklik hata döndürmediği için kolayca gözden kaçar. [Artificial Analysis](https://artificialanalysis.ai/articles/gemini-3-8-flash) yüksek düşünme seviyesinde yaklaşık %30 daha fazla çıkış tokeni ölçtü. Google da modelin uzun ve karmaşık görevlerde, özellikle yüksek çaba seviyelerinde, tasarım gereği daha fazla token kullanabileceğini belirtiyor.

Bütçeyi küresel değil, rota bazında planlayın:

- **Gecikmeye duyarlı uç noktalar:** `low`. Artificial Analysis, görev başına `low` seviyesinde 0,8 dakika ve 0,24 $; `high` seviyesinde 2,5 dakika ve 0,58 $ ölçtü.
- **Varsayılan rotalar:** `medium`; aynı endekste görev başına yaklaşık 0,41 $.
- **Ajan döngüleri:** Daha fazla araç çağrısı turu bekleyin. Döngüyü yalnızca token sayısıyla değil, tur sayısıyla da sınırlayın.

65.536 çıkış tokeni tavanını yeniden gözden geçirin. Düşünmeyle birlikte 40 bin token döndüren bir 3.7 Flash istemi, 3.8 Flash'ta sınıra daha yakın çalışabilir. Üç seviyenin görev başına maliyetlerini incelemek için [3.8 Flash fiyatlandırma dökümünü](https://apidog.com/tr/blog/gemini-3-8-flash-pricing?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) kullanın.

### 8. `media_resolution_high` değerini PDF ve videoda ayrı test edin

3.8 Flash metin, resim, video, ses ve PDF girdilerini kabul eder. Medya çözünürlüğü, her girdinin tükettiği token sayısını değiştirir; maliyet medya türüne göre de farklılaşır. PDF sayfasında uygun maliyetli olan bir ayar, uzun videoda pahalı olabilir.

3.7 Flash'tan genel bir yüksek çözünürlük ayarını ölçüm yapmadan taşımayın. Temsili bir PDF ve video göndererek her çözünürlükte `usageMetadata.promptTokenCount` değerlerini karşılaştırın.

### 9. Görüntü segmentasyonu çağrılarını kaldırın

Görüntü segmentasyonu Gemini 3 modellerinde desteklenmez. 3.7 Flash döneminden kalma bir işlem hattı eski bir Gemini modeli üzerinden segmentasyon yapıyorsa bu yol geçişten bağımsızdır. Ancak 3.8 Flash'tan segmentasyon maskesi isteyen bir istemin kullanılabilir çıktı yerine başarısız olmasını bekleyin.

Model sayfasına göre görüntü oluşturma, ses oluşturma ve Live API de 3.8 Flash'ta desteklenmez. Ayrıntılar için [Gemini 3.8 Flash model sayfasına](https://ai.google.dev/gemini-api/docs/models/gemini-3.8-flash) bakın.

## Apidog'da regresyon planı oluşturun

İki kritik değişiklik ve token kullanımındaki kayma nedeniyle geçişi tek seferlik bir `curl` çağrısı olarak değil, tekrarlanabilir bir karşılaştırma olarak ele alın. [Apidog](https://apidog.com/?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) bir API istemcisi ve test çalıştırıcısıdır: istekleri gönderir, yanıtları doğrular ve çalıştırmaları planlar; modeli kendisi çalıştırmaz.

### Ortam ve değişkenler

Bir Gemini ortamı oluşturun ve şunları saklayın:

- `GEMINI_API_KEY`: gizli değişken
- `MODEL`: model değişkeni

`generateContent` URL'sinde ve Etkileşimler API'sinin `model` alanında `{{MODEL}}` kullanın. Böylece aynı kayıtlı isteği iki modelle çalıştırabilirsiniz.

### Altın istemler

Gerçek rotalarınızı temsil eden 10–20 istem kaydedin:

- Kısa bir sohbet dönüşü
- Yapılandırılmış çıktı çıkarma
- Sahte bir araçla iki aşamalı fonksiyon çağrısı
- Bir PDF girdisi
- Bir video girdisi

Her istemi bir test senaryosundaki ayrı bir istek olarak tanımlayın.

### İstek başına doğrulamalar

Her isteğe şu üç doğrulamayı ekleyin:

1. Durum kodu `200` olmalı ve yanıt gövdesi JSON şemasıyla eşleşmeli. Yapılandırılmış çıktı rotalarında alt akışta ayrıştırdığınız alanları da doğrulayın.
2. `usageMetadata.thoughtsTokenCount`, rota için belirlediğiniz tavanın altında kalmalı. Örneğin `low` rotası için 8.000 token.
3. `usageMetadata.totalTokenCount`, 7. maddede belirlediğiniz rota bütçesinin altında kalmalı.

Fonksiyon çağrısı senaryosunda, geri gönderilen `call_id` değerinin önceki adımın `function_call.id` değeriyle eşleştiğini ayrıca doğrulayın.

### Yan yana çalıştırma

Senaryoyu çoğaltın:

- Bir senaryoda `MODEL=gemini-3.7-flash`
- Diğerinde `MODEL=gemini-3.8-flash`

Her ikisini de çalıştırın. Apidog test raporları doğrulama başına geçme/kalma durumlarını ve yanıt gövdelerini gösterir. Böylece istem başına token farklarını günlüklerden yeniden oluşturmadan tek görünümde inceleyebilirsiniz.

### Planlı çalıştırma

3.8 Flash senaryosunu planlı çalıştırmaya dönüştürün. Token tavanlarını dağıtım penceresi boyunca günlük olarak kontrol edin. Kurulum için [Planlı API testleri rehberine](https://apidog.com/tr/blog/how-to-schedule-api-tests-apidog?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) bakın. İsterseniz [Apidog'u indirin](https://apidog.com/download?utm_source=dev.to&utm_medium=wanda&utm_content=n8n-post-automation) ve yukarıdaki parçacıkları içe aktarın.

## Geri alma: 3.7 Flash'ı yapılandırma bayrağının arkasında tutun

3.7 Flash tamamen desteklenmeye devam ettiği ve 3.8 Flash ile aynı fiyatlandırmayı paylaştığı için geri alma kolaydır. Model kimliklerini kod içine gömmek yerine yapılandırmada tutun:

Enter fullscreen mode Exit fullscreen mode


json
{
"gemini_model": "gemini-3.8-flash",
"gemini_fallback_model": "gemini-3.7-flash"
}




Üç kural geri almayı güvenli hale getirir:

- **İstek şeklini ortak tutun.** 1–6. maddelerdeki değişiklikler — `minimal` kullanmamak, örnekleme anahtarlarını kaldırmak, `thinking_budget` yerine `thinking_level` kullanmak, `candidate_count` göndermemek, `call_id` + `name` eklemek ve imzaları korumak — 3.7 Flash'ta da geçerlidir. Böylece bayrağı değiştirmek ikinci bir kod yolu gerektirmez.
- **Rota bazında yayınlayın.** Önce token farkının en küçük olduğu `low` gecikme rotalarını geçirin. Ajan döngülerini, yan yana senaryolar birkaç gün çalıştıktan sonra taşıyın.
- **Tokenları da izleyin.** 3.8 Flash'ta geri alma nedeni 4xx hatasından çok maliyet veya gecikme regresyonu olabilir. Token tavanı doğrulamalarını uyarı sisteminize bağlayın.

## Sıkça Sorulan Sorular

### Gemini 3.8 Flash, 3.7 Flash'tan daha mı pahalı?

Token başına değil. Her iki model de 31 Aralık 2026'ya kadar 1M token başına 0,75 $ giriş / 3,75 $ çıkış ücretine sahip. Her ikisi de 1 Ocak 2027'de 1,50 $ / 7,50 $ seviyesine çıkacak. Ancak 3.8 Flash tasarım gereği görev başına daha fazla token kullanıyor; Artificial Analysis yüksek düşünme seviyesinde yaklaşık %30 daha fazla çıkış tokeni ölçtü.

### `thinking_level: "minimal"` değerini bırakırsam ne olur?

3.8 Flash isteği doğrulama hatasıyla başarısız olur. Değeri `low` olarak değiştirin.

### 3.8 Flash için Etkileşimler API'sine geçmem gerekiyor mu?

Hayır. `generateContent` eski olarak tanımlansa da sona erme tarihi olmadan desteklenmeye devam ediyor ve 3.8 Flash ile çalışıyor. Etkileşimler API'si, `previous_interaction_id` üzerinden sunucu tarafı konuşma durumu sağlayarak 6. maddedeki imza yönetimini kolaylaştırır.

### 3.7 Flash kullanımdan kaldırılıyor mu?

Google, modelin “tamamen desteklenmeye devam ettiğini” söylüyor ve bir kullanımdan kaldırma tarihi yayınlamadı. Bu nedenle yapılandırma bayrağıyla geri alma hâlâ mümkündür.

### 3.7 Flash için ayarladığım sıcaklığı koruyabilir miyim?

Google'ın tüm Gemini 3 modelleri için tavsiyesi sıcaklığı `1.0` değerinde bırakmaktır. 3.7 Flash'ta sıcaklığı zaten geçersiz kılıyorsanız, bu geçiş onu kaldırıp değerlendirmelerinizi çalıştırmak için iyi bir fırsattır. Deterministik şekiller için desteklenen yaklaşım yapılandırılmış çıktılardır.

## Aşamalı yayınlayın

Geçişin kod tarafı küçüktür: bir model kimliği değişikliği, dört yapılandırma alanının silinmesi veya yeniden adlandırılması, iki araç döngüsü alanı ve bir imza denetimi. Zaman alan bölüm, token bütçesinin rota bazında uygun kaldığını kanıtlamaktır.

Altın istemleri kaydedin, şema ve token tavanlarını doğrulayın, sayılar yerleşene kadar 3.7 ve 3.8 Flash'ı yan yana çalıştırın. Ardından bayrağı her seferinde bir rotayı taşıyacak şekilde güncelleyin. Bir rota gerilerse model kimliğini kod değişikliği yapmadan 3.7 Flash'a geri alabilir, iyileşen rotaları koruyabilirsiniz.
Enter fullscreen mode Exit fullscreen mode

Top comments (0)