Gemini 3.8 Flash Fiyatlandırması: Token Maliyeti, Düşünme Seviyeleri ve 2027 Artışı
Gemini 3.8 Flash, Google’ın Gemini 3.7 Flash için belirlediği tanıtım fiyatını koruyor: 1 milyon giriş tokenı başına 0,75 dolar ve 1 milyon çıkış tokenı başına 3,75 dolar. Bu fiyatlar 31 Aralık 2026’ya kadar geçerli. 1 Ocak 2027’de fiyatlar sırasıyla 1,50 dolar ve 7,50 dolara çıkacak; aynı artış Gemini 3.6 Flash ve 3.7 Flash için de uygulanacak. Token başına oran değişmese de modelin kullandığı token miktarı değişti.
Google, Gemini 3.8 Flash’ın daha fazla muhakeme adımı yürüttüğünü, araçları yinelemeli olarak çağırdığını ve karmaşık görevlerde daha fazla token kullanabildiğini belirtiyor. Artificial Analysis da bu etkiyi ölçtü: yüksek düşünme seviyesinde Intelligence Index görev başına maliyet 3.8 Flash için 0,58 dolar, 3.7 Flash için 0,40 dolar oldu. 3.8 Flash görev başına yaklaşık %30 daha fazla çıkış tokenı kullandı.
Bu rehber, resmi Gemini API fiyatlandırma sayfasındaki oranları, farklı düşünme seviyelerinin maliyetini, alternatif modellerle karşılaştırmayı ve Apidog ile token regresyonlarını yakalamayı ele alır. Modelin genel özellikleri için Gemini 3.8 Flash nedir? yazısıyla başlayabilirsiniz.
Gemini 3.8 Flash fiyatlandırmasına hızlı bakış
Tüm fiyatlar ücretli katmanda 1 milyon token başınadır.
| Oran | Giriş — 31 Aralık 2026’ya kadar | Standart — 1 Ocak 2027’den itibaren |
|---|---|---|
| Giriş: metin, resim, video, ses, PDF | $0.75 | $1.50 |
| Çıkış: düşünme tokenları dahil | $3.75 | $7.50 |
| Bağlam önbelleği okuma | $0.075 | $0.15 |
| Önbellek depolama — saat başına 1 milyon token | $0.50 | $1.00 |
| Toplu API girişi — %50 indirimli | $0.375 | $0.75 |
| Toplu API çıkışı — %50 indirimli | $1.875 | $3.75 |
| Google Search grounding | Gemini 3.x genelinde ayda 5.000 ücretsiz istek; sonrasında 1.000 istek başına $14 | Aynı |
| Ücretsiz katman | $0; oran sınırlı, veriler Google ürünlerini geliştirmek için kullanılır | Aynı |
Üç ayrıntı özellikle önemli:
- Çıkış fiyatı düşünme tokenlarını da kapsar. Dahili muhakeme 0,75 dolardan değil, 3,75 dolardan faturalandırılır.
- Tanıtım fiyatının kesin bitiş tarihi 31 Aralık 2026’dır.
- Gemini 3.6 Flash ve 3.7 Flash satırları da 1 Ocak 2027’deki iki kat artışa dahildir.
Aynı oranları, görev başına daha az token kullanan önceki model üzerinden görmek için 3.7 Flash fiyatlandırma dökümüne bakabilirsiniz.
Düşünme tokenları çıkış tokenıdır
Gemini 3.8 Flash, yanıt üretmeden önce muhakeme yapar. Bu süreçte üretilen her token çıkış olarak ölçülür. API, generateContent yanıtında şu alanları ayrı ayrı döndürür:
-
promptTokenCount: Girdi tokenları -
candidatesTokenCount: Görünür yanıt tokenları -
thoughtsTokenCount: Düşünme tokenları
Görünür yanıt ve düşünme tokenlarının ikisi de 1 milyon token başına 3,75 dolar üzerinden faturalandırılır. Ayrıntılar için Google’ın düşünme dokümantasyonuna ve 3.8 Flash düşünme seviyeleri rehberine göz atın.
Düşünme seviyesini thinking_level ile belirlersiniz:
lowmediumhigh
Gemini 3.8 Flash’ın varsayılan seviyesi medium’dur. Gemini 3 Pro’daki gibi varsayılan olarak high kullanılmaz. minimal seviyesi kaldırılmıştır ve doğrulama hatası döndürür. Eski modellerden taşınan yapılandırmalarda minimal değerini low ile değiştirin.
Google, seviyeleri sabit token bütçeleri olarak değil, göreceli çaba düzeyleri olarak tanımlar. Bu nedenle eski thinking_budget parametresiyle düşünme tokenlarını doğrudan sınırlayamazsınız.
Maliyet hesabı örneği
Bir istek:
- 10.000 giriş tokenı gönderiyor,
- 2.000 görünür çıkış tokenı alıyor,
- 6.000 düşünme tokenı üretiyor olsun.
Tanıtım fiyatlarıyla hesap:
Giriş: 10.000 × 0,75 / 1.000.000 = 0,0075 dolar
Çıkış: (2.000 + 6.000) × 3,75 / 1.000.000 = 0,03 dolar
Toplam: 0,0375 dolar
Düşünme tokenları, çıkış maliyetinin %75’ini ve toplam istek maliyetinin %60’ını oluşturur. 1 Ocak 2027’den sonra aynı istek:
0,015 dolar + 0,06 dolar = 0,075 dolar
“3.7 ile aynı fiyat” ifadesi yalnızca token başına oran için doğrudur. Oran aynı kalsa da modelin tükettiği token miktarı artmıştır.
Fiyat değişmezken görev başına maliyet neden arttı?
Google’ın lansman yazısına göre model, karmaşık görevlerde:
- Ek muhakeme adımları yürütüyor.
- Araçları yinelemeli olarak çağırıyor.
- Çalışmasını daha fazla doğruluyor.
Bu davranış daha fazla düşünme tokenı ve ajan döngülerinde daha fazla araç çağrısı anlamına gelir. Google’ın önerisi, gerekirse thinking_level değerini düşürmek veya 3.7 Flash’ta kalmaktır.
Artificial Analysis verileri şöyle:
| Yapılandırma | Görev başına maliyet | Görev başına süre |
|---|---|---|
| Gemini 3.8 Flash — yüksek | $0.58 | 2,5 dakika |
| Gemini 3.8 Flash — orta | $0.41 | Açıklanmadı |
| Gemini 3.8 Flash — düşük | $0.24 | 0,8 dakika |
| Gemini 3.7 Flash — yüksek | $0.40 | 2,2 dakika |
Bu tablo iki açıdan okunabilir:
- 3.8 Flash yüksek seviyede, 3,7 Flash’a göre üç puanlık Intelligence Index kazanımı için görev başına %45 daha pahalıdır:
0,58 / 0,40 = 1,45. - 3.8 Flash içinde yüksekten orta seviyeye geçiş maliyeti %29, düşük seviyeye geçiş ise %59 azaltır.
Orta seviye, 3.7 Flash’ın yüksek seviyedeki 0,40 dolarlık maliyetine oldukça yakındır. Bu nedenle yükseltme kararını yalnızca model adına veya token başına fiyata göre değil, aynı görev setindeki gerçek kullanım verisine göre verin. 3.8 Flash ve 3.7 Flash karşılaştırması bu kararı iş yüküne göre ayrıntılandırır.
Artificial Analysis ayrıca 3:1 giriş-çıkış oranında 1 milyon token başına 0,58 dolarlık karma fiyat bildiriyor. Bu değer, yüksek seviyedeki görev başına maliyetle aynı olsa da iki farklı şeyi ifade eder: biri token baş doldurma ve tek seferlik belge işleme:** 100 milyon tokenlık bir işin 75 milyon giriş ve 25 milyon çıkış tokenından oluştuğunu varsayalım.
75 × 0,375 + 25 × 1,875
= 28,13 + 46,88
= 74,99 dolar
Ocak 2027’de aynı iş 149,98 dolar olur.
- Değerlendirme setinizi şimdi oluşturun: Ocak ayında fiyat ve token tüketimi aynı anda değişmesin. Temel token sayılarını bugünden kaydedin.
-
Her rota için düşünme seviyesini belirleyin: Varsayılan
mediumolarak bırakılan her rota, maliyeti henüz ölçülmemiş bir rotadır.lowseviyesinde testleri geçen rotaları bu seviyede sabitleyin.
Diğer sağlayıcıları da değerlendirmek için en ucuz LLM API sağlayıcıları özetine ve Fable 5.1 ile GPT-5.6 Sol karşılaştırmasına bakabilirsiniz.
Flash-Lite, Claude Sonnet 5 ve GPT-5.6 Luna karşılaştırması
1 milyon token başına oranlar:
| Model | Giriş | Çıkış | Notlar |
|---|---|---|---|
| Gemini 3.8 Flash — tanıtım | $0.75 | $3.75 | Düşünme çıkış olarak faturalandırılır; önbellek okuma $0.075 |
| Gemini 3.8 Flash — 1 Ocak’tan itibaren | $1.50 | $7.50 | Önbellek okuma $0.15 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | Yaklaşık 350 token/sn |
| Claude Sonnet 5 | $2 | $10 | Kalıcı fiyat; 1 Eylül zammı iptal edildi |
| GPT-5.6 Luna | $1 | $6 | — |
Tanıtım döneminde:
- 3.8 Flash girişi, Flash-Lite’ın 2,5 katıdır.
- 3.8 Flash çıkışı, Flash-Lite’ın 1,5 katıdır.
- Sonnet 5’e göre girişte ve çıkışta yaklaşık 2,7 kat daha ucuzdur.
- Luna’ya göre girişte 0,75 dolara karşı 1 dolar, çıkışta 3,75 dolara karşı 6 dolar maliyet sunar.
1 Ocak 2027’de fiyatlar değiştiğinde 3.8 Flash, hem girişte hem çıkışta Luna’dan daha pahalı hale gelir. Sonnet 5 ile arasındaki fark da yaklaşık 1,3 kata iner. Flash-Lite ise daha ucuz kalır.
Token başına fiyat yalnızca hikâyenin yarısıdır. Daha yüksek oranlı ancak daha az token kullanan bir model, görev başına daha ucuz olabilir. Bunun tek güvenilir yolu aynı görev setini her aday modelde çalıştırıp kullanım metriklerini karşılaştırmaktır. 3.8 Flash API rehberi, usageMetadata alanlarını hem Interactions API hem de eski generateContent akışında nasıl okuyacağınızı gösterir.
Apidog ile token maliyeti regresyonlarını yakalayın
Gemini 3.8 Flash’ta en tehlikeli hata modu yanlış yanıt değil, doğru yanıtın sessizce %40 daha fazla token kullanmasıdır. Bunu fatura gelmeden yakalamak için token sayılarını test edilebilir sınırlar olarak tanımlayın.
1. API anahtarını ortam değişkeninde saklayın
Apidog ortamında GEMINI_API_KEY oluşturun. İsteğin x-goog-api-key başlığında anahtarı şu şekilde kullanın:
{{GEMINI_API_KEY}}
Böylece anahtar kaydedilmiş isteğin içine yazılmaz.
2. Altın bir istek oluşturun
Her üretim rotası için temsili bir istem ve açık bir thinkingConfig.thinkingLevel değeriyle şu adrese POST isteği kaydedin:
https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
3. Kullanım alanlarını doğrulayın
usageMetadata değerlerini okuyan bir son işlemci betiği ekleyin:
const usage = pm.response.json().usageMetadata;
pm.test("thinking tokens within budget", () => {
pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});
pm.test("visible output within budget", () => {
pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});
pm.test("request cost within budget", () => {
const cost = usage.promptTokenCount * 0.75 / 1e6
+ (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;
pm.expect(cost).to.be.below(0.05);
});
4. Testleri zamanlayın
İstekleri bir test senaryosuna ekleyip programlı olarak çalıştırın. Böylece token tüketimindeki artış aynı gün başarısız bir test olarak görünür.
Apidog’da API testlerini zamanlama rehberi kurulum adımlarını açıklar. 1 Ocak’ta fiyat sabitlerini güncellediğinizde maliyet testi çalışmaya devam eder.
Aynı senaryonun kopyalarını Flash-Lite, Sonnet 5 ve Luna için çalıştırarak sağlayıcıları yan yana karşılaştırabilirsiniz. İlk senaryonuzu oluşturmak için Apidog’u indirin; ücretsiz plan bu iş akışını destekler.
SSS
Gemini 3.8 Flash, 3.7 Flash’tan daha mı pahalı?
Token başına hayır. Her iki model de 31 Aralık 2026’ya kadar 0,75 dolar giriş ve 3,75 dolar çıkış ücretine sahip. 1 Ocak 2027’de oranlar 1,50 dolar ve 7,50 dolar olacak.
Görev başına evet. Artificial Analysis, yüksek seviyede Intelligence Index görevi başına 3.8 Flash için 0,58 dolar, 3.7 Flash için 0,40 dolar ölçtü. Bunun nedeni 3.8 Flash’ın yaklaşık %30 daha fazla çıkış tokenı kullanmasıdır.
Düşünme tokenları ayrı mı faturalandırılıyor?
Hayır. Düşünme tokenları, tanıtım döneminde 1 milyon başına 3,75 dolar olan çıkış tokenı ücretine dahildir ve usageMetadata.thoughtsTokenCount içinde görünür.
Bunları dolaylı olarak thinking_level ile kontrol edersiniz. Gemini 3.8 Flash’ta sabit token bütçesi yoktur ve minimal değeri hata döndürür.
Gemini 3.8 Flash’ın ücretsiz katmanı var mı?
Evet. AI Studio ücretsiz katmanında giriş ve çıkış için ücret alınmaz; ancak oran limitleri uygulanır ve Google, ücretsiz katman verilerini ürünlerini geliştirmek için kullanır.
Tüketici Gemini uygulamasında 3.8 Flash yalnızca AI Pro ve Ultra abonelerine sunulur. Ayrıntılar için ücretsiz kullanım rehberine bakın.
1 Ocak 2027’de maliyetler ne olacak?
Giriş, çıkış, önbellek okuma, önbellek depolama ve toplu işlem oranları iki katına çıkacak. Token tüketimi değişmezse faturanız da iki katına çıkar. Gemini 3.6 Flash ve 3.7 Flash oranları da aynı tarihte iki katına çıkacak.
Hangi düşünme seviyesi maliyeti düşük tutar?
Artificial Analysis’ın Intelligence Index dağılımı başlangıç noktası olabilir:
-
low: Görev başına $0.24 -
medium: Görev başına $0.41 -
high: Görev başına $0.58
Her seviyeyi kendi değerlendirme setinizde çalıştırın. Testleri geçen en düşük seviyeyi seçin ve token sınırlarını iddia ederek ayarın zaman içinde değişmediğini doğrulayın.
Bu hafta yapılacaklar
- Her üretim rotası için
thinking_leveldeğerini açıkça belirleyin. -
usageMetadataiçindeki düşünme ve görünür çıkış tokenlarını kaydedin. - Token ve görev başına maliyet için test sınırları ekleyin.
- Batch API’ye uygun işleri 31 Aralık 2026’dan önce çalıştırın.
- Ocak fiyatlarını ve temel token sayılarını değerlendirme setinizle yeniden ölçün.
Gemini 3.8 Flash, 3.7 Flash ile aynı fiyatlandırılırken daha büyük bir model gibi token harcıyor. Düşünme seviyesini yalnızca kalite ayarı değil, doğrudan maliyet ayarı olarak ele alın; her rotada ölçün, sınırlandırın ve doğrulayın.

Top comments (0)