DEV Community

Cover image for OpenAI Ultra Hızlı: 6 Kat Hız, 6 Kat Fiyat. Ne Zaman Kendini Amorti Eder?
Tobias Hoffmann
Tobias Hoffmann

Posted on Originally published at apidog.com

OpenAI Ultra Hızlı: 6 Kat Hız, 6 Kat Fiyat. Ne Zaman Kendini Amorti Eder?

OpenAI Ultrafast yeni bir model değil, bir hizmet katmanıdır. gpt-6-astra için bir Responses API isteğine service_tier: "ultrafast" eklediğinizde API, jetonları 6 kata kadar daha hızlı üretir. Codex tarafında iddia 8 kata veya saniyede 300 jetona kadardır. Bunun karşılığında Standard katmanın 6 katı maliyet ödersiniz: 1 milyon jeton başına 10$ ve 50$ yerine 60$ giriş ve 300$ çıkış. Model kimliği değişmez; yanıtlar daha akıllı değil, yalnızca daha hızlı gelir.

Apidog'u bugün deneyin

OpenAI, Ultrafast'ı 29 Eylül 2026 DevDay etkinliğinde GPT-6 Astra için geniş kullanıma açtı. Ayrıntılar için DevDay'den diğer her şey yazısına bakın. Bu rehberde kullanılabilirlik, istek yapısı, fiyatlandırma, oran limitleri ve kendi verilerinizle uygulayabileceğiniz başabaş hesabı yer alır. Model ayrıntıları için GPT-6 Astra API kılavuzunu okuyun.

Bir bakışta OpenAI Ultrafast

Öğe Detay
Nedir OpenAI API'deki en hızlı hizmet katmanı
Parametre Responses create veya WebSocket response.create üzerinde service_tier: "ultrafast"
Modeller Bugün GPT-6 Astra; GPT-6.1 Sol “yakında”
Hız iddiası API'de 6 kata kadar daha hızlı jeton üretimi; Codex'te 8 kata kadar, 300 jeton/sn
Fiyat (Astra) 1M jeton başına 60$ giriş, 6$ önbelleğe alınmış giriş, 75$ önbellek yazma, 300$ çıkış
Oran limitleri Kademe 1–3: 500K TPM; Kademe 4: 1M TPM; Kademe 5: 5M TPM
İşleme Yalnızca ABD veri ikametgahı ve küresel işleme
Aktarım Özellikle çok adımlı aracılar için WebSocket önerilir
ChatGPT planları Pro 500 ve Enterprise'da ChatGPT Work ve Codex

Kaynaklar: OpenAI’ın Ultrafast mod kılavuzu ve fiyatlandırma sayfası.

Ultrafast nedir ve kimler kullanabilir?

Ultrafast, GPT-6 Astra için premium hız katmanıdır. OpenAI kılavuzuna göre tüm API kullanıcıları düşük varsayılan oran limitleriyle erişebilir. OpenAI hesap ekibiyle çalışan kuruluşlar daha yüksek limit talep edebilir.

Kılavuz, GPT-5.6 Sol için hesap ekipleri üzerinden önizleme erişimi de listeler. OpenAI, Ultrafast'ı ilk olarak 13 Ağustos'ta GPT-5.6 Sol üzerinde önizledi. DevDay özeti ise GPT-6.1 Sol desteğinin sıradaki adım olduğunu belirtir. Bu modeller için henüz yayınlanmış bir Ultrafast fiyatı yoktur.

ChatGPT tarafında Ultrafast Astra, Pro 500 ve Enterprise planlarındaki ChatGPT Work ile Codex'te kullanılabilir. Bu planlar API kullanımını kapsamaz: komut dosyaları, CI işleri ve aracılar API anahtarıyla token bazlı ücretlendirilir.

Hız iddiasını doğru yorumlayın:

  • API için iddia, jeton üretiminde 6 kata kadar hızlanmadır.
  • Codex için iddia, 8 kata kadar veya 300 jeton/sn seviyesidir.
  • OpenAI, Ultrafast için ilk jetona kadar geçen süreyi (TTFT) yayınlamaz.
  • Yüksek token/sn değeri, ilk tokenın ne kadar hızlı geldiğini tek başına göstermez.

service_tier: "ultrafast" nasıl etkinleştirilir?

Her istekte modeli gpt-6-astra, hizmet katmanını ise ultrafast olarak ayarlayın.

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Explain why the sky is blue in one sentence.",
    "service_tier": "ultrafast"
  }'
Enter fullscreen mode Exit fullscreen mode

Çok adımlı araç çağrıları yapan aracılar için OpenAI, WebSocket kullanımını özellikle önerir. Tek bağlantı üzerinde iki tur çalıştıran Python örneği:

from openai import OpenAI

client = OpenAI()
previous_response_id: str | None = None

prompts = [
    "Explain why the sky is blue in one sentence.",
    "Now explain why sunsets look red.",
]

with client.responses.connect() as connection:
    for prompt in prompts:
        connection.response.create(
            model="gpt-6-astra",
            service_tier="ultrafast",
            previous_response_id=previous_response_id,
            input=prompt,
        )

        for event in connection:
            if event.type == "response.output_text.delta":
                print(event.delta, end="", flush=True)

            elif event.type == "response.completed":
                previous_response_id = event.response.id
                print()
                break

            elif event.type in {"response.failed", "response.incomplete", "error"}:
                raise RuntimeError(event.to_json())
        else:
            raise RuntimeError("Connection closed before the response finished.")
Enter fullscreen mode Exit fullscreen mode

Gerekli paketi kurun:

pip install --upgrade "openai[realtime]"
Enter fullscreen mode Exit fullscreen mode

Ardından OPENAI_API_KEY ortam değişkenini tanımlayın. Bağlantı limitleri ve yeniden bağlanma stratejileri için OpenAI WebSocket modu kılavuzuna bakın.

Standard, Hızlı ve Toplu işleme ile Ultrafast fiyatlandırma karşılaştırması

Kısa bağlamda, yani 272K giriş jetonu veya altında, gpt-6-astra için 1 milyon jeton başına fiyatlar:

Katman Giriş Önbelleğe alınmış giriş Önbellek yazma Çıkış Standard'a göre
Standart $10.00 $1.00 $12.50 $50.00 1x
Toplu veya Esnek $5.00 $0.50 $6.25 $25.00 0.5x
Hızlı $20.00 $2.00 $25.00 $100.00 2x
Ultrafast $60.00 $6.00 $75.00 $300.00 6x

272K giriş jetonunun üzerinde Ultrafast fiyatı şuna yükselir:

  • Giriş: 120$
  • Önbelleğe alınmış giriş: 12$
  • Önbellek yazma: 150$
  • Çıkış: 450$

Hızlı katmanı, 30 Temmuz 2026'da yeniden adlandırılan eski Öncelikli işlemedir.

Önemli nokta: Ultrafast'ta yalnızca çıkış tokenları değil, tüm giriş sütunları da çarpılır. Uzun istemlerde, hızlanma hedefinin dışında kalan giriş tokenları için de 6 kat ödeme yaparsınız.

Oran limitleri ve veri ikametgahı

GPT-6 Astra için varsayılan Ultrafast limitleri:

Kullanım katmanı Limit
Kademe 1–3 500.000 TPM
Kademe 4 1.000.000 TPM
Kademe 5 5.000.000 TPM

Ultrafast yalnızca ABD veri ikametgahı ve küresel işlemeyi destekler. Trafiğiniz AB veya başka bir bölgesel uç noktaya yönlendiriliyorsa, bu proje için Ultrafast kullanılamaz.

Ultrafast ne zaman kendini amorti eder?

Bu hesap, liste fiyatlarına dayalı açıklayıcı bir modeldir; benchmark değildir. Kendi ölçümlerinizi kullanın.

Başlangıç varsayımı: Standard Astra, isteminizde saniyede 40 çıktı tokenı üretiyor.

Kullanıcıya dönük yanıt örneği

İstek başına:

  • 5.000 önbelleğe alınmamış giriş tokenı
  • 2.000 çıktı tokenı

Maliyet hesabı:

  • Standard: 0,05$ giriş + 0,10$ çıkış = 0,15$
  • Ultrafast: 0,30$ giriş + 0,60$ çıkış = 0,90$
  • Ek maliyet: 0,75$

Süre hesabı:

  • Standard: 2.000 / 40 = 50 saniye
  • Tam 6x hızlanmada Ultrafast: yaklaşık 8,3 saniye
  • Kazanılan süre: yaklaşık 41,7 saniye

Sonuç:

0,75$ / 41,7 saniye = 0,018$ / kazanılan saniye
Enter fullscreen mode Exit fullscreen mode

Bu, kaldırılan bekleme süresinin saati başına yaklaşık 64,80$ maliyet demektir.

Ölçülen hızlanma Kurtarılan saniye Saniye başına ek maliyet Kurtarılan saat başına
6x 41,7 $0,018 $64,80
4x 37,5 $0,020 $72,00
2x 25,0 $0,030 $108,00

Aracı döngüsü örneği

20 adımlı bir aracı düşünün. Her adımda:

  • 20.000 giriş tokenı
    • 18.000'i önbelleğe alınmış
    • 2.000'i yeni giriş
  • 500 çıktı tokenı
  • Önbellek yazma ücretleri hesaba katılmıyor

Standard maliyeti:

0,018$ önbelleğe alınmış giriş
+ 0,020$ yeni giriş
+ 0,025$ çıkış
= 0,063$ / adım
Enter fullscreen mode Exit fullscreen mode

20 adım için Standard maliyeti: 1,26$

Ultrafast maliyeti: 7,56$

Ek maliyet: 6,30$

Süre hesabı:

  • Standard: yaklaşık 250 saniye
  • 6x hızlanmada Ultrafast: yaklaşık 41,7 saniye
  • Kazanılan süre: yaklaşık 208 saniye
6,30$ / 208 saniye ≈ 0,030$ / kazanılan saniye
Enter fullscreen mode Exit fullscreen mode

Bu, kazanılan saat başına yaklaşık 109$ anlamına gelir.

Aracı döngülerinde maliyet daha hızlı artar; çünkü faturanın büyük kısmı, hızlanmadan faydalanmayan giriş tokenlarından oluşur.

Ultrafast'ın kendini amorti etmediği durumlar

  • Kimse beklemiyorsa: Gece değerlendirmeleri, geçmiş veri doldurma ve raporlar için Toplu API veya Flex daha mantıklıdır. Bu katmanlarda giriş 5$, çıkış 25$ seviyesindedir.
  • Arka plan aracıları: Aracı gözetimsiz çalışıyorsa, birkaç dakika erken bitmesi genellikle iş sonucunu değiştirmez.
  • Kısa çıktılar: 50 tokenlık sınıflandırmalarda kesilebilecek üretim süresi düşüktür. Bağlantı kurulumu ve TTFT daha baskın olabilir.
  • Uzun istemler: Giriş ağırlıklı çağrılar, hız iddiasının kapsamadığı tokenlar için 6 kat ücret öder.
  • Bölgesel işleme: AB uç noktalarında Ultrafast kullanılamaz.
  • TTFT'ye bağlı çağrılar: GPT-6 Sol gecikme analizimiz, uzun muhakeme işlemlerinde görünür ilk token öncesinde sürenin büyük bölümünün geçtiğini gösterir. Gecikmeniz burada oluşuyorsa, Ultrafast için ödeme yapmadan önce TTFT'yi gerçekten iyileştirip iyileştirmediğini ölçün.

Geçiş yapmadan önce TTFT ve toplam süreyi Apidog'da ölçün

Yer tutucu hız değerlerini kendi verilerinizle değiştirmek için aşağıdaki adımları uygulayın.

  1. Apidog'da OPENAI_API_KEY değişkenini içeren bir ortam oluşturun.

  2. https://api.openai.com/v1/responses adresine bir POST isteği ekleyin.

Başlık:

   Authorization: Bearer {{OPENAI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Gövde:

   {
     "model": "gpt-6-astra",
     "input": "<gerçek üretim isteminiz>",
     "service_tier": "ultrafast",
     "stream": true
   }
Enter fullscreen mode Exit fullscreen mode
  1. İsteği çoğaltın. Standard temel senaryosu için ikinci istekte service_tier alanını kaldırın.

  2. Her iki isteği de çalıştırın ve şu metrikleri kaydedin:

    • İlk response.output_text.delta olayının zamanı: TTFT
    • Akışın tamamlanma zamanı: toplam süre
    • Son response.completed olayındaki usage bloğu: token ve maliyet hesabı
  3. Her varyantı en az 10 kez çalıştırın. Tekil sonuçlar yerine medyan ve p95 değerlerini karşılaştırın.

  4. Aracı döngüleri için WebSocket yolunu da test edin:

    • wss://api.openai.com/v1/responses adresine bağlanın.
    • Aynı yetkilendirme başlığını kullanın.
    • stream dışında aynı alanlarla response.create mesajı gönderin.
    • İkinci turda previous_response_id kullanın.

Açık bağlantının neden önemli olduğunu anlamak için WebSocket ile SSE karşılaştırmasını inceleyin.

Kurtarılan süreyi şu şekilde hesaplayın:

Standard medyan toplam süre - Ultrafast medyan toplam süre
Enter fullscreen mode Exit fullscreen mode

Ardından her iki varyantın usage tokenlarını kendi fiyat oranlarıyla maliyetlendirin. Ek maliyeti kazanılan saniyeye bölün ve bu değeri kullanıcı veya iş akışı bekleme maliyetiyle karşılaştırın.

Sıkça Sorulan Sorular

OpenAI Ultrafast nedir?

API'de tokenları Standard fiyatın 6 katı karşılığında 6 kata kadar daha hızlı üreten bir Responses API hizmet katmanıdır. Her istekte service_tier: "ultrafast" ile etkinleştirilir.

Ultrafast daha akıllı bir model mi?

Hayır. Aynı gpt-6-astra model kimliği kullanılır. Yalnızca hız ve fiyat katmanı değişir.

GPT-6 Astra Ultrafast ne kadara mal olur?

Kısa bağlamda 1 milyon token başına:

  • 60$ giriş
  • 6$ önbelleğe alınmış giriş
  • 75$ önbellek yazma
  • 300$ çıkış

Standard katmanda karşılık gelen fiyatlar 10$, 1$, 12,50$ ve 50$'dır.

“Saniyede 300 token” rakamı nereden geliyor?

Bu, OpenAI'ın Codex'teki Ultrafast için belirttiği ve 8 kata kadar hız iddiasıyla ilişkilendirdiği rakamdır. API için açıklanan iddia 6 kata kadardır.

GPT-6.1 Sol Ultrafast'ı destekliyor mu?

Henüz değil. OpenAI bunun yakında geleceğini belirtiyor. Güncel durumu DevDay 2026 özetinden takip edebilirsiniz.

Sonraki adım

En yavaş kullanıcıya dönük isteğinizi seçin. Standard ve Ultrafast katmanlarında en az 10'ar kez çalıştırın, medyan süreleri karşılaştırın ve ek maliyet başına kazanılan süreyi hesaplayın.

İstekleri, zamanlamaları ve usage verilerini aynı projede tutmak için Apidog'u indirin.

Top comments (0)