OpenAI Ultrafast yeni bir model değil, bir hizmet katmanıdır. gpt-6-astra için bir Responses API isteğine service_tier: "ultrafast" eklediğinizde API, jetonları 6 kata kadar daha hızlı üretir. Codex tarafında iddia 8 kata veya saniyede 300 jetona kadardır. Bunun karşılığında Standard katmanın 6 katı maliyet ödersiniz: 1 milyon jeton başına 10$ ve 50$ yerine 60$ giriş ve 300$ çıkış. Model kimliği değişmez; yanıtlar daha akıllı değil, yalnızca daha hızlı gelir.
OpenAI, Ultrafast'ı 29 Eylül 2026 DevDay etkinliğinde GPT-6 Astra için geniş kullanıma açtı. Ayrıntılar için DevDay'den diğer her şey yazısına bakın. Bu rehberde kullanılabilirlik, istek yapısı, fiyatlandırma, oran limitleri ve kendi verilerinizle uygulayabileceğiniz başabaş hesabı yer alır. Model ayrıntıları için GPT-6 Astra API kılavuzunu okuyun.
Bir bakışta OpenAI Ultrafast
| Öğe | Detay |
|---|---|
| Nedir | OpenAI API'deki en hızlı hizmet katmanı |
| Parametre | Responses create veya WebSocket response.create üzerinde service_tier: "ultrafast"
|
| Modeller | Bugün GPT-6 Astra; GPT-6.1 Sol “yakında” |
| Hız iddiası | API'de 6 kata kadar daha hızlı jeton üretimi; Codex'te 8 kata kadar, 300 jeton/sn |
| Fiyat (Astra) | 1M jeton başına 60$ giriş, 6$ önbelleğe alınmış giriş, 75$ önbellek yazma, 300$ çıkış |
| Oran limitleri | Kademe 1–3: 500K TPM; Kademe 4: 1M TPM; Kademe 5: 5M TPM |
| İşleme | Yalnızca ABD veri ikametgahı ve küresel işleme |
| Aktarım | Özellikle çok adımlı aracılar için WebSocket önerilir |
| ChatGPT planları | Pro 500 ve Enterprise'da ChatGPT Work ve Codex |
Kaynaklar: OpenAI’ın Ultrafast mod kılavuzu ve fiyatlandırma sayfası.
Ultrafast nedir ve kimler kullanabilir?
Ultrafast, GPT-6 Astra için premium hız katmanıdır. OpenAI kılavuzuna göre tüm API kullanıcıları düşük varsayılan oran limitleriyle erişebilir. OpenAI hesap ekibiyle çalışan kuruluşlar daha yüksek limit talep edebilir.
Kılavuz, GPT-5.6 Sol için hesap ekipleri üzerinden önizleme erişimi de listeler. OpenAI, Ultrafast'ı ilk olarak 13 Ağustos'ta GPT-5.6 Sol üzerinde önizledi. DevDay özeti ise GPT-6.1 Sol desteğinin sıradaki adım olduğunu belirtir. Bu modeller için henüz yayınlanmış bir Ultrafast fiyatı yoktur.
ChatGPT tarafında Ultrafast Astra, Pro 500 ve Enterprise planlarındaki ChatGPT Work ile Codex'te kullanılabilir. Bu planlar API kullanımını kapsamaz: komut dosyaları, CI işleri ve aracılar API anahtarıyla token bazlı ücretlendirilir.
Hız iddiasını doğru yorumlayın:
- API için iddia, jeton üretiminde 6 kata kadar hızlanmadır.
- Codex için iddia, 8 kata kadar veya 300 jeton/sn seviyesidir.
- OpenAI, Ultrafast için ilk jetona kadar geçen süreyi (TTFT) yayınlamaz.
- Yüksek token/sn değeri, ilk tokenın ne kadar hızlı geldiğini tek başına göstermez.
service_tier: "ultrafast" nasıl etkinleştirilir?
Her istekte modeli gpt-6-astra, hizmet katmanını ise ultrafast olarak ayarlayın.
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Explain why the sky is blue in one sentence.",
"service_tier": "ultrafast"
}'
Çok adımlı araç çağrıları yapan aracılar için OpenAI, WebSocket kullanımını özellikle önerir. Tek bağlantı üzerinde iki tur çalıştıran Python örneği:
from openai import OpenAI
client = OpenAI()
previous_response_id: str | None = None
prompts = [
"Explain why the sky is blue in one sentence.",
"Now explain why sunsets look red.",
]
with client.responses.connect() as connection:
for prompt in prompts:
connection.response.create(
model="gpt-6-astra",
service_tier="ultrafast",
previous_response_id=previous_response_id,
input=prompt,
)
for event in connection:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
elif event.type == "response.completed":
previous_response_id = event.response.id
print()
break
elif event.type in {"response.failed", "response.incomplete", "error"}:
raise RuntimeError(event.to_json())
else:
raise RuntimeError("Connection closed before the response finished.")
Gerekli paketi kurun:
pip install --upgrade "openai[realtime]"
Ardından OPENAI_API_KEY ortam değişkenini tanımlayın. Bağlantı limitleri ve yeniden bağlanma stratejileri için OpenAI WebSocket modu kılavuzuna bakın.
Standard, Hızlı ve Toplu işleme ile Ultrafast fiyatlandırma karşılaştırması
Kısa bağlamda, yani 272K giriş jetonu veya altında, gpt-6-astra için 1 milyon jeton başına fiyatlar:
| Katman | Giriş | Önbelleğe alınmış giriş | Önbellek yazma | Çıkış | Standard'a göre |
|---|---|---|---|---|---|
| Standart | $10.00 | $1.00 | $12.50 | $50.00 | 1x |
| Toplu veya Esnek | $5.00 | $0.50 | $6.25 | $25.00 | 0.5x |
| Hızlı | $20.00 | $2.00 | $25.00 | $100.00 | 2x |
| Ultrafast | $60.00 | $6.00 | $75.00 | $300.00 | 6x |
272K giriş jetonunun üzerinde Ultrafast fiyatı şuna yükselir:
- Giriş: 120$
- Önbelleğe alınmış giriş: 12$
- Önbellek yazma: 150$
- Çıkış: 450$
Hızlı katmanı, 30 Temmuz 2026'da yeniden adlandırılan eski Öncelikli işlemedir.
Önemli nokta: Ultrafast'ta yalnızca çıkış tokenları değil, tüm giriş sütunları da çarpılır. Uzun istemlerde, hızlanma hedefinin dışında kalan giriş tokenları için de 6 kat ödeme yaparsınız.
Oran limitleri ve veri ikametgahı
GPT-6 Astra için varsayılan Ultrafast limitleri:
| Kullanım katmanı | Limit |
|---|---|
| Kademe 1–3 | 500.000 TPM |
| Kademe 4 | 1.000.000 TPM |
| Kademe 5 | 5.000.000 TPM |
Ultrafast yalnızca ABD veri ikametgahı ve küresel işlemeyi destekler. Trafiğiniz AB veya başka bir bölgesel uç noktaya yönlendiriliyorsa, bu proje için Ultrafast kullanılamaz.
Ultrafast ne zaman kendini amorti eder?
Bu hesap, liste fiyatlarına dayalı açıklayıcı bir modeldir; benchmark değildir. Kendi ölçümlerinizi kullanın.
Başlangıç varsayımı: Standard Astra, isteminizde saniyede 40 çıktı tokenı üretiyor.
Kullanıcıya dönük yanıt örneği
İstek başına:
- 5.000 önbelleğe alınmamış giriş tokenı
- 2.000 çıktı tokenı
Maliyet hesabı:
- Standard:
0,05$ giriş + 0,10$ çıkış = 0,15$ - Ultrafast:
0,30$ giriş + 0,60$ çıkış = 0,90$ - Ek maliyet:
0,75$
Süre hesabı:
- Standard:
2.000 / 40 = 50 saniye - Tam 6x hızlanmada Ultrafast: yaklaşık
8,3 saniye - Kazanılan süre: yaklaşık
41,7 saniye
Sonuç:
0,75$ / 41,7 saniye = 0,018$ / kazanılan saniye
Bu, kaldırılan bekleme süresinin saati başına yaklaşık 64,80$ maliyet demektir.
| Ölçülen hızlanma | Kurtarılan saniye | Saniye başına ek maliyet | Kurtarılan saat başına |
|---|---|---|---|
| 6x | 41,7 | $0,018 | $64,80 |
| 4x | 37,5 | $0,020 | $72,00 |
| 2x | 25,0 | $0,030 | $108,00 |
Aracı döngüsü örneği
20 adımlı bir aracı düşünün. Her adımda:
- 20.000 giriş tokenı
- 18.000'i önbelleğe alınmış
- 2.000'i yeni giriş
- 500 çıktı tokenı
- Önbellek yazma ücretleri hesaba katılmıyor
Standard maliyeti:
0,018$ önbelleğe alınmış giriş
+ 0,020$ yeni giriş
+ 0,025$ çıkış
= 0,063$ / adım
20 adım için Standard maliyeti: 1,26$
Ultrafast maliyeti: 7,56$
Ek maliyet: 6,30$
Süre hesabı:
- Standard: yaklaşık 250 saniye
- 6x hızlanmada Ultrafast: yaklaşık 41,7 saniye
- Kazanılan süre: yaklaşık 208 saniye
6,30$ / 208 saniye ≈ 0,030$ / kazanılan saniye
Bu, kazanılan saat başına yaklaşık 109$ anlamına gelir.
Aracı döngülerinde maliyet daha hızlı artar; çünkü faturanın büyük kısmı, hızlanmadan faydalanmayan giriş tokenlarından oluşur.
Ultrafast'ın kendini amorti etmediği durumlar
- Kimse beklemiyorsa: Gece değerlendirmeleri, geçmiş veri doldurma ve raporlar için Toplu API veya Flex daha mantıklıdır. Bu katmanlarda giriş 5$, çıkış 25$ seviyesindedir.
- Arka plan aracıları: Aracı gözetimsiz çalışıyorsa, birkaç dakika erken bitmesi genellikle iş sonucunu değiştirmez.
- Kısa çıktılar: 50 tokenlık sınıflandırmalarda kesilebilecek üretim süresi düşüktür. Bağlantı kurulumu ve TTFT daha baskın olabilir.
- Uzun istemler: Giriş ağırlıklı çağrılar, hız iddiasının kapsamadığı tokenlar için 6 kat ücret öder.
- Bölgesel işleme: AB uç noktalarında Ultrafast kullanılamaz.
- TTFT'ye bağlı çağrılar: GPT-6 Sol gecikme analizimiz, uzun muhakeme işlemlerinde görünür ilk token öncesinde sürenin büyük bölümünün geçtiğini gösterir. Gecikmeniz burada oluşuyorsa, Ultrafast için ödeme yapmadan önce TTFT'yi gerçekten iyileştirip iyileştirmediğini ölçün.
Geçiş yapmadan önce TTFT ve toplam süreyi Apidog'da ölçün
Yer tutucu hız değerlerini kendi verilerinizle değiştirmek için aşağıdaki adımları uygulayın.
Apidog'da
OPENAI_API_KEYdeğişkenini içeren bir ortam oluşturun.https://api.openai.com/v1/responsesadresine birPOSTisteği ekleyin.
Başlık:
Authorization: Bearer {{OPENAI_API_KEY}}
Gövde:
{
"model": "gpt-6-astra",
"input": "<gerçek üretim isteminiz>",
"service_tier": "ultrafast",
"stream": true
}
İsteği çoğaltın. Standard temel senaryosu için ikinci istekte
service_tieralanını kaldırın.-
Her iki isteği de çalıştırın ve şu metrikleri kaydedin:
- İlk
response.output_text.deltaolayının zamanı: TTFT - Akışın tamamlanma zamanı: toplam süre
- Son
response.completedolayındakiusagebloğu: token ve maliyet hesabı
- İlk
Her varyantı en az 10 kez çalıştırın. Tekil sonuçlar yerine medyan ve p95 değerlerini karşılaştırın.
-
Aracı döngüleri için WebSocket yolunu da test edin:
-
wss://api.openai.com/v1/responsesadresine bağlanın. - Aynı yetkilendirme başlığını kullanın.
-
streamdışında aynı alanlarlaresponse.createmesajı gönderin. - İkinci turda
previous_response_idkullanın.
-
Açık bağlantının neden önemli olduğunu anlamak için WebSocket ile SSE karşılaştırmasını inceleyin.
Kurtarılan süreyi şu şekilde hesaplayın:
Standard medyan toplam süre - Ultrafast medyan toplam süre
Ardından her iki varyantın usage tokenlarını kendi fiyat oranlarıyla maliyetlendirin. Ek maliyeti kazanılan saniyeye bölün ve bu değeri kullanıcı veya iş akışı bekleme maliyetiyle karşılaştırın.
Sıkça Sorulan Sorular
OpenAI Ultrafast nedir?
API'de tokenları Standard fiyatın 6 katı karşılığında 6 kata kadar daha hızlı üreten bir Responses API hizmet katmanıdır. Her istekte service_tier: "ultrafast" ile etkinleştirilir.
Ultrafast daha akıllı bir model mi?
Hayır. Aynı gpt-6-astra model kimliği kullanılır. Yalnızca hız ve fiyat katmanı değişir.
GPT-6 Astra Ultrafast ne kadara mal olur?
Kısa bağlamda 1 milyon token başına:
- 60$ giriş
- 6$ önbelleğe alınmış giriş
- 75$ önbellek yazma
- 300$ çıkış
Standard katmanda karşılık gelen fiyatlar 10$, 1$, 12,50$ ve 50$'dır.
“Saniyede 300 token” rakamı nereden geliyor?
Bu, OpenAI'ın Codex'teki Ultrafast için belirttiği ve 8 kata kadar hız iddiasıyla ilişkilendirdiği rakamdır. API için açıklanan iddia 6 kata kadardır.
GPT-6.1 Sol Ultrafast'ı destekliyor mu?
Henüz değil. OpenAI bunun yakında geleceğini belirtiyor. Güncel durumu DevDay 2026 özetinden takip edebilirsiniz.
Sonraki adım
En yavaş kullanıcıya dönük isteğinizi seçin. Standard ve Ultrafast katmanlarında en az 10'ar kez çalıştırın, medyan süreleri karşılaştırın ve ek maliyet başına kazanılan süreyi hesaplayın.
İstekleri, zamanlamaları ve usage verilerini aynı projede tutmak için Apidog'u indirin.
Top comments (0)