OpenAI Ultrafast ist eine Dienstebene, kein neues Modell. Fügen Sie service_tier: "ultrafast" zu einer Responses-API-Anfrage für gpt-6-astra hinzu, und OpenAI generiert Tokens in der API bis zu 6x schneller (in Codex bis zu 8x bzw. 300 Tokens pro Sekunde). Die Ebene kostet das 6-Fache des Standardtarifs: 60 $ Eingabe und 300 $ Ausgabe pro Million Tokens gegenüber 10 $ bzw. 50 $. Die Modell-ID bleibt unverändert – Antworten werden also schneller, nicht intelligenter. Ultrafast lohnt sich vor allem, wenn Menschen oder latenzkritische Schritte auf lange Ausgaben warten.
Apidog noch heute ausprobieren
OpenAI hat Ultrafast am 29. September 2026 auf dem DevDay für GPT-6 Astra allgemein verfügbar gemacht (siehe alles Weitere vom DevDay). Dieser Beitrag zeigt, wie Sie Ultrafast aktivieren, Preise und Limits prüfen und mit eigenen Messwerten entscheiden, ob sich die Ebene rechnet. Details zum Modell finden Sie im GPT-6-Astra-API-Leitfaden. Messen Sie Standard und Ultrafast vor dem Wechsel in Apidog.
OpenAI Ultrafast auf einen Blick
| Punkt | Detail |
|---|---|
| Was es ist | Die schnellste Dienstebene in der OpenAI API |
| Parameter |
service_tier: "ultrafast" bei Responses create oder WebSocket-response.create
|
| Modelle | GPT-6 Astra heute; GPT-6.1 Sol „kommt bald“ |
| Geschwindigkeitsanspruch | Bis zu 6x schnellere Token-Generierung in der API; bis zu 8x bzw. 300 Tokens/s in Codex |
| Preis für Astra | 60 $ Eingabe, 6 $ Cache, 75 $ Cache-Schreibvorgang, 300 $ Ausgabe pro 1 Mio. Tokens |
| Ratenbegrenzungen | 500K TPM (Stufen 1–3), 1M (Stufe 4), 5M (Stufe 5) |
| Verarbeitung | Nur US-Datenresidenz und globale Verarbeitung; keine EU- oder anderen regionalen Endpunkte |
| Transport | WebSockets werden dringend empfohlen |
| ChatGPT-Pläne | ChatGPT Work sowie Codex auf Pro 500 und Enterprise |
Quellen: OpenAIs Leitfaden zum Ultrafast-Modus und Preisübersicht.
Was Ultrafast ist und wer es nutzen kann
Ultrafast ist laut OpenAI eine Premium-Geschwindigkeitsstufe. Für GPT-6 Astra steht sie allen API-Nutzern mit niedrigen Standard-Ratenbegrenzungen zur Verfügung. Organisationen mit einem OpenAI-Konto-Team können höhere Limits anfragen.
Der Leitfaden listet außerdem Vorabzugang für GPT-5.6 Sol über Konto-Teams auf. OpenAI stellte Ultrafast erstmals am 13. August für GPT-5.6 Sol vor; die DevDay-Zusammenfassung nennt GPT-6.1 Sol als nächstes Modell. Für beide gibt es keinen veröffentlichten Ultrafast-Preis.
In ChatGPT läuft Ultrafast Astra in ChatGPT Work sowie in Codex auf Pro 500 und Enterprise. Das deckt die Anwendungen ab, nicht Ihre API-Nutzung: Skripte, CI-Jobs und eigene Agenten werden weiterhin tokenbasiert über Ihren API-Schlüssel abgerechnet.
Beachten Sie den Geschwindigkeitsanspruch genau:
- Er betrifft die Token-Generierung.
- Er lautet „bis zu“.
- Die Angabe von 300 Tokens pro Sekunde gilt für Codex.
- Für die API nennt OpenAI bis zu 6x.
- OpenAI veröffentlicht keine TTFT-Angabe (Time to First Token) für Ultrafast.
Eine hohe Tokens-pro-Sekunde-Rate bedeutet nicht automatisch, dass das erste Token früher erscheint.
So aktivieren Sie service_tier: "ultrafast"
Setzen Sie bei jeder Anfrage model auf gpt-6-astra und service_tier auf ultrafast.
HTTP mit Responses API
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Explain why the sky is blue in one sentence.",
"service_tier": "ultrafast"
}'
WebSocket für mehrstufige Agenten
OpenAI empfiehlt WebSockets besonders für Agenten mit vielen schnellen Tool-Aufrufen. Andernfalls kann der Netzwerk-Overhead pro HTTP-Anfrage den Geschwindigkeitsgewinn verringern.
Dieses Python-Beispiel hält eine Verbindung offen und streamt zwei aufeinanderfolgende Antworten:
from openai import OpenAI
client = OpenAI()
previous_response_id: str | None = None
prompts = [
"Explain why the sky is blue in one sentence.",
"Now explain why sunsets look red.",
]
with client.responses.connect() as connection:
for prompt in prompts:
connection.response.create(
model="gpt-6-astra",
service_tier="ultrafast",
previous_response_id=previous_response_id,
input=prompt,
)
for event in connection:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
elif event.type == "response.completed":
previous_response_id = event.response.id
print()
break
elif event.type in {"response.failed", "response.incomplete", "error"}:
raise RuntimeError(event.to_json())
else:
raise RuntimeError("Connection closed before the response finished.")
Installieren Sie das SDK mit:
pip install --upgrade "openai[realtime]"
Setzen Sie anschließend OPENAI_API_KEY. Der Leitfaden zum OpenAI-WebSocket-Modus behandelt Verbindungsgrenzen und Wiederverbindungen.
Ultrafast-Preise im Vergleich zu Standard, Fast und Batch
Die folgenden Preise gelten für gpt-6-astra bei kurzem Kontext mit höchstens 272K Eingabe-Tokens und jeweils pro 1 Million Tokens:
| Ebene | Eingabe | Gecachte Eingabe | Cache-Schreibvorgang | Ausgabe | Gegenüber Standard |
|---|---|---|---|---|---|
| Standard | $10.00 | $1.00 | $12.50 | $50.00 | 1x |
| Batch oder Flex | $5.00 | $0.50 | $6.25 | $25.00 | 0.5x |
| Fast | $20.00 | $2.00 | $25.00 | $100.00 | 2x |
| Ultrafast | $60.00 | $6.00 | $75.00 | $300.00 | 6x |
Oberhalb von 272K Eingabe-Tokens steigt Ultrafast auf:
- 120 $ Eingabe
- 12 $ Cache
- 150 $ Cache-Schreibvorgang
- 450 $ Ausgabe
Fast ist die ehemalige Priority-Verarbeitung, die am 30. Juli 2026 umbenannt wurde.
Wichtig: Alle Eingabekosten werden ebenfalls mit dem Ultrafast-Faktor multipliziert. Lange Prompts kosten also deutlich mehr, obwohl der Geschwindigkeitsanspruch die Ausgabe-Generierung betrifft.
Ratenbegrenzungen und Datenresidenz
Die Standard-Ultrafast-Limits für GPT-6 Astra sind:
| Nutzungsstufe | Limit |
|---|---|
| Stufen 1–3 | 500.000 Tokens pro Minute |
| Stufe 4 | 1.000.000 Tokens pro Minute |
| Stufe 5 | 5.000.000 Tokens pro Minute |
Ultrafast unterstützt nur US-Datenresidenz und globale Verarbeitung. Wenn Ihr Vertrag Traffic über einen EU-Endpunkt oder einen anderen regionalen Endpunkt leitet, ist Ultrafast für dieses Projekt nicht verfügbar.
Wann sich Ultrafast rechnet: ein Break-even-Modell
Die folgende Rechnung basiert auf Listenpreisen und ist keine Benchmark. Ersetzen Sie die Beispielwerte durch eigene Messungen.
Angenommen, Standard Astra streamt für Ihren Prompt 40 Ausgabe-Tokens pro Sekunde.
Beispiel 1: Eine nutzerorientierte Antwort
Annahme:
- 5.000 ungecachte Eingabe-Tokens
- 2.000 Ausgabe-Tokens
Berechnung:
- Standard: $0.05 Eingabe + $0.10 Ausgabe = $0.15
- Ultrafast: $0.30 Eingabe + $0.60 Ausgabe = $0.90
- Mehrkosten: $0.75
-
Standard-Generierungszeit:
2.000 / 40 = 50 Sekunden -
Ultrafast bei vollem 6x-Faktor: etwa
8,3 Sekunden -
Ersparnis: etwa
41,7 Sekunden -
Kosten pro gesparter Sekunde:
$0.75 / 41,7 = $0.018 - Kosten pro gesparter Stunde: $64.80
Wenn Ihre gemessene Beschleunigung geringer ausfällt, steigen die Kosten pro gesparter Sekunde:
| Gemessene Beschleunigung | Gesparte Sekunden bei 50 Sekunden Standardzeit | Zusätzliche Kosten pro Sekunde | Pro gesparter Stunde |
|---|---|---|---|
| 6x | 41.7 | $0.018 | $64.80 |
| 4x | 37.5 | $0.020 | $72.00 |
| 2x | 25.0 | $0.030 | $108.00 |
Beispiel 2: Eine Agenten-Schleife
Annahme:
- 20 Schritte
- Pro Schritt: 20.000 Eingabe-Tokens
- Davon: 18.000 gecacht, 2.000 neu
- 500 Ausgabe-Tokens
- Cache-Schreibgebühren werden ignoriert
Berechnung pro Schritt:
- Standard: $0.018 gecacht + $0.020 neue Eingabe + $0.025 Ausgabe = $0.063
- Standard pro Durchlauf: $1.26
- Ultrafast pro Durchlauf: $7.56
- Mehrkosten: $6.30
- Standard-Generierungszeit: 250 Sekunden
- Ultrafast bei 6x: etwa 41,7 Sekunden
- Ersparnis: etwa 208 Sekunden
- Kosten pro gesparter Sekunde: etwa $0.030
- Kosten pro gesparter Stunde: etwa $109
Bei Agenten ist der Kurs oft schlechter, weil ein großer Teil der Rechnung aus Eingabe besteht. Diese Tokens kosten das 6-Fache, erhalten aber nicht automatisch einen entsprechenden Geschwindigkeitsgewinn.
Die praktische Frage lautet daher:
Blockiert eine Person oder ein geschäftskritischer Prozess auf diese Sekunden – und ist diese Wartezeit mehr als etwa 65 bis 110 $ pro Stunde wert?
Das kann für einen Entwickler vor einem internen Code-Agenten oder für Kunden in einem bezahlten Flow gelten. Für einen Cron-Job gilt es typischerweise nicht.
Wo sich Ultrafast nicht lohnt
- Niemand wartet: Nächtliche Auswertungen, Nachbefüllungen und Berichte gehören in die Batch API oder auf Flex. Mit 5 $ Eingabe und 25 $ Ausgabe kostet das ein Zwölftel des Ultrafast-Tarifs.
- Hintergrund-Agenten: Wenn ein Agent unbeaufsichtigt läuft und nur eine Abschlussmeldung liefert, verändert eine kürzere Laufzeit oft nichts.
- Kurze Ausgaben: Bei einer 50-Token-Klassifizierung gibt es wenig Generierungszeit einzusparen. Verbindungsaufbau und TTFT dominieren, insbesondere über HTTP.
- Lange Prompts: Eingabelastige Aufrufe zahlen das 6-Fache für Tokens, die nicht direkt vom Generierungsanspruch profitieren. Oberhalb von 272K Eingabe-Tokens steigen die Raten zusätzlich.
- Regionale Verarbeitung: Ultrafast unterstützt keine EU-Endpunkte.
- TTFT-gebundene Aufrufe: Die GPT-6-Sol-Latenzanalyse zeigte, dass bei langen Denkprozessen ein großer Teil der Echtzeit vor dem ersten sichtbaren Token vergeht. Messen Sie zuerst, ob Ultrafast diese Phase tatsächlich verkürzt.
TTFT und Gesamtzeit vor dem Wechsel in Apidog messen
Ersetzen Sie die Platzhalter-Annahmen in etwa zehn Minuten durch Ihre eigenen Zahlen.
- Erstellen Sie in Apidog eine Umgebung mit
OPENAI_API_KEY.
Legen Sie eine POST-Anfrage an https://api.openai.com/v1/responses an und setzen Sie den Header:
Authorization: Bearer {{OPENAI_API_KEY}}
Verwenden Sie diesen Request-Body:
{
"model": "gpt-6-astra",
"input": "<Ihr realer Produktions-Prompt>",
"service_tier": "ultrafast",
"stream": true
}
Duplizieren Sie die Anfrage und entfernen Sie
service_tier, um die Standard-Baseline zu erstellen. Lassen Sie den Prompt unverändert.Senden Sie beide Requests.
Apidog rendert den Server-Sent-Events-Stream Ereignis für Ereignis. Notieren Sie:
- den Zeitpunkt des ersten
response.output_text.delta-Ereignisses für TTFT, - den Zeitpunkt des Stream-Endes für die Gesamtzeit,
- den
usage-Block aus dem finalenresponse.completed-Ereignis für die Kostenberechnung.
- Wiederholen Sie jede Variante mindestens zehnmal.
Vergleichen Sie Median und p95 statt einzelner Läufe.
- Testen Sie für Agenten-Schleifen zusätzlich den WebSocket-Pfad:
- Öffnen Sie in Apidog eine WebSocket-Anfrage an
wss://api.openai.com/v1/responses. - Verwenden Sie denselben Authorization-Header.
- Senden Sie eine
response.create-Nachricht mit denselben Feldern, aber ohnestream. - Starten Sie anschließend einen zweiten Durchlauf mit
previous_response_id.
Der Vergleich von WebSocket und SSE erklärt, warum die offene Verbindung bei mehrstufigen Abläufen relevant ist.
Berechnen Sie anschließend:
gesparte Sekunden =
Median der Gesamtzeit bei Standard
- Median der Gesamtzeit bei Ultrafast
Bepreisen Sie die usage-Tokens für beide Tarife, teilen Sie die Mehrkosten durch die gesparten Sekunden und vergleichen Sie das Ergebnis mit den tatsächlichen Kosten Ihrer Wartezeit.
FAQ
Was ist OpenAI Ultrafast?
Eine Dienstebene der Responses API, die Tokens in der API bis zu 6x schneller generiert und das 6-Fache des Standardpreises kostet. Aktivieren Sie sie pro Request mitservice_tier: "ultrafast".Ist Ultrafast ein intelligenteres Modell?
Nein. Sie verwenden dieselbe Modell-IDgpt-6-astra. Die Ebene ändert Geschwindigkeit und Preis, nicht die Modellqualität.Wie viel kostet GPT-6 Astra Ultrafast?
Bei kurzem Kontext: 60 $ Eingabe, 6 $ gecachte Eingabe, 75 $ Cache-Schreibvorgang und 300 $ Ausgabe pro 1 Million Tokens. Standard kostet 10 $, 1 $, 12.50 $ bzw. 50 $.Woher kommen die 300 Tokens pro Sekunde?
Das ist OpenAIs Angabe für Ultrafast in Codex, wo bis zu 8x beansprucht werden. Für die API lautet der Anspruch bis zu 6x.Unterstützt GPT-6.1 Sol Ultrafast?
Noch nicht. OpenAI sagt, dass es kommt. Die DevDay-2026-Zusammenfassung verfolgt, was bereits live ist.
Nächster Schritt
Wählen Sie Ihre langsamste nutzerorientierte Anfrage aus. Führen Sie sie jeweils zehnmal mit Standard und Ultrafast aus, vergleichen Sie die mediane Zeitersparnis mit den Mehrkosten und entscheiden Sie anhand Ihrer eigenen Daten.
Laden Sie Apidog herunter, um beide Varianten, Zeitangaben und usage-Werte in einem Projekt zu speichern.
Top comments (0)