DEV Community

Cover image for OpenAI Ultraschnell: 6-fache Geschwindigkeit zum 6-fachen Preis. Wann es sich rentiert.
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

OpenAI Ultraschnell: 6-fache Geschwindigkeit zum 6-fachen Preis. Wann es sich rentiert.

OpenAI Ultrafast ist eine Dienstebene, kein neues Modell. Fügen Sie service_tier: "ultrafast" zu einer Responses-API-Anfrage für gpt-6-astra hinzu, und OpenAI generiert Tokens in der API bis zu 6x schneller (in Codex bis zu 8x bzw. 300 Tokens pro Sekunde). Die Ebene kostet das 6-Fache des Standardtarifs: 60 $ Eingabe und 300 $ Ausgabe pro Million Tokens gegenüber 10 $ bzw. 50 $. Die Modell-ID bleibt unverändert – Antworten werden also schneller, nicht intelligenter. Ultrafast lohnt sich vor allem, wenn Menschen oder latenzkritische Schritte auf lange Ausgaben warten.

Apidog noch heute ausprobieren

OpenAI hat Ultrafast am 29. September 2026 auf dem DevDay für GPT-6 Astra allgemein verfügbar gemacht (siehe alles Weitere vom DevDay). Dieser Beitrag zeigt, wie Sie Ultrafast aktivieren, Preise und Limits prüfen und mit eigenen Messwerten entscheiden, ob sich die Ebene rechnet. Details zum Modell finden Sie im GPT-6-Astra-API-Leitfaden. Messen Sie Standard und Ultrafast vor dem Wechsel in Apidog.

OpenAI Ultrafast auf einen Blick

Punkt Detail
Was es ist Die schnellste Dienstebene in der OpenAI API
Parameter service_tier: "ultrafast" bei Responses create oder WebSocket-response.create
Modelle GPT-6 Astra heute; GPT-6.1 Sol „kommt bald“
Geschwindigkeitsanspruch Bis zu 6x schnellere Token-Generierung in der API; bis zu 8x bzw. 300 Tokens/s in Codex
Preis für Astra 60 $ Eingabe, 6 $ Cache, 75 $ Cache-Schreibvorgang, 300 $ Ausgabe pro 1 Mio. Tokens
Ratenbegrenzungen 500K TPM (Stufen 1–3), 1M (Stufe 4), 5M (Stufe 5)
Verarbeitung Nur US-Datenresidenz und globale Verarbeitung; keine EU- oder anderen regionalen Endpunkte
Transport WebSockets werden dringend empfohlen
ChatGPT-Pläne ChatGPT Work sowie Codex auf Pro 500 und Enterprise

Quellen: OpenAIs Leitfaden zum Ultrafast-Modus und Preisübersicht.

Was Ultrafast ist und wer es nutzen kann

Ultrafast ist laut OpenAI eine Premium-Geschwindigkeitsstufe. Für GPT-6 Astra steht sie allen API-Nutzern mit niedrigen Standard-Ratenbegrenzungen zur Verfügung. Organisationen mit einem OpenAI-Konto-Team können höhere Limits anfragen.

Der Leitfaden listet außerdem Vorabzugang für GPT-5.6 Sol über Konto-Teams auf. OpenAI stellte Ultrafast erstmals am 13. August für GPT-5.6 Sol vor; die DevDay-Zusammenfassung nennt GPT-6.1 Sol als nächstes Modell. Für beide gibt es keinen veröffentlichten Ultrafast-Preis.

In ChatGPT läuft Ultrafast Astra in ChatGPT Work sowie in Codex auf Pro 500 und Enterprise. Das deckt die Anwendungen ab, nicht Ihre API-Nutzung: Skripte, CI-Jobs und eigene Agenten werden weiterhin tokenbasiert über Ihren API-Schlüssel abgerechnet.

Beachten Sie den Geschwindigkeitsanspruch genau:

  • Er betrifft die Token-Generierung.
  • Er lautet „bis zu“.
  • Die Angabe von 300 Tokens pro Sekunde gilt für Codex.
  • Für die API nennt OpenAI bis zu 6x.
  • OpenAI veröffentlicht keine TTFT-Angabe (Time to First Token) für Ultrafast.

Eine hohe Tokens-pro-Sekunde-Rate bedeutet nicht automatisch, dass das erste Token früher erscheint.

So aktivieren Sie service_tier: "ultrafast"

Setzen Sie bei jeder Anfrage model auf gpt-6-astra und service_tier auf ultrafast.

HTTP mit Responses API

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Explain why the sky is blue in one sentence.",
    "service_tier": "ultrafast"
  }'
Enter fullscreen mode Exit fullscreen mode

WebSocket für mehrstufige Agenten

OpenAI empfiehlt WebSockets besonders für Agenten mit vielen schnellen Tool-Aufrufen. Andernfalls kann der Netzwerk-Overhead pro HTTP-Anfrage den Geschwindigkeitsgewinn verringern.

Dieses Python-Beispiel hält eine Verbindung offen und streamt zwei aufeinanderfolgende Antworten:

from openai import OpenAI

client = OpenAI()
previous_response_id: str | None = None

prompts = [
    "Explain why the sky is blue in one sentence.",
    "Now explain why sunsets look red.",
]

with client.responses.connect() as connection:
    for prompt in prompts:
        connection.response.create(
            model="gpt-6-astra",
            service_tier="ultrafast",
            previous_response_id=previous_response_id,
            input=prompt,
        )

        for event in connection:
            if event.type == "response.output_text.delta":
                print(event.delta, end="", flush=True)

            elif event.type == "response.completed":
                previous_response_id = event.response.id
                print()
                break

            elif event.type in {"response.failed", "response.incomplete", "error"}:
                raise RuntimeError(event.to_json())
        else:
            raise RuntimeError("Connection closed before the response finished.")
Enter fullscreen mode Exit fullscreen mode

Installieren Sie das SDK mit:

pip install --upgrade "openai[realtime]"
Enter fullscreen mode Exit fullscreen mode

Setzen Sie anschließend OPENAI_API_KEY. Der Leitfaden zum OpenAI-WebSocket-Modus behandelt Verbindungsgrenzen und Wiederverbindungen.

Ultrafast-Preise im Vergleich zu Standard, Fast und Batch

Die folgenden Preise gelten für gpt-6-astra bei kurzem Kontext mit höchstens 272K Eingabe-Tokens und jeweils pro 1 Million Tokens:

Ebene Eingabe Gecachte Eingabe Cache-Schreibvorgang Ausgabe Gegenüber Standard
Standard $10.00 $1.00 $12.50 $50.00 1x
Batch oder Flex $5.00 $0.50 $6.25 $25.00 0.5x
Fast $20.00 $2.00 $25.00 $100.00 2x
Ultrafast $60.00 $6.00 $75.00 $300.00 6x

Oberhalb von 272K Eingabe-Tokens steigt Ultrafast auf:

  • 120 $ Eingabe
  • 12 $ Cache
  • 150 $ Cache-Schreibvorgang
  • 450 $ Ausgabe

Fast ist die ehemalige Priority-Verarbeitung, die am 30. Juli 2026 umbenannt wurde.

Wichtig: Alle Eingabekosten werden ebenfalls mit dem Ultrafast-Faktor multipliziert. Lange Prompts kosten also deutlich mehr, obwohl der Geschwindigkeitsanspruch die Ausgabe-Generierung betrifft.

Ratenbegrenzungen und Datenresidenz

Die Standard-Ultrafast-Limits für GPT-6 Astra sind:

Nutzungsstufe Limit
Stufen 1–3 500.000 Tokens pro Minute
Stufe 4 1.000.000 Tokens pro Minute
Stufe 5 5.000.000 Tokens pro Minute

Ultrafast unterstützt nur US-Datenresidenz und globale Verarbeitung. Wenn Ihr Vertrag Traffic über einen EU-Endpunkt oder einen anderen regionalen Endpunkt leitet, ist Ultrafast für dieses Projekt nicht verfügbar.

Wann sich Ultrafast rechnet: ein Break-even-Modell

Die folgende Rechnung basiert auf Listenpreisen und ist keine Benchmark. Ersetzen Sie die Beispielwerte durch eigene Messungen.

Angenommen, Standard Astra streamt für Ihren Prompt 40 Ausgabe-Tokens pro Sekunde.

Beispiel 1: Eine nutzerorientierte Antwort

Annahme:

  • 5.000 ungecachte Eingabe-Tokens
  • 2.000 Ausgabe-Tokens

Berechnung:

  • Standard: $0.05 Eingabe + $0.10 Ausgabe = $0.15
  • Ultrafast: $0.30 Eingabe + $0.60 Ausgabe = $0.90
  • Mehrkosten: $0.75
  • Standard-Generierungszeit: 2.000 / 40 = 50 Sekunden
  • Ultrafast bei vollem 6x-Faktor: etwa 8,3 Sekunden
  • Ersparnis: etwa 41,7 Sekunden
  • Kosten pro gesparter Sekunde: $0.75 / 41,7 = $0.018
  • Kosten pro gesparter Stunde: $64.80

Wenn Ihre gemessene Beschleunigung geringer ausfällt, steigen die Kosten pro gesparter Sekunde:

Gemessene Beschleunigung Gesparte Sekunden bei 50 Sekunden Standardzeit Zusätzliche Kosten pro Sekunde Pro gesparter Stunde
6x 41.7 $0.018 $64.80
4x 37.5 $0.020 $72.00
2x 25.0 $0.030 $108.00

Beispiel 2: Eine Agenten-Schleife

Annahme:

  • 20 Schritte
  • Pro Schritt: 20.000 Eingabe-Tokens
  • Davon: 18.000 gecacht, 2.000 neu
  • 500 Ausgabe-Tokens
  • Cache-Schreibgebühren werden ignoriert

Berechnung pro Schritt:

  • Standard: $0.018 gecacht + $0.020 neue Eingabe + $0.025 Ausgabe = $0.063
  • Standard pro Durchlauf: $1.26
  • Ultrafast pro Durchlauf: $7.56
  • Mehrkosten: $6.30
  • Standard-Generierungszeit: 250 Sekunden
  • Ultrafast bei 6x: etwa 41,7 Sekunden
  • Ersparnis: etwa 208 Sekunden
  • Kosten pro gesparter Sekunde: etwa $0.030
  • Kosten pro gesparter Stunde: etwa $109

Bei Agenten ist der Kurs oft schlechter, weil ein großer Teil der Rechnung aus Eingabe besteht. Diese Tokens kosten das 6-Fache, erhalten aber nicht automatisch einen entsprechenden Geschwindigkeitsgewinn.

Die praktische Frage lautet daher:

Blockiert eine Person oder ein geschäftskritischer Prozess auf diese Sekunden – und ist diese Wartezeit mehr als etwa 65 bis 110 $ pro Stunde wert?

Das kann für einen Entwickler vor einem internen Code-Agenten oder für Kunden in einem bezahlten Flow gelten. Für einen Cron-Job gilt es typischerweise nicht.

Wo sich Ultrafast nicht lohnt

  • Niemand wartet: Nächtliche Auswertungen, Nachbefüllungen und Berichte gehören in die Batch API oder auf Flex. Mit 5 $ Eingabe und 25 $ Ausgabe kostet das ein Zwölftel des Ultrafast-Tarifs.
  • Hintergrund-Agenten: Wenn ein Agent unbeaufsichtigt läuft und nur eine Abschlussmeldung liefert, verändert eine kürzere Laufzeit oft nichts.
  • Kurze Ausgaben: Bei einer 50-Token-Klassifizierung gibt es wenig Generierungszeit einzusparen. Verbindungsaufbau und TTFT dominieren, insbesondere über HTTP.
  • Lange Prompts: Eingabelastige Aufrufe zahlen das 6-Fache für Tokens, die nicht direkt vom Generierungsanspruch profitieren. Oberhalb von 272K Eingabe-Tokens steigen die Raten zusätzlich.
  • Regionale Verarbeitung: Ultrafast unterstützt keine EU-Endpunkte.
  • TTFT-gebundene Aufrufe: Die GPT-6-Sol-Latenzanalyse zeigte, dass bei langen Denkprozessen ein großer Teil der Echtzeit vor dem ersten sichtbaren Token vergeht. Messen Sie zuerst, ob Ultrafast diese Phase tatsächlich verkürzt.

TTFT und Gesamtzeit vor dem Wechsel in Apidog messen

Ersetzen Sie die Platzhalter-Annahmen in etwa zehn Minuten durch Ihre eigenen Zahlen.

  1. Erstellen Sie in Apidog eine Umgebung mit OPENAI_API_KEY.

Legen Sie eine POST-Anfrage an https://api.openai.com/v1/responses an und setzen Sie den Header:

   Authorization: Bearer {{OPENAI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie diesen Request-Body:

   {
     "model": "gpt-6-astra",
     "input": "<Ihr realer Produktions-Prompt>",
     "service_tier": "ultrafast",
     "stream": true
   }
Enter fullscreen mode Exit fullscreen mode
  1. Duplizieren Sie die Anfrage und entfernen Sie service_tier, um die Standard-Baseline zu erstellen. Lassen Sie den Prompt unverändert.

  2. Senden Sie beide Requests.

Apidog rendert den Server-Sent-Events-Stream Ereignis für Ereignis. Notieren Sie:

  • den Zeitpunkt des ersten response.output_text.delta-Ereignisses für TTFT,
  • den Zeitpunkt des Stream-Endes für die Gesamtzeit,
  • den usage-Block aus dem finalen response.completed-Ereignis für die Kostenberechnung.
  1. Wiederholen Sie jede Variante mindestens zehnmal.

Vergleichen Sie Median und p95 statt einzelner Läufe.

  1. Testen Sie für Agenten-Schleifen zusätzlich den WebSocket-Pfad:
  • Öffnen Sie in Apidog eine WebSocket-Anfrage an wss://api.openai.com/v1/responses.
  • Verwenden Sie denselben Authorization-Header.
  • Senden Sie eine response.create-Nachricht mit denselben Feldern, aber ohne stream.
  • Starten Sie anschließend einen zweiten Durchlauf mit previous_response_id.

Der Vergleich von WebSocket und SSE erklärt, warum die offene Verbindung bei mehrstufigen Abläufen relevant ist.

Berechnen Sie anschließend:

gesparte Sekunden =
Median der Gesamtzeit bei Standard
- Median der Gesamtzeit bei Ultrafast
Enter fullscreen mode Exit fullscreen mode

Bepreisen Sie die usage-Tokens für beide Tarife, teilen Sie die Mehrkosten durch die gesparten Sekunden und vergleichen Sie das Ergebnis mit den tatsächlichen Kosten Ihrer Wartezeit.

FAQ

  • Was ist OpenAI Ultrafast?

    Eine Dienstebene der Responses API, die Tokens in der API bis zu 6x schneller generiert und das 6-Fache des Standardpreises kostet. Aktivieren Sie sie pro Request mit service_tier: "ultrafast".

  • Ist Ultrafast ein intelligenteres Modell?

    Nein. Sie verwenden dieselbe Modell-ID gpt-6-astra. Die Ebene ändert Geschwindigkeit und Preis, nicht die Modellqualität.

  • Wie viel kostet GPT-6 Astra Ultrafast?

    Bei kurzem Kontext: 60 $ Eingabe, 6 $ gecachte Eingabe, 75 $ Cache-Schreibvorgang und 300 $ Ausgabe pro 1 Million Tokens. Standard kostet 10 $, 1 $, 12.50 $ bzw. 50 $.

  • Woher kommen die 300 Tokens pro Sekunde?

    Das ist OpenAIs Angabe für Ultrafast in Codex, wo bis zu 8x beansprucht werden. Für die API lautet der Anspruch bis zu 6x.

  • Unterstützt GPT-6.1 Sol Ultrafast?

    Noch nicht. OpenAI sagt, dass es kommt. Die DevDay-2026-Zusammenfassung verfolgt, was bereits live ist.

Nächster Schritt

Wählen Sie Ihre langsamste nutzerorientierte Anfrage aus. Führen Sie sie jeweils zehnmal mit Standard und Ultrafast aus, vergleichen Sie die mediane Zeitersparnis mit den Mehrkosten und entscheiden Sie anhand Ihrer eigenen Daten.

Laden Sie Apidog herunter, um beide Varianten, Zeitangaben und usage-Werte in einem Projekt zu speichern.

Top comments (0)