DEV Community

Cover image for OpenAI senkt GPT-5.6 API Preise drastisch: Luna 80%, Terra 20% günstiger (Neue Preisübersicht)
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

OpenAI senkt GPT-5.6 API Preise drastisch: Luna 80%, Terra 20% günstiger (Neue Preisübersicht)

OpenAI senkte am 30. Juli 2026 die API-Preise für zwei seiner drei GPT-5.6-Modelle. GPT-5.6 Luna kostet jetzt 80 % weniger: 0,20 $ pro Million Eingabe-Tokens und 1,20 $ pro Million Ausgabe-Tokens. GPT-5.6 Terra sank um 20 % auf 2 $ für Eingabe und 12 $ für Ausgabe. GPT-5.6 Sol, das Flaggschiff-Argumentationsmodell, behält seine Preise von 5 $ und 30 $ bei, erhält aber einen neuen Fast-Modus, der 2,5x schneller läuft – zum doppelten Standardpreis.

Testen Sie Apidog noch heute

Wenn Sie Ihr Kostenmodell auf Grundlage der GPT-5.6-Preise vom Starttag erstellt haben, müssen Sie es aktualisieren. Dieser Beitrag zeigt die neue Preisliste, den Vergleich mit Googles Gemini-Flash-Tier und einen konkreten Workflow für Ihr API-Routing. Testen Sie dafür dieselbe Anfrage gegen Sol, Terra und Luna, messen Sie Token-Verbrauch und Qualität und legen Sie erst dann Routing-Regeln fest. Tools wie Apidog helfen dabei, identische Prompts parallel gegen mehrere Modelle auszuführen.

Die neue GPT-5.6-Preisliste

Alle Preise gelten pro Million Tokens:

Modell Alter Input Neuer Input Alter Output Neuer Output Änderung
GPT-5.6 Sol $5,00 $5,00 $30,00 $30,00 Keine Änderung
GPT-5.6 Terra $2,50 $2,00 $15,00 $12,00 -20 %
GPT-5.6 Luna $1,00 $0,20 $6,00 $1,20 -80 %

Die neuen Preise traten am 30. Juli 2026 für die Standard-API-Stufe in Kraft. Der Preisabstand innerhalb der Modellfamilie ist damit deutlich größer geworden: Zwischen Sol und Luna liegt nun ein Faktor von 25x, verglichen mit 5x bei der allgemeinen Verfügbarkeit am 9. Juli.

Das verändert die Routing-Entscheidung unmittelbar:

  • Luna statt Sol bedeutete zuvor rund 80 % niedrigere Kosten.
  • Luna statt Sol spart nach der Anpassung rund 96 %.
  • Terra bleibt ein Mittelweg für Workloads, die mehr Qualität benötigen als Luna liefert, aber keine Sol-Kosten rechtfertigen.

Prompt-Caching-Rabatte gelten weiterhin zusätzlich. Für die neuen Luna- und Terra-Raten veröffentlichte OpenAI in der Ankündigung keine separaten Preise für gecachte Eingaben. Prüfen Sie deshalb die offizielle Preisseite, bevor Sie Prognosen aktualisieren, die Cache-Lesevorgänge enthalten.

Was sich bei Sol ändert

Der Standardpreis von Sol bleibt unverändert. Neu ist der Fast-Modus:

  • 2,5x schnellere Token-Generierung
  • doppelter Standardpreis
  • ersetzt die bisherige Priority-Processing-Stufe

Wenn Ihre Produktion aktuell Priority Processing verwendet, prüfen Sie Ihre Konfiguration und Abrechnung. Migrieren Sie auf den Fast-Modus und validieren Sie insbesondere Latenz, Modell-ID, Routing-Regeln und die neue Rechnungsposition.

Praktisch segmentiert OpenAI Sol damit über Latenz statt über einen Preisnachlass:

  • Nutzen Sie Sol Standard für hochwertige Argumentation ohne harte Latenzanforderungen.
  • Nutzen Sie Sol Fast nur für interaktive oder zeitkritische Workloads.
  • Leiten Sie Standardaufgaben auf Terra oder Luna um, wenn Ihre Evaluation keine Qualitätsverluste zeigt.

Warum OpenAI die Preise gesenkt hat

OpenAI beschreibt die Kürzungen als Ergebnis von Effizienzgewinnen in der Inferenz. Genannt werden:

  • verbessertes Hardware-Routing über die Inferenz-Flotte,
  • bessere Inferenz-Software für die Produktion,
  • intelligentere Kontext-Caching-Algorithmen,
  • Produktionskernels, die von GPT-5.6 Sol neu geschrieben wurden.

Laut Ankündigung reduzierten diese von Sol überarbeiteten Serving-Kernels den End-to-End-Serving-Overhead um 20 % und verbesserten die Effizienz der Token-Generierung um mehr als 15 %.

Neben den Effizienzgewinnen gibt es einen klaren Wettbewerbsdruck. VentureBeat bewertet die Kürzung als Reaktion auf Googles Flash-Tier. Der kombinierte Listenpreis von Luna liegt jetzt bei 1,40 $ pro Million Tokens und damit unter:

Listenpreise allein reichen aber nicht für eine Migration. Vergleichen Sie Kosten und Qualität mit Ihren eigenen Prompts, Daten und Akzeptanzkriterien.

Was die Preissenkung für Ihre Workloads bedeutet

Die 80%ige Senkung bei Luna verändert Architekturentscheidungen stärker als die 20%ige Terra-Kürzung.

Agenten-Loops werden günstiger

Agentische Workloads erzeugen oft lange Token-Ketten:

  1. Aufgabe planen
  2. Tool aufrufen
  3. Tool-Ergebnis auswerten
  4. nächsten Schritt planen
  5. bei Fehlern erneut versuchen

Bei 0,20 $ für Input und 1,20 $ für Output wird Luna für solche Loops deutlich attraktiver. Starten Sie dennoch nicht mit einer pauschalen Umstellung: Begrenzen Sie Iterationen, erfassen Sie Token-Verbrauch pro Schritt und definieren Sie Abbruchbedingungen.

Klassifizierung, Extraktion und Zusammenfassung gehören erneut in die Evaluation

Wenn Sie diese Workloads bisher auf Terra ausführen, weil Luna zu wenig Qualitätsreserve hatte, bewerten Sie sie erneut. Die Modellqualität hat sich nicht geändert, aber die Kostenbasis schon.

Ein Workload, der auf Terra 100 $ pro Tag kostet, würde bei vergleichbarem Token-Verbrauch auf Luna mit den neuen Preisen ungefähr 11 $ kosten. Prüfen Sie dabei insbesondere:

  • Feldgenauigkeit bei Extraktionen
  • Fehlerraten bei Klassifikationen
  • Halluzinationen in Zusammenfassungen
  • Antwortformat und JSON-Validität
  • benötigte Retry-Rate

Terra bleibt ein sinnvoller Standard

Unser Vergleich von Sol, Terra und Luna empfiehlt Terra als Standardmodell für viele tägliche Aufgaben. Diese Empfehlung bleibt bestehen – nur 20 % günstiger.

Der Argumentationsaufwand bleibt ein zentraler Kostenhebel

GPT-5.6 bietet sechs Stufen des Argumentationsaufwands. Höherer Aufwand erzeugt typischerweise mehr Output-Tokens, also den teureren Teil der Abrechnung.

Eine Preissenkung behebt keine überdimensionierte Aufwandseinstellung. Testen Sie daher Modell und Aufwand getrennt:

Modell: gpt-5.6-luna
Aufwand: niedrig, mittel, hoch

Modell: gpt-5.6-terra
Aufwand: niedrig, mittel, hoch
Enter fullscreen mode Exit fullscreen mode

Vergleichen Sie anschließend Qualität, Latenz und Token-Verbrauch pro Kombination.

So überprüfen Sie Ihre eigenen Zahlen

Verlassen Sie sich nicht nur auf Prozentwerte oder Listenpreise. Messen Sie repräsentativen Produktionsverkehr.

1. Repräsentative Prompts auswählen

Erstellen Sie eine Teststichprobe aus echten Anwendungsfällen:

  • kurze und lange Eingaben,
  • einfache und komplexe Aufgaben,
  • typische Tool-Aufrufe,
  • Edge Cases,
  • Prompts mit strukturierten Ausgaben.

Entfernen oder anonymisieren Sie sensible Produktionsdaten, bevor Sie sie in Evaluierungen verwenden.

2. Dieselbe Anfrage gegen alle drei Modelle ausführen

Senden Sie identische Requests an:

gpt-5.6-luna
gpt-5.6-terra
gpt-5.6-sol
Enter fullscreen mode Exit fullscreen mode

Speichern Sie pro Durchlauf mindestens:

{
  "model": "gpt-5.6-luna",
  "input_tokens": 0,
  "output_tokens": 0,
  "latency_ms": 0,
  "quality_score": 0,
  "valid_output": true
}
Enter fullscreen mode Exit fullscreen mode

3. Kosten pro Request berechnen

Berechnen Sie Input- und Output-Kosten getrennt:

Kosten =
  (Input-Tokens / 1_000_000 × Input-Preis)
  +
  (Output-Tokens / 1_000_000 × Output-Preis)
Enter fullscreen mode Exit fullscreen mode

Für Luna:

Kosten =
  (Input-Tokens / 1_000_000 × 0,20 $)
  +
  (Output-Tokens / 1_000_000 × 1,20 $)
Enter fullscreen mode Exit fullscreen mode

Output-Tokens dominieren bei vielen generativen Workloads die Kosten. Kürzen Sie deshalb unnötig lange Antworten, setzen Sie sinnvolle Antwortlimits und reduzieren Sie überflüssige Reasoning-Stufen.

4. Routing-Regeln aus den Ergebnissen ableiten

Eine einfache Routing-Strategie kann so aussehen:

Wenn Aufgabe = Klassifizierung oder Extraktion:
  zuerst Luna testen

Wenn Aufgabe = Standardanalyse oder strukturierte Zusammenfassung:
  Terra als Standard evaluieren

Wenn Aufgabe = komplexe Argumentation oder kritische Entscheidung:
  Sol verwenden

Wenn Latenz kritisch und Sol erforderlich:
  Sol Fast gegen Standard-Sol benchmarken
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie keine Modellnamen als fest verdrahtete Business-Logik. Halten Sie Modell-ID, Aufwand und Latenzmodus als Konfigurationswerte vor.

Vergleich in Apidog einrichten

Apidog beschleunigt den Modellvergleich: Definieren Sie den Chat-Completion-Endpunkt einmal, steuern Sie die Modell-ID über Umgebungsvariablen und führen Sie dasselbe Testszenario gegen jede Modellstufe aus.

Beispiel für eine Umgebungsvariable:

{
  "OPENAI_MODEL": "gpt-5.6-luna"
}
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie dieselbe Request-Vorlage und ersetzen Sie nur die Modellvariable:

{
  "model": "{{OPENAI_MODEL}}",
  "messages": [
    {
      "role": "user",
      "content": "{{PROMPT}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Prüfen Sie im Response-Viewer pro Request den usage-Block. Damit vergleichen Sie echte Input- und Output-Token-Zahlen statt Schätzungen.

Wenn Sie GPT-5.6 erstmals integrieren, behandelt unser Leitfaden zur Nutzung der GPT-5.6 API Authentifizierung, Modell-IDs und Anfrageformat. Sie können den Endpunkt zudem simulieren, bevor Produktionsbudget oder Live-Zugang verfügbar sind, und später auf echten Traffic wechseln, ohne Ihre Tests neu zu schreiben.

Laden Sie Apidog kostenlos herunter, um den Vergleich auszuführen.

Das größere Bild: Der Preiskampf ist entbrannt

Dies ist die dritte größere Preisänderung am günstigen Ende der Frontier in diesem Sommer. Google aktualisierte sein Flash-Tier im Juli, Anthropic führte Claude Opus 5 zum halben Preis von Fable 5 ein, und OpenAI senkte Luna nun unter beide Gemini-Flash-Optionen.

Die Modellqualität differenziert die Flaggschiffe weiterhin. Bei Batch-Jobs, Extraktion, Klassifizierung und Standardautomatisierungen gewinnt jedoch oft das Modell mit der niedrigsten akzeptablen Kosten-Qualitäts-Kombination.

Für API-Teams folgt daraus ein klarer Implementierungsansatz:

  1. Modell-ID als Konfiguration statt als Hardcode behandeln.
  2. Eine dauerhafte Evaluierungssuite pflegen.
  3. Token, Kosten, Latenz und Qualitätsmetriken überwachen.
  4. Nach jeder Preisänderung einen erneuten Benchmark ausführen.
  5. Routing-Regeln anhand von Messwerten statt Annahmen aktualisieren.

Teams, die Modell-Routing als getestete Infrastruktur behandeln, können Preissenkungen innerhalb von Tagen nutzen statt erst im nächsten Planungszyklus.

FAQ

Was sind die neuen GPT-5.6-API-Preise?

Ab dem 30. Juli 2026 gelten folgende Standardpreise pro Million Tokens:

Modell Input Output
GPT-5.6 Luna $0,20 $1,20
GPT-5.6 Terra $2,00 $12,00
GPT-5.6 Sol $5,00 $30,00

Sol bietet zusätzlich einen Fast-Modus: doppelter Standardpreis für 2,5x schnellere Verarbeitung.

Wurde der Preis für GPT-5.6 Sol gesenkt?

Nein. Die Standardpreise von Sol bleiben unverändert. Neu ist der Fast-Modus, der Priority Processing ersetzt und den doppelten Preis gegen 2,5x höhere Geschwindigkeit eintauscht.

Ist GPT-5.6 Luna jetzt günstiger als Gemini Flash?

Nach Listenpreis: ja. Luna kostet kombiniert 1,40 $ pro Million Input- und Output-Tokens, verglichen mit 2,80 $ für Gemini 3.5 Flash-Lite und 9 $ für Gemini 3.6 Flash.

Preis bedeutet jedoch nicht automatisch bessere Ergebnisse. Testen Sie beide Modelle gegen Ihr eigenes Evaluierungs-Set, bevor Sie Routing-Regeln ändern. Wenn Sie zunächst den kostenlosen Weg testen möchten, lesen Sie wie Sie GPT-5.6 kostenlos nutzen können.

Gelten die Preissenkungen automatisch?

Ja. Die neuen Tarife gelten seit dem 30. Juli 2026 automatisch für die Standard-API-Nutzung. Code-Änderungen sind nur erforderlich, wenn Sie bei Sol bisher Priority Processing verwenden und auf den Fast-Modus migrieren müssen.

Was diese Woche zu tun ist

  1. Aktualisieren Sie Ihr Kostenmodell mit den neuen Luna- und Terra-Preisen.
  2. Identifizieren Sie Workloads, die Luna zu rund 96 % unter Sol-Kosten ausführen könnte.
  3. Testen Sie Terra erneut, wenn bisherige Routing-Schwellenwerte auf dem alten Preis basieren.
  4. Prüfen Sie Sol-Priority-Processing-Konfigurationen und planen Sie die Migration auf Fast.
  5. Führen Sie identische Produktions-Prompts gegen Luna, Terra und Sol aus.
  6. Vergleichen Sie usage, Latenz, Antwortqualität und Retry-Rate.
  7. Aktualisieren Sie Routing-Regeln erst nach einem reproduzierbaren Benchmark.

Ein Testszenario in Apidog, drei Modell-IDs und die tatsächlichen usage-Werte zeigen Ihnen, was die Preissenkung für Ihren konkreten Traffic wert ist.

Top comments (0)