Um die GPT-6.1 Sol API aufzurufen, senden Sie eine POST-Anfrage an https://api.openai.com/v1/responses mit "model": "gpt-6.1-sol" und Ihrem Schlüssel als Bearer-Token. Die Kosten liegen bei denselben 2 $ für Eingaben und 10 $ für Ausgaben pro Million Token wie bei GPT-6 Sol, und die gecachte Eingabe sinkt von 0,20 $ auf 0,10 $. Die Migration von gpt-6-sol ist größtenteils ein String-Austausch. Die wichtigste Änderung betrifft den Aufwand: GPT-6.1 Sol akzeptiert weder none noch minimal, daher müssen diese Anfragen auf low umgestellt werden.
OpenAI hat GPT-6.1 Sol am DevDay am 29. September 2026 veröffentlicht. Der DevDay 2026 Rückblick behandelt die anderen Veröffentlichungen, und Was ist GPT-6.1 Sol behandelt die Benchmarks detailliert. Dieser Leitfaden zeigt die erste Anfrage, die Auswahl des Aufwandsniveaus, die Migrationsänderungen, Batch-, Flex- und Fast-Tiers sowie einen Regressionstest beider Modell-IDs in Apidog, bevor Sie Produktionsverkehr umstellen.
GPT-6 Sol vs. GPT-6.1 Sol: Was sich in der API ändert
Die meisten Spezifikationen sind identisch. Die folgenden Unterschiede basieren auf der GPT-6.1 Sol Modellseite, der GPT-6 Sol Modellseite und OpenAIs Anleitung zur GPT-6 Migration:
gpt-6-sol |
gpt-6.1-sol |
Was zu tun ist | |
|---|---|---|---|
| Eingabe / Ausgabe pro 1 Mio. (Standard) | 2 $ / 10 $ | 2 $ / 10 $ | Nichts |
| Gecachte Eingabe pro 1 Mio. | 0,20 $ | 0,10 $ | Cache-Berechnung erneut ausführen |
| Cache-Schreibvorgänge pro 1 Mio. | 2,50 $ | 2,50 $ | Nichts |
| Kontextfenster / max. Eingabe / max. Ausgabe | 1.050.000 / 922.000 / 128.000 | 1.050.000 / 922.000 / 128.000 | Nichts |
| Wissensstand | 20. April 2026 | 30. April 2026 | Datumsempfindliche Auswertungen erneut prüfen |
reasoning.effort |
none, low, medium (Standard), high, xhigh, max
|
low, medium (Standard), high, xhigh, max
|
none auf low umstellen und neu bewerten |
| Funktionsaufrufe in Chat Completions | Nur mit reasoning_effort: "none"
|
Nicht unterstützt | Tool-Aufrufe nach Responses verschieben |
| Endpunkte | Chat Completions, Responses, Batch | Gleich | Nichts |
| Ratenbegrenzungen | Stufe 1: 500 RPM / 500K TPM; Stufe 5: 15.000 RPM / 40M TPM | Gleich | Nichts |
Die GPT-6 Sol-Seite verweist Leser nun auf GPT-6.1 Sol als „das neuere Sol-Modell“.
Senden Sie Ihre erste GPT-6.1 Sol-Anfrage
Exportieren Sie Ihren Schlüssel als OPENAI_API_KEY und rufen Sie dann die Responses API auf:
curl https://api.openai.com/v1/responses \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-d '{
"model": "gpt-6.1-sol",
"reasoning": {"effort": "medium"},
"input": "List three ways a webhook retry policy can create duplicate orders. One line each."
}'
Das Python SDK liest dieselbe Umgebungsvariable:
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6.1-sol",
reasoning={"effort": "medium"},
input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)
print(response.output_text)
print(response.usage)
Prüfen Sie in der Antwort insbesondere diese Felder:
-
statusist bei Erfolgcompleted. Wenn das Modell das Ausgabebudget überschreitet, erhalten Sieincompletemitincomplete_details.reasonaufmax_output_tokens. Das kann passieren, bevor sichtbarer Text erscheint. Der Reasoning-Leitfaden empfiehlt beim Experimentieren mindestens 25.000 Token für Reasoning und Ausgabe. -
outputist ein Array. Die Antwort befindet sich im Element mittype: "message"und Inhalt vom Typoutput_text. Lesen Sie die Ausgabe nach Typ, nicht nach Array-Index. -
usage.output_tokensenthält auch Reasoning-Token, die zum Ausgabepreis abgerechnet werden.usage.output_tokens_details.reasoning_tokenszeigt deren Anzahl. -
usage.input_tokens_detailsmeldetcached_tokensundcache_write_tokens. Dort sehen Sie den günstigeren Cache.
Verwenden Sie die Responses API für alle Tool-Workflows. GPT-6.1 Sol unterstützt Chat Completions nur für Anfragen ohne Tools. Der Leitfaden zur Responses API behandelt die Anfrageform detaillierter.
Wählen Sie ein Reasoning-Aufwandsniveau
Der Aufwand ist der wichtigste Regler für Kosten und Qualität. Wenn Sie keinen Wert angeben, verwendet das Modell medium.
OpenAIs Modellauswahlleitfaden ordnet medium komplexer technischer Arbeit und koordinierten Ergebnissen zu, die Sie voraussichtlich überarbeiten. xhigh ist für ausgefeilte Ergebnisse und Entscheidungen mit widersprüchlichen Beweisen vorgesehen. Der Veröffentlichungsbeitrag ergänzt Benchmarks nach Einstellung.
| Aufwand | Hier beginnen für | Was OpenAI für GPT-6.1 Sol berichtet |
|---|---|---|
low |
Chat, Extraktion, Klassifizierung, alles, was mit none lief |
Bei von Benutzern markierten Gesprächen sinken Antworten mit einem sachlichen Fehler von 11,4 % auf 7,7 % |
medium (Standard) |
Agentenbasierte Automatisierungen und Tool-Aufruf-Workflows | AutomationBench 1.0.6: +2,2 Prozentpunkte gegenüber Claude Opus 5.5 bei etwa einem Drittel der Kosten; +4,8 Prozentpunkte gegenüber GPT-6 Sol bei gleicher Einstellung |
high |
Komplexes Debugging und detaillierte Planung | Keine einstellungsspezifische Angabe |
xhigh |
Ausgereifte Ergebnisse und lange asynchrone Läufe | Keine einstellungsspezifische Angabe |
max |
Computernutzung und anspruchsvolle wissenschaftliche Aufgaben | OSWorld 2.0: +7 Prozentpunkte gegenüber GPT-6 Sol bei Max für weniger als die Hälfte der Kosten. Terminal-Bench Science 0.1: 5,47 $ pro Aufgabe, gegenüber 23,21 $ für Opus 5.5 und 23,80 $ für GPT-6 Astra |
Die Faktenangabe bezieht sich auf Gespräche, die zuvor als fehlerhaft markiert wurden, nicht auf typischen Traffic. Bei Terminal-Bench Science erzielt GPT-6 Astra weiterhin die höchste Punktzahl von 68,1 %, daher empfiehlt OpenAI Astra für die anspruchsvollsten wissenschaftlichen Arbeiten.
Für latenzempfindliche Aufrufe, die bisher none verwendeten:
- Starten Sie mit
low. - Messen Sie Latenz, Kosten und Ausgabequalität mit repräsentativen Prompts.
- Vergleichen Sie die Ergebnisse mit Ihrer bisherigen
none-Baseline.
Um den Aufwand mitten in einem Gespräch zu ändern, ohne den Prompt-Cache zu unterbrechen, hängen Sie ein configuration_update-Eingabeelement an. Ändern Sie nicht reasoning.effort auf Anforderungsebene.
Migration von gpt-6-sol: Vier Codeänderungen
Modell-ID austauschen.
Ersetzen Siegpt-6-soldurchgpt-6.1-sol. Speichern Sie die ID in einer Konfiguration oder Umgebungsvariable, damit ein Rollback nur eine Änderung erfordert.noneundminimalneu zuordnen.
Verwenden Sielowstattnone. Beginnen Sie für bisherigeminimal-Workloads ebenfalls mitlowund vergleichen Sie repräsentative Aufgaben. Bei GPT-6 Astra, das ebenfalls keinnoneunterstützt, führt das Senden dieses Werts zu HTTP 400.Sampling-Parameter entfernen.
Wenn der Aufwand nichtnoneist, entfernen Sietemperature,top_pundtop_logprobs. In Chat Completions betrifft das auchlogprobs. Code, dertemperaturemitnonebei GPT-6 Sol kombiniert hat, muss angepasst werden.Chat-Completions-Tool-Aufrufe nach Responses verschieben.
GPT-6 Sol erlaubte Funktionsaufrufe in Chat Completions nur mitreasoning_effort: "none". Diese Kombination hat in GPT-6.1 Sol kein Äquivalent.
Führen Sie anschließend alle Auswertungen erneut aus, die von Aktualität abhängen: Der Wissensstand verschiebt sich vom 20. April auf den 30. April 2026. Wenn Sie von Astra zu Sol migriert sind, behandelt der Astra-zu-Sol-Migrationsleitfaden diesen vorherigen Schritt.
Batch-, Flex-, Fast- und Cached-Input-Preise
Alle Tiers behalten die Preisstruktur von GPT-6 Sol bei, aber die gecachte Eingabe kostet nur noch die Hälfte. Die Preise pro 1 Million Token stammen von der API-Preisgestaltungsseite.
Die Modellseite ergänzt: Ein Prompt mit mehr als 272.000 Eingabe-Token wird für die gesamte Anfrage mit dem 2-Fachen der Eingabe- und Cache-Raten sowie dem 1,5-Fachen der Ausgaberate abgerechnet.
| Stufe | Eingabe | Gecachte Eingabe | Cache-Schreibvorgänge | Ausgabe |
|---|---|---|---|---|
| Standard | 2,00 $ | 0,10 $ | 2,50 $ | 10,00 $ |
| Batch | 1,00 $ | 0,05 $ | 1,25 $ | 5,00 $ |
| Flex | 1,00 $ | 0,05 $ | 1,25 $ | 5,00 $ |
| Fast | 4,00 $ | 0,20 $ | 5,00 $ | 20,00 $ |
| Standard, Prompt über 272K Eingabe-Token | 4,00 $ | 0,20 $ | 5,00 $ | 15,00 $ |
Flex aktivieren Sie pro Anfrage:
{
"service_tier": "flex"
}
Fast aktivieren Sie so:
{
"service_tier": "fast"
}
"priority" wird als Alias akzeptiert. Fast ist nicht mit EU-Datenresidenz verfügbar. Ultrafast für GPT-6.1 Sol ist „bald verfügbar“ und derzeit nur für GPT-6 Astra weit verbreitet. Siehe dazu OpenAI Ultrafast-Modus.
Für Nachtjobs führt der OpenAI Batch API Leitfaden durch einen Batch-Lauf.
Der Cache ist der Bereich, in dem das Upgrade Kosten spart. Laut Prompt-Caching-Leitfaden kosten Lesevorgänge bei GPT-6.1 Sol 0,05x der Eingaberate statt 0,1x bei GPT-6 Sol. Schreibvorgänge kosten bei beiden Modellen 1,25x.
Beispiel: Sie verwenden einen System-Prompt mit 50.000 Token über 1.000 Anfragen hinweg.
- Ein Cache-Schreibvorgang kostet bei beiden Modellen 0,125 $.
- 999 Cache-Lesevorgänge kosten bei GPT-6 Sol 9,99 $.
- 999 Cache-Lesevorgänge kosten bei GPT-6.1 Sol 5,00 $.
Das minimale cachebare Präfix beträgt 1.024 sichtbare Token. Ein gecachtes Präfix bleibt mindestens 30 Minuten nach dem letzten Schreib- oder Wiederverwendungsvorgang gültig. Für die Breakpoint-Strategie siehe GPT-6 Prompt Caching.
Testen Sie den Wechsel in Apidog
Stellen Sie die Produktion nicht nur anhand der Listenpreise um. Senden Sie dieselbe gespeicherte Anfrage an beide Modell-IDs und vergleichen Sie Ausgabe, Token-Verbrauch und Kosten.
In Apidog:
-
Erstellen Sie eine Umgebung mit:
-
OPENAI_API_KEYals Geheimnis -
MODEL_IDmitgpt-6-sol -
EFFORTmitmedium
-
Erstellen Sie eine Anfrage an
POST https://api.openai.com/v1/responsesmit dem Header:
Authorization: Bearer {{OPENAI_API_KEY}}
Verwenden Sie diesen Body und speichern Sie die Anfrage:
{
"model": "{{MODEL_ID}}",
"reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000,
"input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
}
- Fügen Sie Zusicherungen hinzu:
- HTTP-Status ist
200 -
$.statusistcompleted -
$.output[*].typeenthältmessage -
$.usage.output_tokensist größer als0 -
$.usage.output_tokens_details.reasoning_tokensexistiert
Prüfen Sie außerdem die Ausgabeform, von der Ihr Code abhängt, etwa gültiges JSON und die von Ihnen geparsten Schlüssel.
- Fügen Sie ein Post-Processor-Skript hinzu, das
usagein Dollar umrechnet:
const u = pm.response.json().usage;
const d = u.input_tokens_details || {};
const cached = d.cached_tokens || 0;
const writes = d.cache_write_tokens || 0;
const model = pm.environment.get("MODEL_ID");
const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;
const cost = (
(u.input_tokens - cached - writes) * 2 +
cached * cachedRate +
writes * 2.5 +
u.output_tokens * 10
) / 1e6;
console.log(model, "cost per call $", cost.toFixed(5));
- Senden Sie die Anfrage mit
MODEL_ID=gpt-6-sol. Ändern Sie anschließendMODEL_IDzugpt-6.1-solund senden Sie sie erneut.
Vergleichen Sie danach:
reasoning_tokensoutput_tokens- Antwortinhalt und Ausgabeformat
- protokollierte Kosten
Wenn Sie von none migrieren, führen Sie die Baseline mit none und den Kandidaten mit low aus.
Verschieben Sie anschließend die Anfrage und einige reale Prompts in ein Testszenario. Führen Sie beide Modellvarianten über die Apidog CLI in CI aus. Mit --env-var überschreiben Sie Variablen für einen einzelnen Lauf:
npm install -g apidog-cli
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6-sol" -r cli,junit
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
--env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Eine fehlgeschlagene Zusicherung lässt den Job fehlschlagen. Die JUnit-Berichte zeigen beide Läufe nebeneinander. Für Assertions bei Ausgaben, die von Lauf zu Lauf variieren, siehe Testen nicht-deterministischer KI-Agenten.
FAQ
Ist GPT-6.1 Sol teurer als GPT-6 Sol?
Nein. Beide Modelle sind mit 2 $ Eingabe und 10 $ Ausgabe pro 1 Million Token gelistet. Die gecachte Eingabe von GPT-6.1 Sol beträgt 0,10 $ statt 0,20 $, daher werden cache-intensive Workloads günstiger.
Was soll ich mit reasoning.effort: "none" tun?
GPT-6.1 Sol unterstützt weder none noch minimal. Ordnen Sie beide Werte low zu, entfernen Sie temperature und top_p, und führen Sie Ihre Auswertungen erneut aus, bevor Sie wechseln.
Kann ich GPT-6.1 Sol mit Chat Completions verwenden?
Ja, für Anfragen ohne Tools. Für Tool-Aufrufe ist die Responses API erforderlich.
Gibt es einen kostenlosen GPT-6.1 Sol API-Tier?
Nein. API-Aufrufe werden ab der ersten Anfrage pro Token abgerechnet. Ist GPT-6.1 Sol kostenlos? behandelt die günstigsten Routen.
Nächster Schritt
Speichern Sie Ihre erste Anfrage. Führen Sie sie mit gpt-6-sol bei Ihrem aktuellen Aufwand und anschließend mit gpt-6.1-sol aus. Vergleichen Sie usage und Ausgabe mit einem Prompt aus Ihrem eigenen Traffic.
Laden Sie Apidog herunter, um beide Läufe als Zusicherungen zu speichern und in CI erneut auszuführen. Wenn Sie stattdessen Anthropic evaluieren, siehe GPT-6.1 Sol vs. Claude Sonnet 5.5.
Top comments (0)