DEV Community

Cover image for Wie nutzt man GPT-6.1 Sol API
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Wie nutzt man GPT-6.1 Sol API

Um die GPT-6.1 Sol API aufzurufen, senden Sie eine POST-Anfrage an https://api.openai.com/v1/responses mit "model": "gpt-6.1-sol" und Ihrem Schlüssel als Bearer-Token. Die Kosten liegen bei denselben 2 $ für Eingaben und 10 $ für Ausgaben pro Million Token wie bei GPT-6 Sol, und die gecachte Eingabe sinkt von 0,20 $ auf 0,10 $. Die Migration von gpt-6-sol ist größtenteils ein String-Austausch. Die wichtigste Änderung betrifft den Aufwand: GPT-6.1 Sol akzeptiert weder none noch minimal, daher müssen diese Anfragen auf low umgestellt werden.

Apidog heute testen

OpenAI hat GPT-6.1 Sol am DevDay am 29. September 2026 veröffentlicht. Der DevDay 2026 Rückblick behandelt die anderen Veröffentlichungen, und Was ist GPT-6.1 Sol behandelt die Benchmarks detailliert. Dieser Leitfaden zeigt die erste Anfrage, die Auswahl des Aufwandsniveaus, die Migrationsänderungen, Batch-, Flex- und Fast-Tiers sowie einen Regressionstest beider Modell-IDs in Apidog, bevor Sie Produktionsverkehr umstellen.

GPT-6 Sol vs. GPT-6.1 Sol: Was sich in der API ändert

Die meisten Spezifikationen sind identisch. Die folgenden Unterschiede basieren auf der GPT-6.1 Sol Modellseite, der GPT-6 Sol Modellseite und OpenAIs Anleitung zur GPT-6 Migration:

gpt-6-sol gpt-6.1-sol Was zu tun ist
Eingabe / Ausgabe pro 1 Mio. (Standard) 2 $ / 10 $ 2 $ / 10 $ Nichts
Gecachte Eingabe pro 1 Mio. 0,20 $ 0,10 $ Cache-Berechnung erneut ausführen
Cache-Schreibvorgänge pro 1 Mio. 2,50 $ 2,50 $ Nichts
Kontextfenster / max. Eingabe / max. Ausgabe 1.050.000 / 922.000 / 128.000 1.050.000 / 922.000 / 128.000 Nichts
Wissensstand 20. April 2026 30. April 2026 Datumsempfindliche Auswertungen erneut prüfen
reasoning.effort none, low, medium (Standard), high, xhigh, max low, medium (Standard), high, xhigh, max none auf low umstellen und neu bewerten
Funktionsaufrufe in Chat Completions Nur mit reasoning_effort: "none" Nicht unterstützt Tool-Aufrufe nach Responses verschieben
Endpunkte Chat Completions, Responses, Batch Gleich Nichts
Ratenbegrenzungen Stufe 1: 500 RPM / 500K TPM; Stufe 5: 15.000 RPM / 40M TPM Gleich Nichts

Die GPT-6 Sol-Seite verweist Leser nun auf GPT-6.1 Sol als „das neuere Sol-Modell“.

Senden Sie Ihre erste GPT-6.1 Sol-Anfrage

Exportieren Sie Ihren Schlüssel als OPENAI_API_KEY und rufen Sie dann die Responses API auf:

curl https://api.openai.com/v1/responses \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -d '{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'
Enter fullscreen mode Exit fullscreen mode

Das Python SDK liest dieselbe Umgebungsvariable:

from openai import OpenAI

client = OpenAI()

response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "medium"},
    input="List three ways a webhook retry policy can create duplicate orders. One line each.",
)

print(response.output_text)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Prüfen Sie in der Antwort insbesondere diese Felder:

  • status ist bei Erfolg completed. Wenn das Modell das Ausgabebudget überschreitet, erhalten Sie incomplete mit incomplete_details.reason auf max_output_tokens. Das kann passieren, bevor sichtbarer Text erscheint. Der Reasoning-Leitfaden empfiehlt beim Experimentieren mindestens 25.000 Token für Reasoning und Ausgabe.
  • output ist ein Array. Die Antwort befindet sich im Element mit type: "message" und Inhalt vom Typ output_text. Lesen Sie die Ausgabe nach Typ, nicht nach Array-Index.
  • usage.output_tokens enthält auch Reasoning-Token, die zum Ausgabepreis abgerechnet werden. usage.output_tokens_details.reasoning_tokens zeigt deren Anzahl.
  • usage.input_tokens_details meldet cached_tokens und cache_write_tokens. Dort sehen Sie den günstigeren Cache.

Verwenden Sie die Responses API für alle Tool-Workflows. GPT-6.1 Sol unterstützt Chat Completions nur für Anfragen ohne Tools. Der Leitfaden zur Responses API behandelt die Anfrageform detaillierter.

Wählen Sie ein Reasoning-Aufwandsniveau

Der Aufwand ist der wichtigste Regler für Kosten und Qualität. Wenn Sie keinen Wert angeben, verwendet das Modell medium.

OpenAIs Modellauswahlleitfaden ordnet medium komplexer technischer Arbeit und koordinierten Ergebnissen zu, die Sie voraussichtlich überarbeiten. xhigh ist für ausgefeilte Ergebnisse und Entscheidungen mit widersprüchlichen Beweisen vorgesehen. Der Veröffentlichungsbeitrag ergänzt Benchmarks nach Einstellung.

Aufwand Hier beginnen für Was OpenAI für GPT-6.1 Sol berichtet
low Chat, Extraktion, Klassifizierung, alles, was mit none lief Bei von Benutzern markierten Gesprächen sinken Antworten mit einem sachlichen Fehler von 11,4 % auf 7,7 %
medium (Standard) Agentenbasierte Automatisierungen und Tool-Aufruf-Workflows AutomationBench 1.0.6: +2,2 Prozentpunkte gegenüber Claude Opus 5.5 bei etwa einem Drittel der Kosten; +4,8 Prozentpunkte gegenüber GPT-6 Sol bei gleicher Einstellung
high Komplexes Debugging und detaillierte Planung Keine einstellungsspezifische Angabe
xhigh Ausgereifte Ergebnisse und lange asynchrone Läufe Keine einstellungsspezifische Angabe
max Computernutzung und anspruchsvolle wissenschaftliche Aufgaben OSWorld 2.0: +7 Prozentpunkte gegenüber GPT-6 Sol bei Max für weniger als die Hälfte der Kosten. Terminal-Bench Science 0.1: 5,47 $ pro Aufgabe, gegenüber 23,21 $ für Opus 5.5 und 23,80 $ für GPT-6 Astra

Die Faktenangabe bezieht sich auf Gespräche, die zuvor als fehlerhaft markiert wurden, nicht auf typischen Traffic. Bei Terminal-Bench Science erzielt GPT-6 Astra weiterhin die höchste Punktzahl von 68,1 %, daher empfiehlt OpenAI Astra für die anspruchsvollsten wissenschaftlichen Arbeiten.

Für latenzempfindliche Aufrufe, die bisher none verwendeten:

  1. Starten Sie mit low.
  2. Messen Sie Latenz, Kosten und Ausgabequalität mit repräsentativen Prompts.
  3. Vergleichen Sie die Ergebnisse mit Ihrer bisherigen none-Baseline.

Um den Aufwand mitten in einem Gespräch zu ändern, ohne den Prompt-Cache zu unterbrechen, hängen Sie ein configuration_update-Eingabeelement an. Ändern Sie nicht reasoning.effort auf Anforderungsebene.

Migration von gpt-6-sol: Vier Codeänderungen

  1. Modell-ID austauschen.

    Ersetzen Sie gpt-6-sol durch gpt-6.1-sol. Speichern Sie die ID in einer Konfiguration oder Umgebungsvariable, damit ein Rollback nur eine Änderung erfordert.

  2. none und minimal neu zuordnen.

    Verwenden Sie low statt none. Beginnen Sie für bisherige minimal-Workloads ebenfalls mit low und vergleichen Sie repräsentative Aufgaben. Bei GPT-6 Astra, das ebenfalls kein none unterstützt, führt das Senden dieses Werts zu HTTP 400.

  3. Sampling-Parameter entfernen.

    Wenn der Aufwand nicht none ist, entfernen Sie temperature, top_p und top_logprobs. In Chat Completions betrifft das auch logprobs. Code, der temperature mit none bei GPT-6 Sol kombiniert hat, muss angepasst werden.

  4. Chat-Completions-Tool-Aufrufe nach Responses verschieben.

    GPT-6 Sol erlaubte Funktionsaufrufe in Chat Completions nur mit reasoning_effort: "none". Diese Kombination hat in GPT-6.1 Sol kein Äquivalent.

Führen Sie anschließend alle Auswertungen erneut aus, die von Aktualität abhängen: Der Wissensstand verschiebt sich vom 20. April auf den 30. April 2026. Wenn Sie von Astra zu Sol migriert sind, behandelt der Astra-zu-Sol-Migrationsleitfaden diesen vorherigen Schritt.

Batch-, Flex-, Fast- und Cached-Input-Preise

Alle Tiers behalten die Preisstruktur von GPT-6 Sol bei, aber die gecachte Eingabe kostet nur noch die Hälfte. Die Preise pro 1 Million Token stammen von der API-Preisgestaltungsseite.

Die Modellseite ergänzt: Ein Prompt mit mehr als 272.000 Eingabe-Token wird für die gesamte Anfrage mit dem 2-Fachen der Eingabe- und Cache-Raten sowie dem 1,5-Fachen der Ausgaberate abgerechnet.

Stufe Eingabe Gecachte Eingabe Cache-Schreibvorgänge Ausgabe
Standard 2,00 $ 0,10 $ 2,50 $ 10,00 $
Batch 1,00 $ 0,05 $ 1,25 $ 5,00 $
Flex 1,00 $ 0,05 $ 1,25 $ 5,00 $
Fast 4,00 $ 0,20 $ 5,00 $ 20,00 $
Standard, Prompt über 272K Eingabe-Token 4,00 $ 0,20 $ 5,00 $ 15,00 $

Flex aktivieren Sie pro Anfrage:

{
  "service_tier": "flex"
}
Enter fullscreen mode Exit fullscreen mode

Fast aktivieren Sie so:

{
  "service_tier": "fast"
}
Enter fullscreen mode Exit fullscreen mode

"priority" wird als Alias akzeptiert. Fast ist nicht mit EU-Datenresidenz verfügbar. Ultrafast für GPT-6.1 Sol ist „bald verfügbar“ und derzeit nur für GPT-6 Astra weit verbreitet. Siehe dazu OpenAI Ultrafast-Modus.

Für Nachtjobs führt der OpenAI Batch API Leitfaden durch einen Batch-Lauf.

Der Cache ist der Bereich, in dem das Upgrade Kosten spart. Laut Prompt-Caching-Leitfaden kosten Lesevorgänge bei GPT-6.1 Sol 0,05x der Eingaberate statt 0,1x bei GPT-6 Sol. Schreibvorgänge kosten bei beiden Modellen 1,25x.

Beispiel: Sie verwenden einen System-Prompt mit 50.000 Token über 1.000 Anfragen hinweg.

  • Ein Cache-Schreibvorgang kostet bei beiden Modellen 0,125 $.
  • 999 Cache-Lesevorgänge kosten bei GPT-6 Sol 9,99 $.
  • 999 Cache-Lesevorgänge kosten bei GPT-6.1 Sol 5,00 $.

Das minimale cachebare Präfix beträgt 1.024 sichtbare Token. Ein gecachtes Präfix bleibt mindestens 30 Minuten nach dem letzten Schreib- oder Wiederverwendungsvorgang gültig. Für die Breakpoint-Strategie siehe GPT-6 Prompt Caching.

Testen Sie den Wechsel in Apidog

Stellen Sie die Produktion nicht nur anhand der Listenpreise um. Senden Sie dieselbe gespeicherte Anfrage an beide Modell-IDs und vergleichen Sie Ausgabe, Token-Verbrauch und Kosten.

In Apidog:

  1. Erstellen Sie eine Umgebung mit:

    • OPENAI_API_KEY als Geheimnis
    • MODEL_ID mit gpt-6-sol
    • EFFORT mit medium
  2. Erstellen Sie eine Anfrage an POST https://api.openai.com/v1/responses mit dem Header:

   Authorization: Bearer {{OPENAI_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie diesen Body und speichern Sie die Anfrage:

   {
     "model": "{{MODEL_ID}}",
     "reasoning": {"effort": "{{EFFORT}}"},
     "max_output_tokens": 25000,
     "input": "Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."
   }
Enter fullscreen mode Exit fullscreen mode
  1. Fügen Sie Zusicherungen hinzu:
  • HTTP-Status ist 200
  • $.status ist completed
  • $.output[*].type enthält message
  • $.usage.output_tokens ist größer als 0
  • $.usage.output_tokens_details.reasoning_tokens existiert

Prüfen Sie außerdem die Ausgabeform, von der Ihr Code abhängt, etwa gültiges JSON und die von Ihnen geparsten Schlüssel.

  1. Fügen Sie ein Post-Processor-Skript hinzu, das usage in Dollar umrechnet:
   const u = pm.response.json().usage;
   const d = u.input_tokens_details || {};
   const cached = d.cached_tokens || 0;
   const writes = d.cache_write_tokens || 0;
   const model = pm.environment.get("MODEL_ID");

   const cachedRate = model === "gpt-6.1-sol" ? 0.10 : 0.20;

   const cost = (
     (u.input_tokens - cached - writes) * 2 +
     cached * cachedRate +
     writes * 2.5 +
     u.output_tokens * 10
   ) / 1e6;

   console.log(model, "cost per call $", cost.toFixed(5));
Enter fullscreen mode Exit fullscreen mode
  1. Senden Sie die Anfrage mit MODEL_ID=gpt-6-sol. Ändern Sie anschließend MODEL_ID zu gpt-6.1-sol und senden Sie sie erneut.

Vergleichen Sie danach:

  • reasoning_tokens
  • output_tokens
  • Antwortinhalt und Ausgabeformat
  • protokollierte Kosten

Wenn Sie von none migrieren, führen Sie die Baseline mit none und den Kandidaten mit low aus.

Verschieben Sie anschließend die Anfrage und einige reale Prompts in ein Testszenario. Führen Sie beide Modellvarianten über die Apidog CLI in CI aus. Mit --env-var überschreiben Sie Variablen für einen einzelnen Lauf:

npm install -g apidog-cli

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6-sol" -r cli,junit

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  --env-var "MODEL_ID=gpt-6.1-sol" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Eine fehlgeschlagene Zusicherung lässt den Job fehlschlagen. Die JUnit-Berichte zeigen beide Läufe nebeneinander. Für Assertions bei Ausgaben, die von Lauf zu Lauf variieren, siehe Testen nicht-deterministischer KI-Agenten.

FAQ

Ist GPT-6.1 Sol teurer als GPT-6 Sol?

Nein. Beide Modelle sind mit 2 $ Eingabe und 10 $ Ausgabe pro 1 Million Token gelistet. Die gecachte Eingabe von GPT-6.1 Sol beträgt 0,10 $ statt 0,20 $, daher werden cache-intensive Workloads günstiger.

Was soll ich mit reasoning.effort: "none" tun?

GPT-6.1 Sol unterstützt weder none noch minimal. Ordnen Sie beide Werte low zu, entfernen Sie temperature und top_p, und führen Sie Ihre Auswertungen erneut aus, bevor Sie wechseln.

Kann ich GPT-6.1 Sol mit Chat Completions verwenden?

Ja, für Anfragen ohne Tools. Für Tool-Aufrufe ist die Responses API erforderlich.

Gibt es einen kostenlosen GPT-6.1 Sol API-Tier?

Nein. API-Aufrufe werden ab der ersten Anfrage pro Token abgerechnet. Ist GPT-6.1 Sol kostenlos? behandelt die günstigsten Routen.

Nächster Schritt

Speichern Sie Ihre erste Anfrage. Führen Sie sie mit gpt-6-sol bei Ihrem aktuellen Aufwand und anschließend mit gpt-6.1-sol aus. Vergleichen Sie usage und Ausgabe mit einem Prompt aus Ihrem eigenen Traffic.

Laden Sie Apidog herunter, um beide Läufe als Zusicherungen zu speichern und in CI erneut auszuführen. Wenn Sie stattdessen Anthropic evaluieren, siehe GPT-6.1 Sol vs. Claude Sonnet 5.5.

Top comments (0)