DEV Community

Cover image for GPT-6.1 Sol vs Claude Sonnet 5.5 KI-Modelle: Gleicher Preis $2/$10, 1 Tag Startunterschied & keine Benchmarks
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

GPT-6.1 Sol vs Claude Sonnet 5.5 KI-Modelle: Gleicher Preis $2/$10, 1 Tag Startunterschied & keine Benchmarks

GPT-6.1 Sol und Claude Sonnet 5.5 kosten beide 2 $ pro Million Input-Tokens und 10 $ pro Million Output-Tokens und wurden im Abstand eines Tages eingeführt: Sonnet 5.5 am 28. September 2026 und GPT-6.1 Sol am 29. September. Keiner der Anbieter hat das eine Modell direkt gegen das andere getestet. OpenAI verglich GPT-6.1 Sol mit Claude Opus 5.5 und Fable 5.1, Anthropic verglich Sonnet 5.5 mit GPT-6 Sol, dem vorherigen Sol-Modell. Für eine belastbare Entscheidung führen Sie beide Modelle mit Ihren eigenen Aufgaben aus und vergleichen die Kosten pro erfolgreicher Aufgabe – nicht nur den Tokenpreis.

Apidog noch heute ausprobieren

Dieser Beitrag zeigt Spezifikationen und Preise nebeneinander, ordnet die Anbieter-Claims ein, fasst Drittanbieter-Zahlen zusammen – alle beziehen sich auf GPT-6 Sol, nicht 6.1 – und erklärt, wie Sie den Vergleich selbst in Apidog durchführen. Details zu den einzelnen Modellen finden Sie unter Was ist GPT-6.1 Sol und Was ist Claude Sonnet 5.5.

GPT-6.1 Sol vs. Claude Sonnet 5.5: Spezifikationen und Preise

Quellen: OpenAIs Preisseite, Anthropics Sonnet-5.5-Übersicht und Preise sowie die weiter unten verlinkte GPT-6.1-Sol-Modellseite.

GPT-6.1 Sol Claude Sonnet 5.5
Model-ID gpt-6.1-sol claude-sonnet-5-5 (Bedrock: anthropic.claude-sonnet-5-5)
Veröffentlicht 29. Sep. 2026 28. Sep. 2026
Input / Output pro 1 Mio. 2 $ / 10 $ 2 $ / 10 $
Cache-Lesevorgänge pro 1 Mio. 0,10 $ 0,20 $
Cache-Schreibvorgänge pro 1 Mio. 2,50 $ 2,50 $ (5 Minuten), 4 $ (1 Stunde)
Batch pro 1 Mio. 1 $ / 5 $ 1 $ / 5 $
Prompts über 272K Input-Tokens 4 $ Input, 0,20 $ gecacht, 15 $ Output für die gesamte Anfrage Kein Aufpreis innerhalb des 1M-Fensters
Schnellere Stufe Fast für 4 $ / 20 $; Ultraschnell „demnächst verfügbar“ Kein schneller Modus verfügbar
Kontextfenster 1.050.000 (922.000 max. Input) 1 Mio.
Max. Output 128.000 128K (300K im Batch mit Beta-Header)
Wissensstichtag 30. Apr. 2026 Juni 2026
Anstrengungsstufen low, medium (Standard), high, xhigh, max; kein none low, medium, high (API-Standard), xhigh, max; Denken kann nicht abgeschaltet werden (niedrigste Einstellung: between_tools)
API-Form Responses (mit Tools), Chat Completions (ohne Tools), Batch Messages, Batch
Andere Plattformen OpenRouter (openai/gpt-6.1-sol) Bedrock, Google Cloud, Microsoft Foundry, Claude Platform auf AWS
Kostenloser Zugang Keiner. Plus, Pro, Business, Enterprise und Edu erhalten es in ChatGPT Work und Codex, nicht Chat; Enterprise und Edu nach Administrator-Aktivierung laut Modelldokumentation. Kein kostenloser API-Tier. Jeder kann auf Claude.ai damit chatten; die API wird pro Token abgerechnet.

Für die Kosten sind insbesondere zwei Zeilen relevant:

  1. Cache-Lesevorgänge: GPT-6.1 Sol berechnet dafür die Hälfte von Sonnet 5.5. Wenn Sie lange System-Prompts wiederverwenden, ist OpenAI günstiger.
  2. Große Inputs: Ab 272K Input-Tokens kehrt sich der Vorteil um. Laut der GPT-6.1-Sol-Modellseite wird die vollständige Anfrage mit dem Doppelten der Input- und Cache-Raten sowie dem 1,5-Fachen der Output-Rate berechnet. Sonnet 5.5 bleibt bei 2 $ Input und 10 $ Output.

Ein ungecachter Prompt mit 400.000 Tokens und einer Antwort mit 5.000 Tokens kostet damit ungefähr 1,68 $ bei GPT-6.1 Sol und 0,85 $ bei Sonnet 5.5.

Was jeder Anbieter beansprucht – und gegen welches Modell

OpenAI zu GPT-6.1 Sol Anthropic zu Claude Sonnet 5.5
Verglichen mit GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol (GPT-5.6 Sol in zwei Diagrammen)
Enthält das andere Modell Nein Nein, da GPT-6.1 Sol noch nicht existierte
Schlagzeile „Nahezu Astra-Intelligenz“ zum Fünftel der Standard-Tokenpreise von Astra 30 %+ schneller als Sonnet 5, bis zu 30 % weniger Kosten pro Aufgabe
Wer die Zahlen ermittelt hat OpenAI; Konkurrenzwerte stammen laut Fußnote aus öffentlichen Berichten Anthropic sowie Cognition, Cursor, Artificial Analysis und Surge AI für genannte Benchmarks

OpenAIs GPT-6.1-Sol-Launch-Post nennt diese von OpenAI gemeldeten Ergebnisse:

  • AutomationBench 1.0.6, mittlerer Aufwand: +2,2 Prozentpunkte gegenüber Opus 5.5 bei etwa einem Drittel der Kosten sowie +4,8 Prozentpunkte gegenüber GPT-6 Sol.
  • Terminal-Bench Science 0.1, maximaler Aufwand: 5,47 $ pro Aufgabe gegenüber 23,21 $ für Opus 5.5. GPT-6 Astra erzielt mit 68,1 % weiterhin den höchsten Wert.
  • OSWorld 2.0 offline, maximaler Aufwand: +7 Prozentpunkte gegenüber GPT-6 Sol bei weniger als der Hälfte der Kosten.

Anthropics Sonnet-5.5-Launch-Post enthält eine Vergleichsspalte für GPT-6 Sol:

  • FrontierCode 1.1, durchgeführt von Cognition: Sonnet 5.5 erreicht 52,1 % bei xhigh und 46,2 % bei max, verglichen mit 49,3 % für GPT-6 Sol. Bei hohem Aufwand erreicht Sonnet 5.5 laut Anthropic den besten GPT-6-Sol-Wert für etwa ein Fünftel der Kosten.
  • GDPval-AA v2.1 und AA-Briefcase v1.1, durchgeführt von Artificial Analysis: 1844 gegenüber 1487 beziehungsweise 1811 gegenüber 1483.

Die Sonnet-5.5-Benchmark-Aufschlüsselung deckt weitere Werte aus der Anthropic-Tabelle ab.

Sie sollten diese Benchmarks nicht direkt zusammenrechnen oder über gemeinsame Vergleichsmodelle „überbrücken“. Zwar erscheint Opus 5.5 in beiden Diagrammen, und beide Anbieter berichten über AutomationBench und Terminal-Bench Science. Die Testaufbauten unterscheiden sich jedoch:

  • OpenAI berichtet AutomationBench 1.0.6 mit mittlerem Aufwand im eigenen Setup.
  • Anthropics Systemkarte führt Claude-Modelle in ihrer Zusammenfassung mit maximalem Aufwand aus: Sonnet 5.5 bei 44,7, Opus 5.5 bei 42,5 und GPT-6 Sol bei 32,0.
  • Anthropic gibt 59,9 % für Sonnet 5.5 bei Terminal-Bench Science an, während OpenAI keine Rohpunktzahl für GPT-6.1 Sol im Text nennt.
  • OpenAI testete Computernutzung mit OSWorld 2.0 offline, Anthropic mit OSWorld 2.1.

Der Vergleich von GPT-6 Sol und Claude Opus 5.5 stößt auf dieselbe methodische Hürde.

Was Dritte gemessen haben: GPT-6 Sol, nicht GPT-6.1

Alle auffindbaren Drittanbieter-Vergleiche kombinieren Sonnet 5.5 mit GPT-6 Sol, nicht mit GPT-6.1 Sol. Der umfassendste Vergleich stammt von Artificial Analysis. Dessen Intelligence Index v4.3.2 aggregiert zehn Bewertungen:

Aufwand Sonnet 5.5 Index Sonnet 5.5 Kosten pro Aufgabe GPT-6 Sol Index GPT-6 Sol Kosten pro Aufgabe
medium 41 0,59 $ 40 0,25 $
high 47 1,08 $ 43 0,38 $
xhigh 52 2,74 $ 44 0,52 $
max 56 7,60 $ 48 1,05 $

Bei maximalem Aufwand misst dieselbe Seite Sonnet 5.5 mit 138 Output-Tokens pro Sekunde und GPT-6 Sol mit 76.

Die praktische Interpretation:

  • Sonnet 5.5 erzielt bei allen gezeigten Aufwandsstufen höhere Werte.
  • Sonnet 5.5 kostet trotz identischer Listenpreise mehr pro Aufgabe.
  • Der Unterschied entsteht durch den tatsächlichen Tokenverbrauch.
  • Sonnet 5.5 bei high liegt mit Index 47 und 1,08 $ pro Aufgabe nah an GPT-6 Sol bei max mit Index 48 und 1,05 $.

Auch Anthropics eigene Diagrammdaten zeigen keinen eindeutigen Gesamtsieger:

  • Bei AA-Briefcase kostet GPT-6 Sol bei jeder Aufwandsstufe weniger pro Aufgabe, etwa 0,34 $ gegenüber 1,64 $ bei medium, während Sonnet 5.5 höhere Werte erzielt.
  • Bei FrontierCode erreicht Sonnet 5.5 bei high 49,4 % für 0,42 $ pro Aufgabe. GPT-6 Sol erreicht 49,3 % bei max für 2,07 $.

Diese Zahlen beziehen sich ausschließlich auf die ältere Sol-Version. OpenAI sagt, dass GPT-6.1 Sol GPT-6 Sol bei mehreren Benchmarks mit gleichem oder geringerem Aufwand übertrifft. Sobald Drittanbieter GPT-6.1 Sol testen, kann sich die Einordnung ändern.

Wo jedes Modell laut Anbieterangaben wahrscheinlich stärker ist

GPT-6.1 Sol

OpenAI positioniert GPT-6.1 Sol für komplexe Programmierung, Computernutzung und professionelle Aufgaben, wenn Sie eine nahezu Astra-ähnliche Leistung zu geringeren Kosten benötigen.

Die genannten Stärken sind:

  • agentenbasierte Automatisierung,
  • Computernutzung,
  • wissenschaftliche Aufgaben,
  • weniger Sachfehler bei geringem Aufwand.

Bei den Kosten ist GPT-6.1 Sol besonders interessant für Cache-intensive Workloads unter 272K Input-Tokens. Außerdem ist es von beiden Modellen das einzige mit einer kostenpflichtigen Geschwindigkeitsstufe: Fast.

Claude Sonnet 5.5

Anthropic positioniert Sonnet 5.5 für klar definierte Alltagsaufgaben, Fehlerbehebung sowie ausgefeilte Dokumente, Präsentationen und Tabellenkalkulationen. Anthropic sagt außerdem, dass Opus 5.5 bei komplexen, offenen Aufgaben deutlich stärker bleibt; siehe Sonnet 5.5 vs. Opus 5.5.

Die gemeldeten Stärken sind:

  • agentenbasierte Programmierung, darunter 70,6 % bei Terminal-Bench 4.0 mit max, durchgeführt von Anthropic,
  • Wissensarbeit,
  • Computernutzung, darunter 80,1 % teilweise bei OSWorld 2.1.

Bei den Kosten ist Sonnet 5.5 für Prompts über 272K Tokens attraktiver. Es läuft außerdem auf Bedrock, Google Cloud und Microsoft Foundry.

Beachten Sie beim Testen zwei Unterschiede:

  1. Abweichende Standard-Aufwandsstufen: GPT-6.1 Sol nutzt standardmäßig medium, Sonnet 5.5 in der API high. Vergleichen Sie daher mehrere passende Einstellungen.
  2. Keine frei kombinierbaren Sampling-Regler: Sonnet 5.5 antwortet mit HTTP 400 bei nicht standardmäßigen Werten für temperature, top_p oder top_k. OpenAIs GPT-6-Anleitung empfiehlt, temperature und top_p zu senken, wenn der Aufwand nicht none ist.

Führen Sie pro Prompt mehrere Wiederholungen aus, um Varianz nicht fälschlich als Modellunterschied zu bewerten.

Führen Sie den Vergleich selbst in Apidog durch

Wählen Sie zuerst 20 bis 50 Aufgaben aus Ihrem realen Traffic. Jede Aufgabe sollte eine überprüfbare Antwort besitzen, beispielsweise ein JSON-Feld, ein Klassifikationslabel oder einen exakten erwarteten Wert.

1. Umgebung und Geheimnisse anlegen

Erstellen Sie in Apidog eine Umgebung mit diesen Variablen:

  • OPENAI_API_KEY
  • ANTHROPIC_API_KEY
  • EFFORT

Speichern Sie die API-Schlüssel als Geheimnisse.

2. Zwei Anfragen mit demselben Prompt anlegen

Legen Sie zwei Requests an, die beide {{prompt}} verwenden. Die API-Formen unterscheiden sich: siehe die Responses-Referenz, die Messages-Referenz und den Vergleich der API-Formate.

OpenAI Responses API:

POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
 "max_output_tokens": 25000, "input": "{{prompt}}"}
Enter fullscreen mode Exit fullscreen mode

Anthropic Messages API:

POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{"model": "claude-sonnet-5-5", "max_tokens": 25000,
 "output_config": {"effort": "{{EFFORT}}"},
 "messages": [{"role": "user", "content": "{{prompt}}"}]}
Enter fullscreen mode Exit fullscreen mode

3. Assertions für API-Erfolg, Inhalt und Tokenverbrauch hinzufügen

Ergänzen Sie Assertions für die jeweilige Antwortform und eine fachliche Assertion gegen eine expected-Spalte in Ihrer Testdatei.

Überprüfung OpenAI Responses Anthropic Messages
Normal beendet $.status gleich completed $.stop_reason gleich end_turn
Antwort vorhanden $.output[*].type enthält message $.content[*].type enthält text
Output-Tokens inklusive Begründung $.usage.output_tokens $.usage.output_tokens
Cache-Lesevorgänge $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
Cache-Schreibvorgänge $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens

4. Kosten pro Antwort berechnen

Berechnen Sie die Kosten in einem Post-Processor-Skript.

Bei OpenAI enthält input_tokens auch gecachte Tokens und Cache-Schreib-Tokens. Ziehen Sie diese ab, bevor Sie den regulären Satz von 2 $ pro Million Input-Tokens anwenden. Details dazu stehen in der OpenAI-Dokumentation zu Prompt Caching.

Bei Anthropic zählt input_tokens nur Tokens nach dem letzten Cache-Haltepunkt. Siehe Anthropic Prompt Caching.

Wenden Sie auf der OpenAI-Seite außerdem die 272K-Regel an.

5. Szenario mit CSV-Daten ausführen

Legen Sie beide Anfragen in einem Testszenario ab. Speichern Sie Ihre Prompts in einer CSV-Datei:

  • ein Prompt pro Zeile,
  • keine doppelten Anführungszeichen,
  • Prompt-Inhalt möglichst in einer einzelnen Zeile.

Führen Sie das Szenario mit der Apidog CLI für jede relevante Aufwandsstufe aus:

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Teilen Sie anschließend die Gesamtausgaben durch die Anzahl erfolgreich abgeschlossener Aufgaben. Das Ergebnis sind Ihre Kosten pro erfolgreicher Aufgabe.

Führen Sie mindestens medium und high für beide Modelle aus. Derselbe Aufwandsname ist bei den Anbietern nicht zwingend gleich kalibriert.

Für konkrete Request-Details siehe den GPT-6.1-Sol-API-Leitfaden und So verwenden Sie die Claude-Sonnet-5.5-API.

FAQ

Ist GPT-6.1 Sol günstiger als Claude Sonnet 5.5?

Der Listenpreis ist identisch: 2 $ Input und 10 $ Output pro Million Tokens. GPT-6.1 Sol hat günstigere Cache-Lesevorgänge, während Sonnet 5.5 bei mehr als 272K Input-Tokens günstiger ist. Die tatsächlichen Kosten hängen vom Tokenverbrauch pro Aufgabe ab.

Welches Modell ist besser beim Programmieren?

Es gibt keinen gemeinsamen Benchmark für GPT-6.1 Sol und Sonnet 5.5. Anthropic berichtet, dass Sonnet 5.5 bei FrontierCode besser als GPT-6 Sol abschneidet. OpenAI berichtet, dass GPT-6.1 Sol den besten DeepSWE-Wert von GPT-6 Sol um 6,4 Prozentpunkte übertrifft. Testen Sie beide Modelle mit Aufgaben aus Ihrem eigenen Repository.

Welches Modell ist schneller?

Artificial Analysis maß Sonnet 5.5 mit 138 Tokens pro Sekunde und GPT-6 Sol mit 76 Tokens pro Sekunde, jeweils bei maximalem Aufwand. Drittanbieter-Zahlen für GPT-6.1 Sol liegen noch nicht vor.

Ist eines der Modelle kostenlos?

GPT-6.1 Sol hat keine kostenlose Stufe. Sonnet 5.5 ist in den Chat-Apps von Claude.ai verfügbar, die API wird jedoch pro Token abgerechnet. Siehe auch Claude Sonnet 5.5 kostenlos nutzen.

Wählen Sie durch Ausführen beider Modelle

Nehmen Sie zehn Aufgaben aus Ihrem Backlog. Führen Sie beide Modelle bei medium und high aus. Vergleichen Sie anschließend Qualität, Erfolgsrate, Latenz und Kosten pro erfolgreicher Aufgabe.

Laden Sie Apidog herunter, um beide Requests als wiederverwendbares Szenario zu speichern. So können Sie den Test erneut ausführen, sobald Artificial Analysis Werte für GPT-6.1 Sol veröffentlicht oder einer der Anbieter einen neuen Snapshot liefert.

Top comments (0)