Gemini 3.8 Flash vs. Claude Fable 5.1 vs. GPT-5.6 Sol: Preise, Benchmarks und die richtige API
Drei wichtige APIs wurden innerhalb einer Woche veröffentlicht oder neu bepreist – und sie liegen in drei unterschiedlichen Preisstufen. Google veröffentlichte Gemini 3.8 Flash am 2. September 2026 für 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens. Anthropic veröffentlichte Claude Fable 5.1 am Vortag für 10 $ beziehungsweise 50 $. OpenAIs GPT-5.6 Sol liegt mit 5 $ und 30 $ dazwischen. Auf dem unabhängigen Intelligence Index von Artificial Analysis erreichen die Modelle 59, 57 und 59 Punkte. Kurz gesagt: Ein Modell, das etwa ein Dreizehntel des Preises der Spitzenklasse kostet, erzielt auf dem einzigen Index, der alle drei Modelle einheitlich testet, dieselbe Punktzahl.
Der entscheidende Vorbehalt betrifft das Wort „Index“. Benchmarks zählen Antworten pro Aufgabe, während API-Rechnungen Tokens pro Aufgabe zählen. Gemini 3.8 Flash ist darauf ausgelegt, bei schwierigen Aufgaben mehr Tokens zu verbrauchen.
Dieser Vergleich betrachtet:
- die technischen Spezifikationen,
- Googles eigene Benchmark-Tabellen,
- die unabhängigen Zahlen von Artificial Analysis,
- die Preisunterschiede,
- und eine praktische Regel für die API-Auswahl.
Der Gemini-3.8-Flash-Artikel behandelt das Modell ausführlich. Googles Launch-Beitrag ist die primäre Quelle für die Google-Angaben.
Hinweis zum Timing: Unser Vergleich von Gemini 3.7 Flash, Claude und GPT vom August bezog sich auf Claude Fable 5. Anthropic hat dieses Modell am 1. September ersetzt. Der folgende Vergleich ist daher eine neue Gegenüberstellung und keine Aktualisierung.
Spezifikationen auf einen Blick
| Merkmal | Gemini 3.8 Flash | Claude Fable 5.1 | GPT-5.6 Sol |
|---|---|---|---|
| Anbieter | Anthropic | OpenAI | |
| Kontextfenster | 1.048.576 Tokens | 1M Tokens | 1M Tokens |
| Maximale Ausgabe | 65.536 Tokens | 128K Tokens | 128K Tokens |
| Eingabepreis pro 1M Tokens | 0,75 $ Einführungspreis, 1,50 $ ab 1. Januar 2027 | 10 $ | 5 $ |
| Ausgabepreis pro 1M Tokens | 3,75 $ Einführungspreis, 7,50 $ ab 1. Januar 2027 | 50 $ | 30 $ |
| Cache-Lesen pro 1M Tokens | 0,075 $ Einführungspreis, 0,15 $ ab 1. Januar 2027 | 0,25 $ | 0,50 $ |
| Wissensstand | März 2026 | Juni 2026 | Nicht aufgeführt |
| Schlussfolgerungskontrolle |
thinking_level: low / medium / high; medium ist Standard |
Erweitertes Denken, immer aktiv | Anstrengungsstufen bis xhigh |
| Artificial Analysis Index | 59 bei high | 57 bei medium | 59 bei xhigh |
Zwei Punkte fallen sofort auf:
- Gemini 3.8 Flash hat mit 65.536 Tokens nur halb so viel maximale Ausgabe wie die beiden anderen Modelle. Das ist bei einzelnen langen Dokumenten relevant, weniger bei Agenten-Loops mit kurzen Zwischenschritten.
- Der Einführungspreis endet am 31. Dezember 2026. Ab dem 1. Januar 2027 verdoppeln sich beide Gemini-Preise. Der Preisleitfaden für Gemini 3.8 Flash behandelt außerdem Caching, Batch und Grounding.
Die unabhängige Zahl: 59, 57, 59
Artificial Analysis führt für jedes Modell dieselben neun Evaluationen durch und veröffentlicht daraus eine Intelligence-Index-Punktzahl:
- Gemini 3.8 Flash: 59 Punkte bei hoher Denkleistung
- GPT-5.6 Sol: 59 Punkte bei xhigh
- Claude Fable 5.1: 57 Punkte bei medium
- Gemini 3.7 Flash: 56 Punkte
- Gemini 3.6 Flash: 52 Punkte
- Grok 4.6: 59 Punkte bei medium
Die Einstellungen sind wichtig: Fable 5.1 wurde bei mittlerer Anstrengung getestet, Sol bei seiner höchsten Einstellung. Zwei Punkte Unterschied bei verschiedenen Denkstufen ergeben keine belastbare Rangliste.
Die vertretbare Schlussfolgerung lautet daher: Bei den getesteten Einstellungen erreicht Gemini 3.8 Flash in diesem Index die beiden Premium-Modelle und ist zugleich das günstigste Modell mit 59 Punkten.
Artificial Analysis maß auch die Kosten:
- durchschnittlich 48.000 Ausgabe-Tokens pro Aufgabe bei hoher Einstellung,
- rund 30 % mehr als Gemini 3.7 Flash,
- 0,58 $ API-Ausgaben pro Aufgabe,
- etwa 2,5 Minuten pro Aufgabe,
- ungefähr 300 Tokens pro Sekunde,
- 13,3 Sekunden bis zum ersten Token beim High-Reasoning-Lauf,
- 45 % bei τ³-Banking, 12 Punkte mehr als Gemini 3.7 Flash.
Das Modell denkt also länger, bevor es antwortet. Ein niedriger Preis pro Token bedeutet deshalb nicht automatisch niedrige Kosten pro Aufgabe.
Googles Benchmark-Tabellen: Warum Claude Fable 5.1 fehlt
Googles Flash-Modellseite veröffentlicht drei herstellerübergreifende Benchmark-Zeilen. Claude Fable 5.1 ist dort nicht enthalten. Stattdessen führt Google Claude Opus 5 und Claude Sonnet 5 auf.
Fable 5.1 war erst einen Tag öffentlich, als die Tabellen erstellt wurden. Die Anthropic-Spalten unten beziehen sich daher auf Opus 5 und Sonnet 5 – nicht auf das 10-$-/50-$-Modell dieses Artikels.
| Benchmark von Google | Gemini 3.8 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|
| HLE-Verified | 54,9 % | 54,4 % | 31,0 % | 54,5 % | 51,1 % |
| Vals Finance Agent v2 | 61,4 % | 58,6 % | 53,9 % | 53,8 % | 54,4 % |
| Harvey Legal Agent Benchmark | 10,0 % | 6,7 % | 5,0 % | 2,5 % | 0,8 % |
Interpretation
- HLE-Verified: praktisch ein Gleichstand. Gemini, Opus und Sol liegen innerhalb eines halben Punktes.
- Vals Finance Agent v2: Gemini 3.8 Flash liegt 2,8 Punkte vor Opus 5 und 7,6 Punkte vor Sol.
- Harvey Legal: Alle Modelle liegen unter 11 %. Die Reihenfolge ist aussagekräftiger als die kleinen absoluten Unterschiede.
Ebenso wichtig sind die fehlenden Daten: Google veröffentlicht für Gemini 3.8 Flash keine Textwerte für SWE-Bench Pro, Terminal-Bench oder OSWorld. Das DeepSWE-v1.1-Ergebnis erscheint nur als Aussage, das Modell übertreffe „die meisten größeren Frontier-Modelle“ zu „einem Bruchteil der Kosten“; die konkrete Zahl steht in einer Bildtabelle.
Für Coding- und Computer-Use-Vergleiche müssen daher die jeweiligen Anbieter-Benchmarks herangezogen werden:
Da kein Anbieter das Modell des jeweils anderen ausgeführt hat, bleibt Artificial Analysis die einzige direkt vergleichbare Quelle.
Die Preisspanne im Detail
Zu Einführungspreisen ist der Unterschied eindeutig:
- Fable 5.1 kostet bei der Eingabe 13,3-mal mehr als Gemini 3.8 Flash.
- Bei der Ausgabe beträgt der Faktor ebenfalls 13,3.
- Sol kostet bei der Eingabe 6,7-mal mehr.
- Bei der Ausgabe liegt der Faktor bei 8.
Beim Cache-Lesen wird die Lücke kleiner:
- Gemini 3.8 Flash: 0,075 $
- Claude Fable 5.1: 0,25 $, also 3,3-mal mehr
- GPT-5.6 Sol: 0,50 $, also 6,7-mal mehr
Fable 5.1 hat damit die günstigste Cache-Lesezeile unter den beiden Premium-Modellen.
Beispielrechnung
Angenommen, ein Lauf verbraucht 1 Million Eingabe-Tokens und 200.000 Ausgabe-Tokens, vollständig ohne Cache:
- Gemini 3.8 Flash: 0,75 $ + 0,75 $ = 1,50 $
- GPT-5.6 Sol: 5,00 $ + 6,00 $ = 11,00 $
- Claude Fable 5.1: 10,00 $ + 10,00 $ = 20,00 $
Ab dem 1. Januar 2027 kostet derselbe Gemini-Lauf 3,00 $. Dann sinken die Preisfaktoren auf etwa 3,7 gegenüber Sol und 6,7 gegenüber Fable 5.1.
Die Verdopplung gilt auch für Gemini 3.6 Flash und 3.7 Flash. Es gibt also keine günstigere Gemini-Flash-Version, auf die man ausweichen könnte. Die Preisseite von Anthropic, der Claude-Fable-5.1-Preisleitfaden und der GPT-5.6-Preisleitfaden enthalten weitere Batch- und Cache-Preise.
Kosten pro Aufgabe statt pro Token
Google weist ausdrücklich darauf hin, dass Gemini 3.8 Flash bei langen und komplexen Aufgaben mehr Tokens verbrauchen kann. Das Modell zerlegt schwierige Probleme in kleinere Denkschritte, überprüft seine Arbeit und ruft Tools iterativ auf.
Artificial Analysis beobachtete:
- Gemini 3.7 Flash: 0,40 $ pro Aufgabe
- Gemini 3.8 Flash bei unveränderten Pro-Token-Preisen: 0,58 $ pro Aufgabe bei high
- Gemini 3.8 Flash bei medium: 0,41 $
- Gemini 3.8 Flash bei low: 0,24 $
Daraus folgen zwei praktische Regeln:
- Eine 13,3-fache Preislücke pro Token ist nicht automatisch eine 13,3-fache Kostenlücke pro Aufgabe. Ein Premium-Modell kann mit weniger Tokens oder weniger Tool-Aufrufen zum Ziel kommen.
- Bei Gemini ist
thinking_levelder wichtigste Kostenhebel. Der Wechsel von high zu low reduzierte die Kosten pro Aufgabe im Artificial-Analysis-Datensatz um mehr als die Hälfte. Der Leitfaden zu den Denkstufen zeigt, wie die Einstellung pro Endpunkt vorgenommen wird.
Für einen direkten Vergleich unter realen Bedingungen ist der Vergleich von Gemini 3.8 Flash und 3.7 Flash hilfreich: In bestimmten Szenarien ist das ältere Modell trotz 31 % niedrigerer Kosten pro Aufgabe der bessere Kauf.
Welches Modell für welche Aufgabe?
Gemini 3.8 Flash für Volumen und kostengünstige Agenten
Wählen Sie Gemini 3.8 Flash als Standardmodell, wenn Sie täglich Tausende Agenten-Aufgaben ausführen. Es:
- erreicht im unabhängigen Index die Premium-Modelle,
- führt Googles Finanz- und Rechtsagenten-Rankings an,
- bleibt selbst nach der Preiserhöhung deutlich günstiger,
- akzeptiert nativ Video-, Audio- und PDF-Eingaben,
- bietet Batch mit 50 % Rabatt,
- enthält 5.000 kostenlose Google-Search-Grounding-Anfragen pro Monat,
- und stellt einen kostenlosen Tarif für Prototyping bereit.
Die Kompromisse:
- nur Textausgabe,
- keine Live-API,
- maximal 65.536 Ausgabe-Tokens,
- potenziell hoher Token-Verbrauch bei medium und high.
Claude Fable 5.1 für besonders komplexe Schlussfolgerungen
Fable 5.1 ist ein Eskalationsmodell, nicht unbedingt das beste Startmodell. Es eignet sich für Aufgaben, bei denen eine falsche Antwort teurer ist als zusätzliche Tokens:
- mehrstündige Recherche-Agenten,
- lange Terminalsitzungen,
- komplexe Schlussfolgerungsketten,
- Workflows, bei denen günstigere Modelle die Evaluationen nicht bestehen.
Die 128K-Ausgabe und Cache-Lesevorgänge für 0,25 $ sind besonders nützlich für Agenten-Loops, die in jeder Runde denselben großen Kontext wiederverwenden. Dadurch fällt der effektive Preisfaktor deutlich kleiner aus als 13,3. Das Datenblatt zu Claude Fable 5.1 enthält weitere Details.
GPT-5.6 Sol für Agenten im OpenAI-Ökosystem
GPT-5.6 Sol erreicht bei xhigh 59 Punkte, liegt bei HLE-Verified praktisch gleichauf mit Gemini 3.8 Flash und bietet 128K Ausgabe für 5 $ / 30 $.
Sol ist eine gute Wahl, wenn sich Ihre Agenten, Evaluationen und Tools bereits im OpenAI-Stack befinden und Sie keinen zweiten Anbieter integrieren möchten. Die Cache-Lesevorgänge sind mit 0,50 $ jedoch am teuersten. Sol passt daher besser zu frischen Kontexten als zu langen, stark gecachten Sitzungen.
Der Vergleich von Grok 4.6, GPT-5.6 und Claude Fable 5 ordnet Sol gegenüber dem vorherigen Anthropic-Flaggschiff ein.
Alle drei Modelle in Apidog testen
Die beste Auswahl basiert auf Ihren eigenen Prompts. Apidog führt die Modelle nicht selbst aus, ermöglicht aber, dieselbe Anfrage schnell an alle drei Anbieter zu senden und die Ergebnisse zu vergleichen.
1. Drei Umgebungen einrichten
Erstellen Sie ein Projekt mit drei Umgebungen:
-
Gemini: Basis-URL
https://generativelanguage.googleapis.comundGEMINI_API_KEY - Anthropic: Anthropic-Basis-URL und Claude-Schlüssel
- OpenAI: OpenAI-Basis-URL und OpenAI-Schlüssel
Speichern Sie Schlüssel ausschließlich als Umgebungsvariablen – niemals im Anfragetext oder in einer geteilten Sammlung.
2. Ein Testszenario erstellen
Fügen Sie drei Anfrageschritte hinzu, die denselben Prompt verwenden.
Der Gemini-Schritt sendet an /v1beta/interactions und enthält:
{
"model": "gemini-3.8-flash",
"thinking_level": "medium"
}
Die anderen beiden Schritte verwenden den Chat- beziehungsweise Messages-Endpunkt des jeweiligen Anbieters.
Fügen Sie pro Schritt Assertions hinzu für:
- HTTP-Status
200, - einen JSON-Pfad, der eine vorhandene Antwort bestätigt,
- eine Obergrenze für das Token-Nutzungsfeld.
Bei Gemini ist das Feld beim Legacy-Endpunkt usageMetadata.thoughtsTokenCount. Für Claude und OpenAI prüfen Sie den entsprechenden Nutzungsblock.
3. Golden Prompts täglich ausführen
Führen Sie das Szenario mit einer Sammlung repräsentativer Golden Prompts aus und planen Sie den Lauf täglich. Wenn sich Standardeinstellungen ändern oder ein Modell plötzlich doppelt so viele Denktokens verbraucht, schlägt die Assertion fehl, bevor die Rechnung unerwartet steigt.
Weitere Informationen:
Häufig gestellte Fragen
Ist Gemini 3.8 Flash besser als Claude Fable 5.1?
Im Artificial-Analysis-Index erreicht Gemini 3.8 Flash bei high 59 Punkte und Fable 5.1 bei medium 57 Punkte. Bei den getesteten Einstellungen liegen sie daher nah beieinander.
Googles Tabellen enthalten Fable 5.1 nicht, während Anthropics Benchmarks Gemini 3.8 Flash nicht enthalten. Ein breiterer direkter Vergleich fehlt somit. Beim Preis pro Token ist Gemini zum Einführungspreis 13,3-mal günstiger.
Welches Modell ist für Agenten-Workloads am günstigsten?
Gemini 3.8 Flash ist pro Token mit großem Abstand am günstigsten: 0,75 $ / 3,75 $ bis zum 31. Dezember 2026.
Artificial Analysis maß 0,58 $ pro Aufgabe bei high, 0,41 $ bei medium und 0,24 $ bei low. Da Gemini etwa 30 % mehr Ausgabe-Tokens als 3.7 Flash verbraucht, sollten Sie trotzdem die Kosten pro abgeschlossener Aufgabe messen.
Haben alle drei Modelle ein 1M-Kontextfenster?
Ja. Gemini 3.8 Flash akzeptiert 1.048.576 Eingabe-Tokens. Fable 5.1 und GPT-5.6 Sol listen jeweils 1M Tokens auf.
Die maximale Ausgabe unterscheidet sich:
- Gemini 3.8 Flash: 65.536 Tokens
- Claude Fable 5.1: 128K Tokens
- GPT-5.6 Sol: 128K Tokens
Warum fehlt Claude Fable 5.1 in Googles Benchmark-Tabellen?
Googles veröffentlichte Tabellen enthalten Claude Opus 5 und Claude Sonnet 5. Fable 5.1 wurde am 1. September veröffentlicht, einen Tag vor Gemini 3.8 Flash, und war daher noch nicht enthalten.
Die eigenen Anthropic-Zahlen finden Sie im Vergleich von Claude Fable 5.1 und Opus 5.
Bleibt der Gemini-Preisvorteil nach 2027 bestehen?
Teilweise. Ab dem 1. Januar 2027 steigt Gemini 3.8 Flash auf 1,50 $ / 7,50 $.
Damit kostet:
- Fable 5.1 bei der Eingabe 6,7-mal mehr,
- Sol bei der Eingabe 3,3-mal mehr,
- Fable 5.1 bei der Ausgabe 6,7-mal mehr,
- Sol bei der Ausgabe 4-mal mehr.
Gemini bleibt günstiger, aber die Lücke halbiert sich ungefähr.
Welches Modell sollten Sie zuerst aufrufen?
Beginnen Sie mit Gemini 3.8 Flash für Aufgaben, die Sie in großem Umfang ausführen. Legen Sie thinking_level pro Route fest und überwachen Sie Tokens pro Aufgabe statt nur den Listenpreis.
Eskalieren Sie zu Claude Fable 5.1, wenn günstigere Modelle Ihre Evaluationen nicht bestehen und große Kontexte über mehrere Runden gecacht werden.
Verwenden Sie GPT-5.6 Sol, wenn Ihr übriger Stack auf OpenAI basiert und Sie eine Premium-Stufe ohne zweiten Anbieter benötigen.
Führen Sie unabhängig von der Entscheidung denselben Prompt zunächst in einem Testszenario durch alle drei APIs. Das Preisverhältnis ist öffentlich – das Kosten-pro-Aufgabe-Verhältnis für Ihre Workloads müssen Sie selbst messen.
Top comments (0)