Gemini 3.8 Flash vs. 3.7 Flash: Lohnt sich das Upgrade?
Google hat Gemini 3.8 Flash am 2. September 2026 veröffentlicht – drei Wochen nach Gemini 3.7 Flash und sechs Wochen nach 3.6 Flash. Einführungspreis, Kontextfenster und Geschwindigkeit bleiben praktisch unverändert: 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token bis zum 31. Dezember, 1 Mio. Kontext-Token und laut Google ungefähr dieselbe Geschwindigkeit. Neu ist die Arbeitsweise: Das Modell zerlegt schwierige Aufgaben in kleinere Denk- und Argumentationsschritte, prüft seine Ausgaben selbst und ruft Tools iterativ auf. Dadurch steigen die Benchmark-Ergebnisse – aber auch der Tokenverbrauch pro Aufgabe.
Die relevante Upgrade-Frage lautet daher nicht nur: „Ist 3.8 Flash besser?“ Auf dem Papier ja. Entscheidend ist, ob die zusätzliche Qualität den höheren Tokenverbrauch rechtfertigt und ob die Breaking Changes Ihren Code betreffen.
Google sagt außerdem, dass Gemini 3.7 Flash weiterhin vollständig unterstützt wird. Ein Support-Enddatum wurde nicht veröffentlicht. Ein sofortiger Wechsel ist daher nicht erforderlich.
Gemini 3.8 Flash und 3.7 Flash im Vergleich
| Merkmal | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| Modell-ID | gemini-3.8-flash |
gemini-3.7-flash |
| Veröffentlichung | 2. September 2026 | 13. August 2026 |
| Basis | Laut Modellkarte auf 3.7 Flash basierend | – |
| Kontext / maximale Ausgabe | 1.048.576 / 65.536 Token | Gleich |
| Einführungspreis Eingabe (bis 31. Dezember 2026) |
0,75 $ pro Million Token | 0,75 $ pro Million Token |
| Einführungspreis Ausgabe (bis 31. Dezember 2026) |
3,75 $ pro Million Token, Denkprozess inklusive | 3,75 $ pro Million Token, Denkprozess inklusive |
| Standardpreis ab 1. Januar 2027 | 1,50 $ / 7,50 $ | 1,50 $ / 7,50 $ |
| Kontext-Cache-Lesen | 0,075 $ pro Million Token bei Einführung | Gleich |
| Batch | 50 % Rabatt, gleiche Warteschlangen-Tokenstufen | Gleich |
| Denk-/Argumentationsstufen |
low, medium (Standard), high
|
low, medium, high
|
minimal |
Validierungsfehler | Akzeptiert; laut Migrationshinweis auf low abbilden |
| Wissensstand | März 2026 | In den 3.8-Dokumenten nicht erneut aufgeführt |
| Ausgabe-Geschwindigkeit (Artificial Analysis) |
Rund 300 Token/s; gemessen: 302,1 bei high
|
Laut Google ungefähr gleich schnell |
| Artificial-Analysis-Intelligenzindex | 59 bei high
|
56 bei high
|
| Support | Aktuell | Vollständig unterstützt, kein Enddatum |
Was unverändert bleibt
Preis und Kontingente
Beide Modelle verwenden dieselben Preisstufen:
- 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token bis zum 31. Dezember 2026
- 1,50 $ pro Million Eingabe-Token und 7,50 $ pro Million Ausgabe-Token ab dem 1. Januar 2027
- Kontext-Cache-Lesen: 0,075 $ pro Million Token bei Einführung
- 50 % Batch-Rabatt
- 5.000 kostenlose Google-Search-Grounding-Anfragen pro Monat, geteilt über alle Gemini-3.x-Modelle
Die detaillierten Spezifikationen und Preisreferenzen von Gemini 3.7 Flash gelten daher weitgehend auch für 3.8 Flash.
Kontext, Ein- und Ausgabe
Beide Modelle unterstützen:
- 1.048.576 Eingabe-Token
- 65.536 Ausgabe-Token
- Text, Bild, Video, Audio und PDF als Eingabe
- Text als Ausgabe
Nicht unterstützt werden Audio-Generierung, Bild-Generierung und die Live API.
Geschwindigkeit
Google beschreibt 3.8 Flash als Modell mit „gleichem Preis wie 3.7“ und „ungefähr gleicher Geschwindigkeit“.
Artificial Analysis maß bei Gemini 3.8 Flash ungefähr 302,1 Ausgabe-Token pro Sekunde bei high. Das ist der Durchsatz, sobald die Ausgabe beginnt. Die Zeit bis zum ersten Token betrug im selben Test 13,30 Sekunden, weil das Modell bei high zunächst argumentiert.
API-Oberfläche
Die Interactions API ist Googles primärer Pfad für Gemini 3.x. Der bisherige generateContent-Endpunkt bleibt vollständig unterstützt; ein Enddatum gibt es nicht.
In vielen Fällen reicht es, in einer bestehenden 3.7-Integration den Modellnamen auf gemini-3.8-flash zu ändern. Die Ausnahmen stehen im Abschnitt Breaking Changes.
Was sich verbessert
Google bezeichnet Gemini 3.8 Flash als „unser intelligentestes Flash-Modell“. Es wurde insbesondere für folgende Szenarien entwickelt:
- Softwareentwicklung mit langen Zeithorizonten
- autonome Agenten
- komplexe Unternehmens-Workflows
- iterative Tool-Nutzung
- dokumentenlastige Aufgaben
Bei schwierigen Aufgaben führt das Modell zusätzliche Denk- und Argumentationsschritte aus, ruft Tools in Schleifen auf und überprüft seine Arbeit während der Ausführung.
Googles Benchmarks
Google veröffentlichte auf der DeepMind-Flash-Seite drei numerische Vergleiche mit 3.7 Flash:
| Benchmark | 3.8 Flash | 3.7 Flash | Differenz |
|---|---|---|---|
| Vals Finance Agent v2 | 61,4 % | 59,0 % | +2,4 |
| HLE-Verified | 54,9 % | 53,6 % | +1,3 |
| Harvey Legal Agent Benchmark | 10,0 % | 8,8 % | +1,2 |
Die Zuwächse sind nicht spektakulär, aber konstant. In Googles Tabelle übertrifft 3.8 Flash außerdem größere Modelle, darunter Claude Opus 5 mit 58,6 % bei Vals Finance und 54,4 % bei HLE-Verified. Der Dreiervergleich mit Claude Fable 5.1 und GPT-5.6 Sol führt diesen Vergleich weiter.
Unabhängige Ergebnisse von Artificial Analysis
Artificial Analysis bewertet Gemini 3.8 Flash bei high mit 59 Punkten auf dem eigenen Intelligenzindex:
- Gemini 3.6 Flash: 52
- Gemini 3.7 Flash: 56
- Gemini 3.8 Flash: 59
Damit liegt 3.8 Flash auf dem Niveau von GPT-5.6 Sol bei xhigh und Grok 4.6 bei medium. Es liegt einen Punkt über Claude Fable 5.1 bei medium.
Für Tool-Nutzung ist der τ³-Banking-Wert relevanter: Gemini 3.8 Flash erreichte 45 %, zwölf Punkte mehr als Gemini 3.7 Flash. Wenn Ihre Agenten tatsächlich Tools aufrufen, ist dieser Wert aussagekräftiger als ein allgemeiner Intelligenzindex.
Dokumentenlastige Agenten-Workflows
Google behauptet, Gemini 3.8 Flash erledige bei langlaufenden, dokumentenlastigen Workflows mehr als dreimal so viele Aufgaben wie Gemini 3.7 Flash.
Das Ergebnis stammt aus einer internen Bewertung und ist kein öffentlich reproduzierbarer Benchmark. Es ist daher eher als Richtungsangabe zu verstehen. Die Behauptung passt jedoch zur Architektur des Modells: Zusätzliche Prüfschritte helfen besonders bei Workflows, in denen ein einzelner Fehler einen 40-Schritte-Prozess scheitern lassen kann.
Codierung
Bei DeepSWE v1.1 erreichte Gemini 3.7 Flash 65,3 %, gegenüber 49,0 % bei Gemini 3.6 Flash.
Google sagt, Gemini 3.8 Flash übertreffe dort „die meisten größeren Frontier-Modelle“ zu einem Bruchteil der Kosten. Der genaue 3.8-Prozentwert steht allerdings nur in den Bildtabellen der Modellkarte und nicht im veröffentlichten Text. Deshalb wird hier keine Zahl angegeben.
Für SWE-Bench Pro, Terminal-Bench und OSWorld veröffentlichte Google im Text ebenfalls keine 3.8-Flash-Werte. Wenn diese Benchmarks für Ihre Entscheidung wichtig sind, sollten Sie unabhängige Tests abwarten.
Sicherheit und Prompt-Injection-Resistenz
Google meldet einen „signifikanten Sprung“ bei Gray-Swan-Prompt-Injection-Tests, ohne genaue Zahlen zu veröffentlichen.
Die in der Modellkarte angegebenen Änderungen gegenüber 3.7 Flash sind kleiner:
- Mehrsprachige Sicherheit: +5,4 Punkte
- Text-zu-Text-Sicherheit: −0,4 Punkte
- Ungerechtfertigte Ablehnungen: +1,1 Punkte
Der letzte Wert bedeutet eine leichte Zunahme übermäßiger Ablehnungen.
Was das Upgrade kostet
Die Tokenpreise sind gleich geblieben. Die Kosten pro erledigter Aufgabe steigen jedoch, weil Gemini 3.8 Flash systembedingt mehr Ausgabe-Token verwenden kann – insbesondere bei höheren Denkstufen.
Artificial Analysis maß durchschnittlich 48.000 Ausgabe-Token pro Aufgabe. Das sind 30 % mehr als bei Gemini 3.7 Flash.
| Konfiguration | Kosten pro Aufgabe | Zeit pro Aufgabe |
|---|---|---|
Gemini 3.7 Flash, high
|
0,40 $ | 2,2 Min. |
Gemini 3.8 Flash, low
|
0,24 $ | 0,8 Min. |
Gemini 3.8 Flash, medium
|
0,41 $ | Nicht veröffentlicht |
Gemini 3.8 Flash, high
|
0,58 $ | 2,5 Min. |
Daraus ergeben sich drei praktische Konsequenzen:
-
Bei
highkostet 3.8 Flash rund 45 % mehr pro Aufgabe als 3.7 Flash beihighund benötigt 14 % mehr reale Rechenzeit. -
Bei
mediumliegt 3.8 Flash nahezu auf dem Preisniveau von 3.7 Flash beihigh. Ein Upgrade innerhalb desselben Budgets ist daher möglich, wennmediumfür Ihre Qualitätsanforderungen ausreicht. -
lowist die günstigste und schnellste Konfiguration. Sie eignet sich für latenzkritische Routen, auf denen 3.7 Flash bisher aus Gewohnheit mithighausgeführt wurde.
Die Preisaufschlüsselung für Gemini 3.8 Flash berücksichtigt diesen Unterschied bei täglichen Volumen. Wenn Sie pro Aufgabe bezahlen, ist das Upgrade nicht kostenlos. Die Denkstufe ist der wichtigste Regler dafür, wie viel zusätzliche Qualität Sie kaufen.
Breaking Changes
Zwei Änderungen betreffen bestehenden 3.7-Flash-Code direkt.
thinking_level: "minimal" wird abgelehnt
Gemini 3.8 Flash akzeptiert nur:
low
medium
high
Eine Konfiguration mit minimal führt zu einem Validierungsfehler. Migrieren Sie sie auf low:
{
"thinkingConfig": {
"thinkingLevel": "low"
}
}
Der Leitfaden zu Denk- und Argumentationsstufen beschreibt die Unterschiede bei Qualität, Kosten und Latenz.
Funktionsantworten brauchen call_id und name
In der Interactions API muss jedes function_result sowohl call_id als auch name enthalten.
Beim veralteten generateContent-Endpunkt benötigt jedes functionResponse die passende id und name.
Code, der Funktionsresultate bisher nur anhand des Funktionsnamens zurückgab, kann beim zweiten Durchlauf einer Tool-Schleife fehlschlagen.
Weitere Gemini-3-Regeln prüfen
Der Migrationsleitfaden von 3.7 zu 3.8 Flash empfiehlt außerdem, die folgenden Regeln zu überprüfen:
-
temperatureauf der Standardeinstellung1.0belassen. Google warnt, dass niedrigere Werte Schleifen oder schlechtere Leistung verursachen können. -
thinking_levelstatt eines Integer-Werts inthinking_budgetverwenden. -
candidate_countentfernen. - Gedankensignaturen exakt so zurückgeben, wie sie empfangen wurden.
Diese Punkte sind nicht neu für 3.8 Flash. Eine 3.7-Codebasis, die sie bisher ignoriert hat, kann dadurch beim Modellwechsel Probleme sichtbar machen.
Entscheidungsmatrix nach Arbeitslast
| Arbeitslast | Empfehlung | Begründung |
|---|---|---|
| Mehrstufige Agenten mit Tool-Aufrufen | Upgrade auf medium oder high
|
+12 Punkte bei τ³-Banking; iterative Tool-Schleifen sind der Kern von 3.8 |
| Langdokumentenextraktion und -prüfung | Upgrade | Googles Behauptung zur dreifachen Aufgabenleistung zielt genau auf diesen Fall |
| Agentengestützte Codierung in einem Testrahmen | Upgrade, dann messen | Der DeepSWE-Textwert ist nicht veröffentlicht |
| Finanz-, Rechts- und Forschungsagenten | Upgrade | Alle drei veröffentlichten Google-Vergleiche sprechen für 3.8 |
| Hochvolumige Klassifizierung, Extraktion und Chat | Bei 3.7 bleiben oder 3.8 mit low verwenden |
Die Kosten pro Aufgabe sind entscheidend |
| Latenzkritische Benutzerendpunkte | 3.8 mit low
|
0,8 Minuten pro Aufgabe gegenüber 2,2 Minuten bei 3.7 mit high
|
Workloads mit minimal Thinking |
Zuerst migrieren | Die Konfiguration verursacht einen Validierungsfehler |
| Batch-Pipelines mit Cent-genauer Kalkulation | Bei 3.7 bleiben, bis neu bewertet | Gleicher Tokenpreis, aber 30 % mehr Ausgabe-Token |
Das Muster ist eindeutig:
- Je schwieriger und länger die Aufgabe, desto eher rechtfertigt das „arbeitet härter“-Design von 3.8 Flash den höheren Tokenverbrauch.
- Je kürzer und repetitiver die Aufgabe, desto geringer ist der Qualitätsgewinn.
- Die Denkstufe entscheidet maßgeblich über Kosten und Latenz.
Beide Modelle in Apidog mit demselben Testszenario testen
Die Werte von Artificial Analysis stammen aus einem externen Testrahmen. Vor dem Wechsel in der Produktion sollten Sie Ihre eigenen Prompts mit beiden Modellen ausführen und Tokenverbrauch, Qualität und Latenz vergleichen.
Mit Apidog lässt sich ein solcher Vergleich schnell aufsetzen.
1. API-Anfrage konfigurieren
Setzen Sie GEMINI_API_KEY als Umgebungsvariable in einer Apidog-Umgebung.
Erstellen Sie anschließend eine POST-Anfrage an:
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Lesen Sie den API-Schlüssel aus der Umgebungsvariable GEMINI_API_KEY im Header x-goog-api-key.
Machen Sie model zu einer Szenario-Variablen. Verwenden Sie für beide Läufe denselben Request-Body:
{
"contents": [
{
"parts": [
{
"text": "{{golden_prompt}}"
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
}
}
}
2. Testszenario mit beiden Modellen erstellen
Erstellen Sie zwei Schritte:
- Anfrage mit
model = gemini-3.7-flash - Dieselbe Anfrage mit
model = gemini-3.8-flash
Fügen Sie für jeden Schritt Assertions hinzu für:
usageMetadata.candidatesTokenCountusageMetadata.thoughtsTokenCount- eine Obergrenze, die Ihrem Budget entspricht
- jeden JSON-Pfad, den Ihre Anwendung tatsächlich verwendet
Führen Sie das Szenario mit zehn bis zwanzig Golden Prompts aus. Der Testbericht zeigt die Antworten und Assertion-Ergebnisse beider Modelle gemeinsam. So erhalten Sie Ihre eigene Token-Differenz anstelle einer fremden Benchmark-Zahl.
3. Tokenverbrauch als Regression testen
Planen Sie das Szenario, damit ein späterer Anstieg der Denk-Token nach einem Modellupdate einen Test fehlschlagen lässt – statt erst auf der Rechnung sichtbar zu werden.
Apidog herunterladen; der kostenlose Plan deckt diesen Workflow ab. Eine Anleitung zum Planen von API-Tests in Apidog zeigt die einzelnen Schritte.
FAQ
Ist Gemini 3.8 Flash schneller als 3.7 Flash?
Nein. Google beschreibt die Geschwindigkeit als ungefähr gleich. Artificial Analysis maß bei high etwa 300 Ausgabe-Token pro Sekunde.
Da 3.8 Flash mehr Denkschritte ausführt, stieg die reale Zeit pro Aufgabe im Test jedoch leicht:
- 3.7 Flash,
high: 2,2 Minuten - 3.8 Flash,
high: 2,5 Minuten - 3.8 Flash,
low: 0,8 Minuten
Kostet Gemini 3.8 Flash mehr als 3.7 Flash?
Nicht pro Token. Beide Modelle kosten bis zum 31. Dezember 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token. Ab dem 1. Januar 2027 steigen die Preise auf 1,50 $ beziehungsweise 7,50 $.
Pro Aufgabe kostet 3.8 Flash im Artificial-Analysis-Test mehr:
- 3.7 Flash,
high: 0,40 $ - 3.8 Flash,
high: 0,58 $
Der Grund sind rund 30 % mehr Ausgabe-Token.
Wird Google Gemini 3.7 Flash einstellen?
Google sagt, dass 3.7 Flash weiterhin vollständig unterstützt wird. Ein Enddatum wurde nicht veröffentlicht. Sie können das Modell daher weiterverwenden. Der „What’s new in 3.7 Flash“-Beitrag bleibt die Referenz für diese Version.
Was ändert sich beim Wechsel zu 3.8 Flash?
Zwei Punkte:
-
thinking_level: "minimal"verursacht den Fehler400 INVALID_ARGUMENT. - Jede Funktionsantwort muss sowohl Aufruf-ID als auch Namen enthalten:
-
call_idundnamein der Interactions API -
idundnameingenerateContent
-
Die übrige Gemini-3-API bleibt unverändert.
Wie groß ist der Sprung von 3.6 zu 3.7 im Vergleich zu 3.7 zu 3.8?
Gemini 3.7 Flash war der größere Leistungssprung:
- DeepSWE: 49,0 % auf 65,3 %
- Artificial-Analysis-Index: 52 auf 56
Der Sprung zu 3.8 Flash beträgt drei Punkte beim Index und basiert stärker auf einer Neugestaltung der Token-Ausgabe und des Denkprozesses.
Für die frühere Generation siehe Gemini 3.6 Flash vs. Gemini 3.5 Flash, einschließlich der Preissenkung, mit der diese Veröffentlichungsreihe begann.
Fazit
Führen Sie ein Upgrade durch, wenn Ihre Workloads agentenbasiert, tool-lastig oder dokumentenlastig sind. In diesen Szenarien zeigen sowohl Google als auch Artificial Analysis Verbesserungen, und die zusätzlichen Token können sich durch mehr erfolgreich abgeschlossene Aufgaben amortisieren.
Bleiben Sie bei Gemini 3.7 Flash oder verwenden Sie Gemini 3.8 Flash mit low, wenn Sie kurze, repetitive Aufrufe ausführen und die Kosten pro Aufgabe entscheidend sind.
Unabhängig von der Entscheidung:
- Ersetzen Sie
minimaldurchlow. - Ergänzen Sie
call_idbeziehungsweiseidundnamein allen Funktionsantworten. - Messen Sie Tokenverbrauch, Qualität und Latenz mit Ihren eigenen Prompts.
- Automatisieren Sie den Vergleich, damit steigende Denk-Token als Testfehler erscheinen.
Quellen
- Googles Launch-Post
- What’s new in Gemini 3.8 Flash
- What Gemini 3.8 Flash is
- Gemini-API-Preise
- Spezifikationen und Preisreferenzen für Gemini 3.7 Flash
- DeepMind Flash
- Gemini 3.8 Flash vs. Claude Fable 5.1 vs. GPT-5.6 Sol
- Artificial-Analysis-Bericht
- Gemini-3.8-Flash-Modellkarte
- Preisaufschlüsselung für Gemini 3.8 Flash
- Leitfaden zu den Denk- und Argumentationsstufen
- Migrationsleitfaden von Gemini 3.7 zu 3.8 Flash
- Apidog
- API-Tests in Apidog planen
- Apidog herunterladen
- What’s new in Gemini 3.7 Flash
- Gemini 3.6 Flash vs. Gemini 3.5 Flash
Top comments (0)