DEV Community

Cover image for Gemini 3.8 Flash vs 3.7 Flash Vergleich: Was ist neu und lohnt sich ein Upgrade?
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 3.8 Flash vs 3.7 Flash Vergleich: Was ist neu und lohnt sich ein Upgrade?

Gemini 3.8 Flash vs. 3.7 Flash: Lohnt sich das Upgrade?

Google hat Gemini 3.8 Flash am 2. September 2026 veröffentlicht – drei Wochen nach Gemini 3.7 Flash und sechs Wochen nach 3.6 Flash. Einführungspreis, Kontextfenster und Geschwindigkeit bleiben praktisch unverändert: 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token bis zum 31. Dezember, 1 Mio. Kontext-Token und laut Google ungefähr dieselbe Geschwindigkeit. Neu ist die Arbeitsweise: Das Modell zerlegt schwierige Aufgaben in kleinere Denk- und Argumentationsschritte, prüft seine Ausgaben selbst und ruft Tools iterativ auf. Dadurch steigen die Benchmark-Ergebnisse – aber auch der Tokenverbrauch pro Aufgabe.

Jetzt Apidog testen

Die relevante Upgrade-Frage lautet daher nicht nur: „Ist 3.8 Flash besser?“ Auf dem Papier ja. Entscheidend ist, ob die zusätzliche Qualität den höheren Tokenverbrauch rechtfertigt und ob die Breaking Changes Ihren Code betreffen.

Google sagt außerdem, dass Gemini 3.7 Flash weiterhin vollständig unterstützt wird. Ein Support-Enddatum wurde nicht veröffentlicht. Ein sofortiger Wechsel ist daher nicht erforderlich.

Gemini 3.8 Flash und 3.7 Flash im Vergleich

Merkmal Gemini 3.8 Flash Gemini 3.7 Flash
Modell-ID gemini-3.8-flash gemini-3.7-flash
Veröffentlichung 2. September 2026 13. August 2026
Basis Laut Modellkarte auf 3.7 Flash basierend
Kontext / maximale Ausgabe 1.048.576 / 65.536 Token Gleich
Einführungspreis Eingabe
(bis 31. Dezember 2026)
0,75 $ pro Million Token 0,75 $ pro Million Token
Einführungspreis Ausgabe
(bis 31. Dezember 2026)
3,75 $ pro Million Token, Denkprozess inklusive 3,75 $ pro Million Token, Denkprozess inklusive
Standardpreis ab 1. Januar 2027 1,50 $ / 7,50 $ 1,50 $ / 7,50 $
Kontext-Cache-Lesen 0,075 $ pro Million Token bei Einführung Gleich
Batch 50 % Rabatt, gleiche Warteschlangen-Tokenstufen Gleich
Denk-/Argumentationsstufen low, medium (Standard), high low, medium, high
minimal Validierungsfehler Akzeptiert; laut Migrationshinweis auf low abbilden
Wissensstand März 2026 In den 3.8-Dokumenten nicht erneut aufgeführt
Ausgabe-Geschwindigkeit
(Artificial Analysis)
Rund 300 Token/s; gemessen: 302,1 bei high Laut Google ungefähr gleich schnell
Artificial-Analysis-Intelligenzindex 59 bei high 56 bei high
Support Aktuell Vollständig unterstützt, kein Enddatum

Was unverändert bleibt

Preis und Kontingente

Beide Modelle verwenden dieselben Preisstufen:

  • 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token bis zum 31. Dezember 2026
  • 1,50 $ pro Million Eingabe-Token und 7,50 $ pro Million Ausgabe-Token ab dem 1. Januar 2027
  • Kontext-Cache-Lesen: 0,075 $ pro Million Token bei Einführung
  • 50 % Batch-Rabatt
  • 5.000 kostenlose Google-Search-Grounding-Anfragen pro Monat, geteilt über alle Gemini-3.x-Modelle

Die detaillierten Spezifikationen und Preisreferenzen von Gemini 3.7 Flash gelten daher weitgehend auch für 3.8 Flash.

Kontext, Ein- und Ausgabe

Beide Modelle unterstützen:

  • 1.048.576 Eingabe-Token
  • 65.536 Ausgabe-Token
  • Text, Bild, Video, Audio und PDF als Eingabe
  • Text als Ausgabe

Nicht unterstützt werden Audio-Generierung, Bild-Generierung und die Live API.

Geschwindigkeit

Google beschreibt 3.8 Flash als Modell mit „gleichem Preis wie 3.7“ und „ungefähr gleicher Geschwindigkeit“.

Artificial Analysis maß bei Gemini 3.8 Flash ungefähr 302,1 Ausgabe-Token pro Sekunde bei high. Das ist der Durchsatz, sobald die Ausgabe beginnt. Die Zeit bis zum ersten Token betrug im selben Test 13,30 Sekunden, weil das Modell bei high zunächst argumentiert.

API-Oberfläche

Die Interactions API ist Googles primärer Pfad für Gemini 3.x. Der bisherige generateContent-Endpunkt bleibt vollständig unterstützt; ein Enddatum gibt es nicht.

In vielen Fällen reicht es, in einer bestehenden 3.7-Integration den Modellnamen auf gemini-3.8-flash zu ändern. Die Ausnahmen stehen im Abschnitt Breaking Changes.

Was sich verbessert

Google bezeichnet Gemini 3.8 Flash als „unser intelligentestes Flash-Modell“. Es wurde insbesondere für folgende Szenarien entwickelt:

  • Softwareentwicklung mit langen Zeithorizonten
  • autonome Agenten
  • komplexe Unternehmens-Workflows
  • iterative Tool-Nutzung
  • dokumentenlastige Aufgaben

Bei schwierigen Aufgaben führt das Modell zusätzliche Denk- und Argumentationsschritte aus, ruft Tools in Schleifen auf und überprüft seine Arbeit während der Ausführung.

Googles Benchmarks

Google veröffentlichte auf der DeepMind-Flash-Seite drei numerische Vergleiche mit 3.7 Flash:

Benchmark 3.8 Flash 3.7 Flash Differenz
Vals Finance Agent v2 61,4 % 59,0 % +2,4
HLE-Verified 54,9 % 53,6 % +1,3
Harvey Legal Agent Benchmark 10,0 % 8,8 % +1,2

Die Zuwächse sind nicht spektakulär, aber konstant. In Googles Tabelle übertrifft 3.8 Flash außerdem größere Modelle, darunter Claude Opus 5 mit 58,6 % bei Vals Finance und 54,4 % bei HLE-Verified. Der Dreiervergleich mit Claude Fable 5.1 und GPT-5.6 Sol führt diesen Vergleich weiter.

Unabhängige Ergebnisse von Artificial Analysis

Artificial Analysis bewertet Gemini 3.8 Flash bei high mit 59 Punkten auf dem eigenen Intelligenzindex:

  • Gemini 3.6 Flash: 52
  • Gemini 3.7 Flash: 56
  • Gemini 3.8 Flash: 59

Damit liegt 3.8 Flash auf dem Niveau von GPT-5.6 Sol bei xhigh und Grok 4.6 bei medium. Es liegt einen Punkt über Claude Fable 5.1 bei medium.

Für Tool-Nutzung ist der τ³-Banking-Wert relevanter: Gemini 3.8 Flash erreichte 45 %, zwölf Punkte mehr als Gemini 3.7 Flash. Wenn Ihre Agenten tatsächlich Tools aufrufen, ist dieser Wert aussagekräftiger als ein allgemeiner Intelligenzindex.

Dokumentenlastige Agenten-Workflows

Google behauptet, Gemini 3.8 Flash erledige bei langlaufenden, dokumentenlastigen Workflows mehr als dreimal so viele Aufgaben wie Gemini 3.7 Flash.

Das Ergebnis stammt aus einer internen Bewertung und ist kein öffentlich reproduzierbarer Benchmark. Es ist daher eher als Richtungsangabe zu verstehen. Die Behauptung passt jedoch zur Architektur des Modells: Zusätzliche Prüfschritte helfen besonders bei Workflows, in denen ein einzelner Fehler einen 40-Schritte-Prozess scheitern lassen kann.

Codierung

Bei DeepSWE v1.1 erreichte Gemini 3.7 Flash 65,3 %, gegenüber 49,0 % bei Gemini 3.6 Flash.

Google sagt, Gemini 3.8 Flash übertreffe dort „die meisten größeren Frontier-Modelle“ zu einem Bruchteil der Kosten. Der genaue 3.8-Prozentwert steht allerdings nur in den Bildtabellen der Modellkarte und nicht im veröffentlichten Text. Deshalb wird hier keine Zahl angegeben.

Für SWE-Bench Pro, Terminal-Bench und OSWorld veröffentlichte Google im Text ebenfalls keine 3.8-Flash-Werte. Wenn diese Benchmarks für Ihre Entscheidung wichtig sind, sollten Sie unabhängige Tests abwarten.

Sicherheit und Prompt-Injection-Resistenz

Google meldet einen „signifikanten Sprung“ bei Gray-Swan-Prompt-Injection-Tests, ohne genaue Zahlen zu veröffentlichen.

Die in der Modellkarte angegebenen Änderungen gegenüber 3.7 Flash sind kleiner:

  • Mehrsprachige Sicherheit: +5,4 Punkte
  • Text-zu-Text-Sicherheit: −0,4 Punkte
  • Ungerechtfertigte Ablehnungen: +1,1 Punkte

Der letzte Wert bedeutet eine leichte Zunahme übermäßiger Ablehnungen.

Was das Upgrade kostet

Die Tokenpreise sind gleich geblieben. Die Kosten pro erledigter Aufgabe steigen jedoch, weil Gemini 3.8 Flash systembedingt mehr Ausgabe-Token verwenden kann – insbesondere bei höheren Denkstufen.

Artificial Analysis maß durchschnittlich 48.000 Ausgabe-Token pro Aufgabe. Das sind 30 % mehr als bei Gemini 3.7 Flash.

Konfiguration Kosten pro Aufgabe Zeit pro Aufgabe
Gemini 3.7 Flash, high 0,40 $ 2,2 Min.
Gemini 3.8 Flash, low 0,24 $ 0,8 Min.
Gemini 3.8 Flash, medium 0,41 $ Nicht veröffentlicht
Gemini 3.8 Flash, high 0,58 $ 2,5 Min.

Daraus ergeben sich drei praktische Konsequenzen:

  1. Bei high kostet 3.8 Flash rund 45 % mehr pro Aufgabe als 3.7 Flash bei high und benötigt 14 % mehr reale Rechenzeit.
  2. Bei medium liegt 3.8 Flash nahezu auf dem Preisniveau von 3.7 Flash bei high. Ein Upgrade innerhalb desselben Budgets ist daher möglich, wenn medium für Ihre Qualitätsanforderungen ausreicht.
  3. low ist die günstigste und schnellste Konfiguration. Sie eignet sich für latenzkritische Routen, auf denen 3.7 Flash bisher aus Gewohnheit mit high ausgeführt wurde.

Die Preisaufschlüsselung für Gemini 3.8 Flash berücksichtigt diesen Unterschied bei täglichen Volumen. Wenn Sie pro Aufgabe bezahlen, ist das Upgrade nicht kostenlos. Die Denkstufe ist der wichtigste Regler dafür, wie viel zusätzliche Qualität Sie kaufen.

Breaking Changes

Zwei Änderungen betreffen bestehenden 3.7-Flash-Code direkt.

thinking_level: "minimal" wird abgelehnt

Gemini 3.8 Flash akzeptiert nur:

low
medium
high
Enter fullscreen mode Exit fullscreen mode

Eine Konfiguration mit minimal führt zu einem Validierungsfehler. Migrieren Sie sie auf low:

{
  "thinkingConfig": {
    "thinkingLevel": "low"
  }
}
Enter fullscreen mode Exit fullscreen mode

Der Leitfaden zu Denk- und Argumentationsstufen beschreibt die Unterschiede bei Qualität, Kosten und Latenz.

Funktionsantworten brauchen call_id und name

In der Interactions API muss jedes function_result sowohl call_id als auch name enthalten.

Beim veralteten generateContent-Endpunkt benötigt jedes functionResponse die passende id und name.

Code, der Funktionsresultate bisher nur anhand des Funktionsnamens zurückgab, kann beim zweiten Durchlauf einer Tool-Schleife fehlschlagen.

Weitere Gemini-3-Regeln prüfen

Der Migrationsleitfaden von 3.7 zu 3.8 Flash empfiehlt außerdem, die folgenden Regeln zu überprüfen:

  • temperature auf der Standardeinstellung 1.0 belassen. Google warnt, dass niedrigere Werte Schleifen oder schlechtere Leistung verursachen können.
  • thinking_level statt eines Integer-Werts in thinking_budget verwenden.
  • candidate_count entfernen.
  • Gedankensignaturen exakt so zurückgeben, wie sie empfangen wurden.

Diese Punkte sind nicht neu für 3.8 Flash. Eine 3.7-Codebasis, die sie bisher ignoriert hat, kann dadurch beim Modellwechsel Probleme sichtbar machen.

Entscheidungsmatrix nach Arbeitslast

Arbeitslast Empfehlung Begründung
Mehrstufige Agenten mit Tool-Aufrufen Upgrade auf medium oder high +12 Punkte bei τ³-Banking; iterative Tool-Schleifen sind der Kern von 3.8
Langdokumentenextraktion und -prüfung Upgrade Googles Behauptung zur dreifachen Aufgabenleistung zielt genau auf diesen Fall
Agentengestützte Codierung in einem Testrahmen Upgrade, dann messen Der DeepSWE-Textwert ist nicht veröffentlicht
Finanz-, Rechts- und Forschungsagenten Upgrade Alle drei veröffentlichten Google-Vergleiche sprechen für 3.8
Hochvolumige Klassifizierung, Extraktion und Chat Bei 3.7 bleiben oder 3.8 mit low verwenden Die Kosten pro Aufgabe sind entscheidend
Latenzkritische Benutzerendpunkte 3.8 mit low 0,8 Minuten pro Aufgabe gegenüber 2,2 Minuten bei 3.7 mit high
Workloads mit minimal Thinking Zuerst migrieren Die Konfiguration verursacht einen Validierungsfehler
Batch-Pipelines mit Cent-genauer Kalkulation Bei 3.7 bleiben, bis neu bewertet Gleicher Tokenpreis, aber 30 % mehr Ausgabe-Token

Das Muster ist eindeutig:

  • Je schwieriger und länger die Aufgabe, desto eher rechtfertigt das „arbeitet härter“-Design von 3.8 Flash den höheren Tokenverbrauch.
  • Je kürzer und repetitiver die Aufgabe, desto geringer ist der Qualitätsgewinn.
  • Die Denkstufe entscheidet maßgeblich über Kosten und Latenz.

Beide Modelle in Apidog mit demselben Testszenario testen

Die Werte von Artificial Analysis stammen aus einem externen Testrahmen. Vor dem Wechsel in der Produktion sollten Sie Ihre eigenen Prompts mit beiden Modellen ausführen und Tokenverbrauch, Qualität und Latenz vergleichen.

Mit Apidog lässt sich ein solcher Vergleich schnell aufsetzen.

1. API-Anfrage konfigurieren

Setzen Sie GEMINI_API_KEY als Umgebungsvariable in einer Apidog-Umgebung.

Erstellen Sie anschließend eine POST-Anfrage an:

https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Enter fullscreen mode Exit fullscreen mode

Lesen Sie den API-Schlüssel aus der Umgebungsvariable GEMINI_API_KEY im Header x-goog-api-key.

Machen Sie model zu einer Szenario-Variablen. Verwenden Sie für beide Läufe denselben Request-Body:

{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
Enter fullscreen mode Exit fullscreen mode

2. Testszenario mit beiden Modellen erstellen

Erstellen Sie zwei Schritte:

  1. Anfrage mit model = gemini-3.7-flash
  2. Dieselbe Anfrage mit model = gemini-3.8-flash

Fügen Sie für jeden Schritt Assertions hinzu für:

  • usageMetadata.candidatesTokenCount
  • usageMetadata.thoughtsTokenCount
  • eine Obergrenze, die Ihrem Budget entspricht
  • jeden JSON-Pfad, den Ihre Anwendung tatsächlich verwendet

Führen Sie das Szenario mit zehn bis zwanzig Golden Prompts aus. Der Testbericht zeigt die Antworten und Assertion-Ergebnisse beider Modelle gemeinsam. So erhalten Sie Ihre eigene Token-Differenz anstelle einer fremden Benchmark-Zahl.

3. Tokenverbrauch als Regression testen

Planen Sie das Szenario, damit ein späterer Anstieg der Denk-Token nach einem Modellupdate einen Test fehlschlagen lässt – statt erst auf der Rechnung sichtbar zu werden.

Apidog herunterladen; der kostenlose Plan deckt diesen Workflow ab. Eine Anleitung zum Planen von API-Tests in Apidog zeigt die einzelnen Schritte.

FAQ

Ist Gemini 3.8 Flash schneller als 3.7 Flash?

Nein. Google beschreibt die Geschwindigkeit als ungefähr gleich. Artificial Analysis maß bei high etwa 300 Ausgabe-Token pro Sekunde.

Da 3.8 Flash mehr Denkschritte ausführt, stieg die reale Zeit pro Aufgabe im Test jedoch leicht:

  • 3.7 Flash, high: 2,2 Minuten
  • 3.8 Flash, high: 2,5 Minuten
  • 3.8 Flash, low: 0,8 Minuten

Kostet Gemini 3.8 Flash mehr als 3.7 Flash?

Nicht pro Token. Beide Modelle kosten bis zum 31. Dezember 0,75 $ pro Million Eingabe-Token und 3,75 $ pro Million Ausgabe-Token. Ab dem 1. Januar 2027 steigen die Preise auf 1,50 $ beziehungsweise 7,50 $.

Pro Aufgabe kostet 3.8 Flash im Artificial-Analysis-Test mehr:

  • 3.7 Flash, high: 0,40 $
  • 3.8 Flash, high: 0,58 $

Der Grund sind rund 30 % mehr Ausgabe-Token.

Wird Google Gemini 3.7 Flash einstellen?

Google sagt, dass 3.7 Flash weiterhin vollständig unterstützt wird. Ein Enddatum wurde nicht veröffentlicht. Sie können das Modell daher weiterverwenden. Der „What’s new in 3.7 Flash“-Beitrag bleibt die Referenz für diese Version.

Was ändert sich beim Wechsel zu 3.8 Flash?

Zwei Punkte:

  1. thinking_level: "minimal" verursacht den Fehler 400 INVALID_ARGUMENT.
  2. Jede Funktionsantwort muss sowohl Aufruf-ID als auch Namen enthalten:
    • call_id und name in der Interactions API
    • id und name in generateContent

Die übrige Gemini-3-API bleibt unverändert.

Wie groß ist der Sprung von 3.6 zu 3.7 im Vergleich zu 3.7 zu 3.8?

Gemini 3.7 Flash war der größere Leistungssprung:

  • DeepSWE: 49,0 % auf 65,3 %
  • Artificial-Analysis-Index: 52 auf 56

Der Sprung zu 3.8 Flash beträgt drei Punkte beim Index und basiert stärker auf einer Neugestaltung der Token-Ausgabe und des Denkprozesses.

Für die frühere Generation siehe Gemini 3.6 Flash vs. Gemini 3.5 Flash, einschließlich der Preissenkung, mit der diese Veröffentlichungsreihe begann.

Fazit

Führen Sie ein Upgrade durch, wenn Ihre Workloads agentenbasiert, tool-lastig oder dokumentenlastig sind. In diesen Szenarien zeigen sowohl Google als auch Artificial Analysis Verbesserungen, und die zusätzlichen Token können sich durch mehr erfolgreich abgeschlossene Aufgaben amortisieren.

Bleiben Sie bei Gemini 3.7 Flash oder verwenden Sie Gemini 3.8 Flash mit low, wenn Sie kurze, repetitive Aufrufe ausführen und die Kosten pro Aufgabe entscheidend sind.

Unabhängig von der Entscheidung:

  1. Ersetzen Sie minimal durch low.
  2. Ergänzen Sie call_id beziehungsweise id und name in allen Funktionsantworten.
  3. Messen Sie Tokenverbrauch, Qualität und Latenz mit Ihren eigenen Prompts.
  4. Automatisieren Sie den Vergleich, damit steigende Denk-Token als Testfehler erscheinen.

Quellen

Top comments (0)