DEV Community

Cover image for Gemini 3.8 Flash Denkniveaus: niedrig, mittel, hoch – warum minimal entfiel
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 3.8 Flash Denkniveaus: niedrig, mittel, hoch – warum minimal entfiel

Gemini 3.8 Flash: Denkebenen richtig wählen, Kosten kontrollieren und testen

Gemini 3.8 Flash wird mit drei Denkebenen ausgeliefert: low, medium und high. Die Einstellung steuert, wie viele interne Überlegungen das Modell vor der Antwort anstellt – und beeinflusst dadurch Latenz, Ausgabe-Tokens und Kosten. Bei komplexen Aufgaben arbeitet Gemini 3.8 Flash intensiver als sein Vorgänger, deshalb ist die Wahl der Ebene besonders wichtig. Eine Einführung bietet die Gemini 3.8 Flash Übersicht; dieser Leitfaden konzentriert sich ausschließlich auf thinking_level.

Apidog heute ausprobieren

Zwei Details sorgen beim Einstieg häufig für Verwirrung:

  • Die Standardstufe ist medium, nicht high. Gemini 3 Pro verwendet standardmäßig high.
  • minimal, das ältere Gemini-3.7-Flash-Konfigurationen möglicherweise noch senden, wird bei Gemini 3.8 Flash abgelehnt.

Beides ist in den Neuerungen in Gemini 3.8 Flash dokumentiert.

Dieser Artikel zeigt:

  • was die einzelnen Ebenen leisten,
  • wie sich die Kosten unterscheiden,
  • wie Sie die Einstellung in beiden API-Varianten setzen,
  • welche Ebene zu welcher Route passt,
  • wie Sie die Unterschiede in Apidog reproduzierbar messen.

Denkebenen im Überblick

Ebene Googles Empfehlung Kosten pro Aufgabe (AA) Zeit pro Aufgabe (AA) Geeignet für
low Minimiert Latenz und Kosten $0.24 0,8 Min. Chat, Klassifikation, Transkriptsuche, hohe Durchsatzraten
medium (Standard) Standard für komplexen Code und agentische Arbeit $0.41 nicht veröffentlicht Die meisten Routen, allgemeine Video-Frage-und-Antwort
high Maximale Überlegungstiefe $0.58 2,5 Min. Dichte visuelle QA, Videos über 60 Minuten, wichtige Planungsschritte
minimal Nicht unterstützt n/a n/a Nie verwenden; auf low migrieren

Die Kosten- und Zeitwerte stammen von Artificial Analysis. Sie kombinieren den Intelligence Index mit Googles Einführungspreisen pro Token. Es sind unabhängige Durchschnittswerte für eine Benchmark-Arbeitslast, nicht für Ihre individuellen Prompts. Verwenden Sie sie als Richtwerte und messen Sie anschließend Ihre eigenen Routen.

Was die einzelnen Ebenen tun

Gemini-3.8-Flash-Antworten können Denk-Tokens enthalten: interne Überlegungen, die vor der sichtbaren Antwort generiert werden. Sie werden als Ausgabe-Tokens abgerechnet:

  • $3,75 pro Million Output-Tokens bis zum 31.12.2026
  • $7,50 pro Million Output-Tokens ab dem 01.01.2027

Die API meldet diese Tokens separat als usageMetadata.thoughtsTokenCount.

  • low begrenzt die Überlegungen. Das erste Token kommt schneller, und die Ausgabekosten bleiben niedriger. Google empfiehlt diese Ebene für einfache Anweisungsbefolgung, Chat und Endpunkte mit hohem Durchsatz.
  • medium ist der Kompromiss und die Standardeinstellung. Google nennt sie als passende Ebene für komplexen Code und agentische Aufgaben.
  • high gibt dem Modell die größtmögliche Überlegungstiefe für schwierige, mehrstufige Probleme.

Gemini 3.8 Flash kann bei komplexen Aufgaben zusätzliche Überlegungsschritte ausführen, Tools iterativ aufrufen und die eigene Arbeit überprüfen. Google weist darauf hin, dass das Modell bei längeren und komplexeren Aufgaben – besonders auf höheren Ebenen – mehr Tokens verbrauchen kann.

Wenn der Verbrauch steigt, empfiehlt Google zuerst, thinking_level zu reduzieren. Als zweite Option können Sie bei Gemini 3.7 Flash bleiben, das weiterhin vollständig unterstützt wird.

thinking_level ist kein Token-Budget

thinking_level ist ein Enum, kein numerisches Budget. Das frühere thinking_budget gibt es bei Gemini-3-Modellen nicht mehr. Sie können also nicht „höchstens 2.000 Denk-Tokens“ anfordern. Stattdessen wählen Sie eine Ebene und messen anschließend deren tatsächlichen Verbrauch.

Der Standard ist medium, nicht high

Wenn Sie das Feld weglassen, verwendet Gemini 3.8 Flash medium. Das kann insbesondere in zwei Fällen unbemerkt zu einem anderen Kostenprofil führen:

  1. Sie migrieren einen Prototyp von Gemini 3 Pro und erwarten weiterhin standardmäßig high.
  2. Sie entfernen beim Upgrade von Gemini 3.7 Flash thinking_budget, ersetzen es aber nicht durch eine Denkebene.

Setzen Sie thinking_level deshalb explizit bei jeder Anfrage und pro Route – idealerweise in der Konfiguration statt direkt im Anwendungscode. So bleibt Ihr Kostenprofil stabil, auch wenn Google später Standardwerte ändert.

Warum minimal entfällt

minimal funktionierte bei Gemini 3.7 Flash, gehört aber nicht mehr zu den unterstützten Ebenen von Gemini 3.8 Flash. Die Modellseite listet nur low, medium und high.

Eine REST-Anfrage mit minimal wird bereits während der Validierung abgelehnt:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "minimal" }
}
Enter fullscreen mode Exit fullscreen mode

Die Antwort ist 400 INVALID_ARGUMENT mit einer Meldung wie:

Thinking level MINIMAL is not supported for this model.
Please retry with other thinking level.
Enter fullscreen mode Exit fullscreen mode

SDKs verpacken diesen Fehler möglicherweise in eigene Ausnahmeklassen. Prüfen Sie daher den HTTP-Status 400 oder den Fehlercode INVALID_ARGUMENT, nicht den Nachrichtentext.

Ersetzen Sie minimal durch low:

{
  "model": "gemini-3.8-flash",
  "input": "Classify this ticket as billing, bug, or feature.",
  "generation_config": { "thinking_level": "low" }
}
Enter fullscreen mode Exit fullscreen mode

Googles Migrationsanleitung empfiehlt genau diese Zuordnung: minimallow. Weitere wichtige Hinweise finden Sie im 3.7-zu-3.8-Flash-Migrationsleitfaden.

Vermeiden Sie dabei zwei typische Workarounds:

  • Verwenden Sie nicht thinking_budget; es wird von Gemini-3-Modellen nicht unterstützt.
  • Senken Sie nicht temperature, um das Denken zu reduzieren. Google empfiehlt für Gemini 3 den Standardwert 1.0, da niedrigere Werte Schleifen oder schlechtere Ausgaben verursachen können.

Da die Validierung vor der Token-Generierung erfolgt, eignet sich eine geplante Testanfrage mit minimal als kostenloser Regressionstest.

Was die Ebenen kosten

Der Preis pro Token ändert sich nicht mit der Denkebene. Laut Googles Preisseite kostet Gemini 3.8 Flash zum Einführungspreis:

  • $0,75 pro Million Input-Tokens
  • $3,75 pro Million Output-Tokens

Ab dem 01.01.2027 steigen die Preise auf $1,50 beziehungsweise $7,50. Die Ebene beeinflusst ausschließlich, wie viele Output-Tokens das Modell erzeugt.

Modell und Ebene Kosten pro Aufgabe Zeit pro Aufgabe
Gemini 3.8 Flash low $0.24 0,8 Min.
Gemini 3.8 Flash medium $0.41 nicht veröffentlicht
Gemini 3.8 Flash high $0.58 2,5 Min.
Gemini 3.7 Flash high $0.40 2,2 Min.

Quelle: Artificial Analysis, Intelligence-Index-Läufe zu Einführungspreisen.

Daraus ergeben sich drei praktische Verhältnisse:

  • low kostet ungefähr 41 % von high und benötigt etwa ein Drittel der Zeit.
  • medium bei 3.8 Flash kostet ungefähr so viel wie high bei 3.7 Flash: $0,41 gegenüber $0,40.
  • high bei 3.8 Flash kostet pro Aufgabe etwa 45 % mehr als high bei 3.7 Flash, obwohl der Tokenpreis gleich bleibt. Der Grund sind im Durchschnitt etwa 30 % mehr Output-Tokens, rund 48.000 pro Indexaufgabe.

Der Intelligence-Index-Wert 59 von Artificial Analysis basiert auf einem high-Lauf. Für medium und low wurden im Artikel keine Indexwerte veröffentlicht. Gehen Sie daher nicht von einer linearen Qualitätskurve aus. Testen Sie Ihre eigenen Bewertungen, bevor Sie eine Route herabstufen.

Ein Beispiel für 1.000 Aufgaben pro Tag finden Sie im Artikel Gemini 3.8 Flash-Preise.

thinking_level in der Interactions API setzen

Die Interactions API ist Googles primäre Schnittstelle für Gemini 3.x. Die Einstellung liegt in generation_config und verwendet snake_case:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Enter fullscreen mode Exit fullscreen mode

In Python:

interaction = client.interactions.create(
    model="gemini-3.8-flash",
    input="Explain HTTP caching in 3 sentences.",
    generation_config={"thinking_level": "low"},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Da es sich um ein Feld auf Anfrageebene handelt, sollte es bei jedem Aufruf gesetzt werden – auch bei Folgeaufrufen mit previous_interaction_id.

Die Antwort besteht aus einer Liste von Ausführungsschritten, etwa Gedanken und Tool-Aufrufen, und endet mit model_output. Das SDK stellt den endgültigen Text als output_text bereit. Eine vollständige Einführung mit Multi-Turn-Zustand und Streaming bietet der Artikel Wie man die Gemini 3.8 Flash API verwendet.

thinking_level in generateContent setzen

Die ältere generateContent-Funktion wird weiterhin vollständig unterstützt und hat laut Google kein Enddatum. Hier liegt die Einstellung tiefer verschachtelt und verwendet camelCase:

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -X POST \
  -d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
       "generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
Enter fullscreen mode Exit fullscreen mode

In Python:

from google.genai import types

response = client.models.generate_content(
    model="gemini-3.8-flash",
    contents="Explain HTTP caching in 3 sentences.",
    config=types.GenerateContentConfig(
        thinking_config=types.ThinkingConfig(thinking_level="low")
    ),
)

print(response.usage_metadata.thoughts_token_count)
Enter fullscreen mode Exit fullscreen mode

includeThoughts: true fügt Gedankenzusammenfassungen als Teile mit thought: true hinzu. Das ist während der Kalibrierung hilfreich, sollte im normalen Betrieb aber meist deaktiviert werden.

Die relevante Kennzahl ist usageMetadata.thoughtsTokenCount: die genaue Anzahl der Denk-Tokens, die als Output abgerechnet wird.

Eine Strategie pro Route

Behandeln Sie die Denkebene als Routing-Entscheidung und nicht als globale Einstellung:

  • Chat und Autovervollständigung: low, wenn eine Person auf die Antwort wartet.
  • Klassifikation, Extraktion und Transkriptsuche: zunächst low, anschließend Genauigkeit mit einem eigenen Evaluierungslauf prüfen.
  • Codierungsagenten und Tool-Schleifen: medium. Eskalieren Sie einzelne Planungsschritte auf high, wenn deren Ergebnis alle folgenden Schritte steuert.
  • Dokumentenintensive, langfristig orientierte Workflows: high. Für nicht-interaktive Aufgaben kann die Batch API mit 50 % Rabatt sinnvoll sein.
  • Video: high für dichte visuelle QA oder Videos über 60 Minuten, medium für allgemeine Video-Frage-und-Antwort und low für Transkriptsuche.

Wenn selbst low für eine Route noch zu teuer oder zu langsam ist, prüfen Sie die Flash-Lite-Linie. Der Gemini-3.1-Flash-Lite-Leitfaden beschreibt den Kompromiss; Gemini 3.5 Flash-Lite startet mit $0,30 pro Million Input- und $2,50 pro Million Output-Tokens.

Halten Sie die Ebene in der pro-Routen-Konfiguration und setzen Sie gemini-3.7-flash hinter ein Feature-Flag. Steigt der Tokenverbrauch nach einem Upgrade, können Sie die Ebene oder das Modell ohne neue Codeveröffentlichung zurückstufen.

Alle drei Ebenen in Apidog testen

Benchmarkwerte liefern nur Verhältnisse. Für belastbare Entscheidungen brauchen Sie Ihre eigenen Prompts. Mit Apidog können Sie denselben Golden Prompt auf allen drei Ebenen ausführen und die Antworten, Tokenzahlen und Latenz vergleichen.

  1. API-Schlüssel als Variable speichern

    Erstellen Sie in einer Apidog-Umgebung GEMINI_API_KEY und verwenden Sie {{GEMINI_API_KEY}} im Header x-goog-api-key. Legen Sie zusätzlich THINKING_LEVEL an.

  2. Eine Anfrage speichern

    Verwenden Sie den Legacy-Endpunkt:

   POST /v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Setzen Sie im Request:

   {
     "thinkingConfig": {
       "thinkingLevel": "{{THINKING_LEVEL}}"
     }
   }
Enter fullscreen mode Exit fullscreen mode
  1. Drei Testschritte anlegen

    Importieren Sie dieselbe Anfrage dreimal und setzen Sie THINKING_LEVEL jeweils auf low, medium und high.

  2. Messwerte prüfen

    Bestätigen Sie pro Schritt:

  • HTTP-Status ist 200
  • usageMetadata.thoughtsTokenCount ist vorhanden
  • Antwortzeit und Denk-Tokenzahl von low bleiben unter dem Grenzwert Ihrer Route

Speichern Sie die Messwerte beispielsweise per Post-Processor in Variablen. Der high-Schritt sollte mindestens so viele Denk-Tokens wie der low-Schritt verwenden. Eine Umkehrung weist auf eine Modell- oder Konfigurationsänderung hin.

  1. Regressionstest für minimal hinzufügen

    Senden Sie zusätzlich thinkingLevel: "minimal" und erwarten Sie eine Antwort ungleich 200, typischerweise 400 INVALID_ARGUMENT.

  2. Szenario planen

    Führen Sie den Test täglich aus. So werden Konfigurationsregressionen und stille Verhaltensänderungen sichtbar, bevor sie zu einer unerwarteten Rechnung führen. Die Einrichtung beschreibt der Artikel Wie man API-Tests in Apidog plant.

Für gestreamte Antworten funktioniert dasselbe Vorgehen mit SSE-Rendering. Eine Anleitung bietet Wie man LLM-APIs testet, die über SSE streamen. Der kostenlose Apidog-Plan deckt dieses Testszenario ab. Apidog herunterladen.

FAQ

Ändert die Denkebene den Preis pro Token?

Nein. Der Einführungspreis beträgt bei Gemini 3.8 Flash $0,75 pro Million Input- und $3,75 pro Million Output-Tokens – unabhängig von der Ebene. Die Ebene beeinflusst die Anzahl der Denk-Tokens, die als Output abgerechnet werden. Details zu Caching, Batch und der Preiserhöhung am 1. Januar finden Sie auf der Preisseite.

Kann ich ein exaktes Denk-Token-Budget festlegen?

Nein. Bei Gemini 3 ersetzt das Enum thinking_level das frühere thinking_budget. Gemini 3.8 Flash akzeptiert nur low, medium und high. Erzwingen Sie Obergrenzen stattdessen mit Tests und Alarmierungen.

Welche Ebene verwendet der Artificial-Analysis-Score von 59?

high. Artificial Analysis hat den Intelligence Index bei high berechnet und Kosten sowie Zeit für low und medium veröffentlicht, aber keine Indexwerte für diese Ebenen.

Sollte ich die Temperatur senken?

Nein. Google empfiehlt für Gemini 3 den Standardwert 1.0. Niedrigere Werte können Schleifen oder schlechtere Ausgaben verursachen. Verwenden Sie thinking_level, um die Überlegungstiefe zu steuern.

Was, wenn low immer noch zu langsam oder zu teuer ist?

Bleiben Sie bei Gemini 3.7 Flash, das laut Google weiterhin vollständig unterstützt wird, oder wechseln Sie für diese Route zu einem Flash-Lite-Modell. Der Vergleich zwischen Gemini 3.8 Flash und Gemini 3.7 Flash zeigt, wo zusätzliche Tokens messbare Qualitätsgewinne bringen.

Ebene pro Route wählen und messen

Gemini 3.8 Flash bietet drei Denkebenen, verwendet standardmäßig medium und kann bei komplexen Aufgaben mehr Tokens als sein Vorgänger verbrauchen. Setzen Sie thinking_level explizit pro Route, migrieren Sie minimal zu low und überwachen Sie usageMetadata.thoughtsTokenCount.

Die Artificial-Analysis-Werte von $0,24, $0,41 und $0,58 zeigen die Form der Kostenkurve. Ein dreistufiges Apidog-Szenario liefert Ihnen die Zahlen für Ihre eigenen Prompts – rechtzeitig vor der Preisänderung am 31. Dezember.

Top comments (0)