Gemini 3.8 Flash: Denkebenen richtig wählen, Kosten kontrollieren und testen
Gemini 3.8 Flash wird mit drei Denkebenen ausgeliefert: low, medium und high. Die Einstellung steuert, wie viele interne Überlegungen das Modell vor der Antwort anstellt – und beeinflusst dadurch Latenz, Ausgabe-Tokens und Kosten. Bei komplexen Aufgaben arbeitet Gemini 3.8 Flash intensiver als sein Vorgänger, deshalb ist die Wahl der Ebene besonders wichtig. Eine Einführung bietet die Gemini 3.8 Flash Übersicht; dieser Leitfaden konzentriert sich ausschließlich auf thinking_level.
Zwei Details sorgen beim Einstieg häufig für Verwirrung:
- Die Standardstufe ist
medium, nichthigh. Gemini 3 Pro verwendet standardmäßighigh. -
minimal, das ältere Gemini-3.7-Flash-Konfigurationen möglicherweise noch senden, wird bei Gemini 3.8 Flash abgelehnt.
Beides ist in den Neuerungen in Gemini 3.8 Flash dokumentiert.
Dieser Artikel zeigt:
- was die einzelnen Ebenen leisten,
- wie sich die Kosten unterscheiden,
- wie Sie die Einstellung in beiden API-Varianten setzen,
- welche Ebene zu welcher Route passt,
- wie Sie die Unterschiede in Apidog reproduzierbar messen.
Denkebenen im Überblick
| Ebene | Googles Empfehlung | Kosten pro Aufgabe (AA) | Zeit pro Aufgabe (AA) | Geeignet für |
|---|---|---|---|---|
low |
Minimiert Latenz und Kosten | $0.24 | 0,8 Min. | Chat, Klassifikation, Transkriptsuche, hohe Durchsatzraten |
medium (Standard) |
Standard für komplexen Code und agentische Arbeit | $0.41 | nicht veröffentlicht | Die meisten Routen, allgemeine Video-Frage-und-Antwort |
high |
Maximale Überlegungstiefe | $0.58 | 2,5 Min. | Dichte visuelle QA, Videos über 60 Minuten, wichtige Planungsschritte |
minimal |
Nicht unterstützt | n/a | n/a | Nie verwenden; auf low migrieren |
Die Kosten- und Zeitwerte stammen von Artificial Analysis. Sie kombinieren den Intelligence Index mit Googles Einführungspreisen pro Token. Es sind unabhängige Durchschnittswerte für eine Benchmark-Arbeitslast, nicht für Ihre individuellen Prompts. Verwenden Sie sie als Richtwerte und messen Sie anschließend Ihre eigenen Routen.
Was die einzelnen Ebenen tun
Gemini-3.8-Flash-Antworten können Denk-Tokens enthalten: interne Überlegungen, die vor der sichtbaren Antwort generiert werden. Sie werden als Ausgabe-Tokens abgerechnet:
- $3,75 pro Million Output-Tokens bis zum 31.12.2026
- $7,50 pro Million Output-Tokens ab dem 01.01.2027
Die API meldet diese Tokens separat als usageMetadata.thoughtsTokenCount.
-
lowbegrenzt die Überlegungen. Das erste Token kommt schneller, und die Ausgabekosten bleiben niedriger. Google empfiehlt diese Ebene für einfache Anweisungsbefolgung, Chat und Endpunkte mit hohem Durchsatz. -
mediumist der Kompromiss und die Standardeinstellung. Google nennt sie als passende Ebene für komplexen Code und agentische Aufgaben. -
highgibt dem Modell die größtmögliche Überlegungstiefe für schwierige, mehrstufige Probleme.
Gemini 3.8 Flash kann bei komplexen Aufgaben zusätzliche Überlegungsschritte ausführen, Tools iterativ aufrufen und die eigene Arbeit überprüfen. Google weist darauf hin, dass das Modell bei längeren und komplexeren Aufgaben – besonders auf höheren Ebenen – mehr Tokens verbrauchen kann.
Wenn der Verbrauch steigt, empfiehlt Google zuerst, thinking_level zu reduzieren. Als zweite Option können Sie bei Gemini 3.7 Flash bleiben, das weiterhin vollständig unterstützt wird.
thinking_level ist kein Token-Budget
thinking_level ist ein Enum, kein numerisches Budget. Das frühere thinking_budget gibt es bei Gemini-3-Modellen nicht mehr. Sie können also nicht „höchstens 2.000 Denk-Tokens“ anfordern. Stattdessen wählen Sie eine Ebene und messen anschließend deren tatsächlichen Verbrauch.
Der Standard ist medium, nicht high
Wenn Sie das Feld weglassen, verwendet Gemini 3.8 Flash medium. Das kann insbesondere in zwei Fällen unbemerkt zu einem anderen Kostenprofil führen:
- Sie migrieren einen Prototyp von Gemini 3 Pro und erwarten weiterhin standardmäßig
high. - Sie entfernen beim Upgrade von Gemini 3.7 Flash
thinking_budget, ersetzen es aber nicht durch eine Denkebene.
Setzen Sie thinking_level deshalb explizit bei jeder Anfrage und pro Route – idealerweise in der Konfiguration statt direkt im Anwendungscode. So bleibt Ihr Kostenprofil stabil, auch wenn Google später Standardwerte ändert.
Warum minimal entfällt
minimal funktionierte bei Gemini 3.7 Flash, gehört aber nicht mehr zu den unterstützten Ebenen von Gemini 3.8 Flash. Die Modellseite listet nur low, medium und high.
Eine REST-Anfrage mit minimal wird bereits während der Validierung abgelehnt:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "minimal" }
}
Die Antwort ist 400 INVALID_ARGUMENT mit einer Meldung wie:
Thinking level MINIMAL is not supported for this model.
Please retry with other thinking level.
SDKs verpacken diesen Fehler möglicherweise in eigene Ausnahmeklassen. Prüfen Sie daher den HTTP-Status 400 oder den Fehlercode INVALID_ARGUMENT, nicht den Nachrichtentext.
Ersetzen Sie minimal durch low:
{
"model": "gemini-3.8-flash",
"input": "Classify this ticket as billing, bug, or feature.",
"generation_config": { "thinking_level": "low" }
}
Googles Migrationsanleitung empfiehlt genau diese Zuordnung: minimal → low. Weitere wichtige Hinweise finden Sie im 3.7-zu-3.8-Flash-Migrationsleitfaden.
Vermeiden Sie dabei zwei typische Workarounds:
- Verwenden Sie nicht
thinking_budget; es wird von Gemini-3-Modellen nicht unterstützt. - Senken Sie nicht
temperature, um das Denken zu reduzieren. Google empfiehlt für Gemini 3 den Standardwert1.0, da niedrigere Werte Schleifen oder schlechtere Ausgaben verursachen können.
Da die Validierung vor der Token-Generierung erfolgt, eignet sich eine geplante Testanfrage mit minimal als kostenloser Regressionstest.
Was die Ebenen kosten
Der Preis pro Token ändert sich nicht mit der Denkebene. Laut Googles Preisseite kostet Gemini 3.8 Flash zum Einführungspreis:
- $0,75 pro Million Input-Tokens
- $3,75 pro Million Output-Tokens
Ab dem 01.01.2027 steigen die Preise auf $1,50 beziehungsweise $7,50. Die Ebene beeinflusst ausschließlich, wie viele Output-Tokens das Modell erzeugt.
| Modell und Ebene | Kosten pro Aufgabe | Zeit pro Aufgabe |
|---|---|---|
Gemini 3.8 Flash low
|
$0.24 | 0,8 Min. |
Gemini 3.8 Flash medium
|
$0.41 | nicht veröffentlicht |
Gemini 3.8 Flash high
|
$0.58 | 2,5 Min. |
Gemini 3.7 Flash high
|
$0.40 | 2,2 Min. |
Quelle: Artificial Analysis, Intelligence-Index-Läufe zu Einführungspreisen.
Daraus ergeben sich drei praktische Verhältnisse:
-
lowkostet ungefähr 41 % vonhighund benötigt etwa ein Drittel der Zeit. -
mediumbei 3.8 Flash kostet ungefähr so viel wiehighbei 3.7 Flash: $0,41 gegenüber $0,40. -
highbei 3.8 Flash kostet pro Aufgabe etwa 45 % mehr alshighbei 3.7 Flash, obwohl der Tokenpreis gleich bleibt. Der Grund sind im Durchschnitt etwa 30 % mehr Output-Tokens, rund 48.000 pro Indexaufgabe.
Der Intelligence-Index-Wert 59 von Artificial Analysis basiert auf einem high-Lauf. Für medium und low wurden im Artikel keine Indexwerte veröffentlicht. Gehen Sie daher nicht von einer linearen Qualitätskurve aus. Testen Sie Ihre eigenen Bewertungen, bevor Sie eine Route herabstufen.
Ein Beispiel für 1.000 Aufgaben pro Tag finden Sie im Artikel Gemini 3.8 Flash-Preise.
thinking_level in der Interactions API setzen
Die Interactions API ist Googles primäre Schnittstelle für Gemini 3.x. Die Einstellung liegt in generation_config und verwendet snake_case:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] \
-H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
In Python:
interaction = client.interactions.create(
model="gemini-3.8-flash",
input="Explain HTTP caching in 3 sentences.",
generation_config={"thinking_level": "low"},
)
print(interaction.output_text)
Da es sich um ein Feld auf Anfrageebene handelt, sollte es bei jedem Aufruf gesetzt werden – auch bei Folgeaufrufen mit previous_interaction_id.
Die Antwort besteht aus einer Liste von Ausführungsschritten, etwa Gedanken und Tool-Aufrufen, und endet mit model_output. Das SDK stellt den endgültigen Text als output_text bereit. Eine vollständige Einführung mit Multi-Turn-Zustand und Streaming bietet der Artikel Wie man die Gemini 3.8 Flash API verwendet.
thinking_level in generateContent setzen
Die ältere generateContent-Funktion wird weiterhin vollständig unterstützt und hat laut Google kein Enddatum. Hier liegt die Einstellung tiefer verschachtelt und verwendet camelCase:
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent" \
-H "x-goog-[REDACTED CREDENTIAL] \
-H 'Content-Type: application/json' \
-X POST \
-d '{"contents":[{"parts":[{"text":"Explain HTTP caching in 3 sentences."}]}],
"generationConfig":{"thinkingConfig":{"thinkingLevel":"low","includeThoughts":true}}}'
In Python:
from google.genai import types
response = client.models.generate_content(
model="gemini-3.8-flash",
contents="Explain HTTP caching in 3 sentences.",
config=types.GenerateContentConfig(
thinking_config=types.ThinkingConfig(thinking_level="low")
),
)
print(response.usage_metadata.thoughts_token_count)
includeThoughts: true fügt Gedankenzusammenfassungen als Teile mit thought: true hinzu. Das ist während der Kalibrierung hilfreich, sollte im normalen Betrieb aber meist deaktiviert werden.
Die relevante Kennzahl ist usageMetadata.thoughtsTokenCount: die genaue Anzahl der Denk-Tokens, die als Output abgerechnet wird.
Eine Strategie pro Route
Behandeln Sie die Denkebene als Routing-Entscheidung und nicht als globale Einstellung:
-
Chat und Autovervollständigung:
low, wenn eine Person auf die Antwort wartet. -
Klassifikation, Extraktion und Transkriptsuche: zunächst
low, anschließend Genauigkeit mit einem eigenen Evaluierungslauf prüfen. -
Codierungsagenten und Tool-Schleifen:
medium. Eskalieren Sie einzelne Planungsschritte aufhigh, wenn deren Ergebnis alle folgenden Schritte steuert. -
Dokumentenintensive, langfristig orientierte Workflows:
high. Für nicht-interaktive Aufgaben kann die Batch API mit 50 % Rabatt sinnvoll sein. -
Video:
highfür dichte visuelle QA oder Videos über 60 Minuten,mediumfür allgemeine Video-Frage-und-Antwort undlowfür Transkriptsuche.
Wenn selbst low für eine Route noch zu teuer oder zu langsam ist, prüfen Sie die Flash-Lite-Linie. Der Gemini-3.1-Flash-Lite-Leitfaden beschreibt den Kompromiss; Gemini 3.5 Flash-Lite startet mit $0,30 pro Million Input- und $2,50 pro Million Output-Tokens.
Halten Sie die Ebene in der pro-Routen-Konfiguration und setzen Sie gemini-3.7-flash hinter ein Feature-Flag. Steigt der Tokenverbrauch nach einem Upgrade, können Sie die Ebene oder das Modell ohne neue Codeveröffentlichung zurückstufen.
Alle drei Ebenen in Apidog testen
Benchmarkwerte liefern nur Verhältnisse. Für belastbare Entscheidungen brauchen Sie Ihre eigenen Prompts. Mit Apidog können Sie denselben Golden Prompt auf allen drei Ebenen ausführen und die Antworten, Tokenzahlen und Latenz vergleichen.
API-Schlüssel als Variable speichern
Erstellen Sie in einer Apidog-UmgebungGEMINI_API_KEYund verwenden Sie{{GEMINI_API_KEY}}im Headerx-goog-api-key. Legen Sie zusätzlichTHINKING_LEVELan.Eine Anfrage speichern
Verwenden Sie den Legacy-Endpunkt:
POST /v1beta/models/gemini-3.8-flash:generateContent
Setzen Sie im Request:
{
"thinkingConfig": {
"thinkingLevel": "{{THINKING_LEVEL}}"
}
}
Drei Testschritte anlegen
Importieren Sie dieselbe Anfrage dreimal und setzen SieTHINKING_LEVELjeweils auflow,mediumundhigh.Messwerte prüfen
Bestätigen Sie pro Schritt:
- HTTP-Status ist
200 -
usageMetadata.thoughtsTokenCountist vorhanden - Antwortzeit und Denk-Tokenzahl von
lowbleiben unter dem Grenzwert Ihrer Route
Speichern Sie die Messwerte beispielsweise per Post-Processor in Variablen. Der high-Schritt sollte mindestens so viele Denk-Tokens wie der low-Schritt verwenden. Eine Umkehrung weist auf eine Modell- oder Konfigurationsänderung hin.
Regressionstest für
minimalhinzufügen
Senden Sie zusätzlichthinkingLevel: "minimal"und erwarten Sie eine Antwort ungleich200, typischerweise400 INVALID_ARGUMENT.Szenario planen
Führen Sie den Test täglich aus. So werden Konfigurationsregressionen und stille Verhaltensänderungen sichtbar, bevor sie zu einer unerwarteten Rechnung führen. Die Einrichtung beschreibt der Artikel Wie man API-Tests in Apidog plant.
Für gestreamte Antworten funktioniert dasselbe Vorgehen mit SSE-Rendering. Eine Anleitung bietet Wie man LLM-APIs testet, die über SSE streamen. Der kostenlose Apidog-Plan deckt dieses Testszenario ab. Apidog herunterladen.
FAQ
Ändert die Denkebene den Preis pro Token?
Nein. Der Einführungspreis beträgt bei Gemini 3.8 Flash $0,75 pro Million Input- und $3,75 pro Million Output-Tokens – unabhängig von der Ebene. Die Ebene beeinflusst die Anzahl der Denk-Tokens, die als Output abgerechnet werden. Details zu Caching, Batch und der Preiserhöhung am 1. Januar finden Sie auf der Preisseite.
Kann ich ein exaktes Denk-Token-Budget festlegen?
Nein. Bei Gemini 3 ersetzt das Enum thinking_level das frühere thinking_budget. Gemini 3.8 Flash akzeptiert nur low, medium und high. Erzwingen Sie Obergrenzen stattdessen mit Tests und Alarmierungen.
Welche Ebene verwendet der Artificial-Analysis-Score von 59?
high. Artificial Analysis hat den Intelligence Index bei high berechnet und Kosten sowie Zeit für low und medium veröffentlicht, aber keine Indexwerte für diese Ebenen.
Sollte ich die Temperatur senken?
Nein. Google empfiehlt für Gemini 3 den Standardwert 1.0. Niedrigere Werte können Schleifen oder schlechtere Ausgaben verursachen. Verwenden Sie thinking_level, um die Überlegungstiefe zu steuern.
Was, wenn low immer noch zu langsam oder zu teuer ist?
Bleiben Sie bei Gemini 3.7 Flash, das laut Google weiterhin vollständig unterstützt wird, oder wechseln Sie für diese Route zu einem Flash-Lite-Modell. Der Vergleich zwischen Gemini 3.8 Flash und Gemini 3.7 Flash zeigt, wo zusätzliche Tokens messbare Qualitätsgewinne bringen.
Ebene pro Route wählen und messen
Gemini 3.8 Flash bietet drei Denkebenen, verwendet standardmäßig medium und kann bei komplexen Aufgaben mehr Tokens als sein Vorgänger verbrauchen. Setzen Sie thinking_level explizit pro Route, migrieren Sie minimal zu low und überwachen Sie usageMetadata.thoughtsTokenCount.
Die Artificial-Analysis-Werte von $0,24, $0,41 und $0,58 zeigen die Form der Kostenkurve. Ein dreistufiges Apidog-Szenario liefert Ihnen die Zahlen für Ihre eigenen Prompts – rechtzeitig vor der Preisänderung am 31. Dezember.
Top comments (0)