DEV Community

Cover image for Gemini 3.8 Flash Preise: Einführungspreise, Denk-Token und die realen Kosten pro Aufgabe
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 3.8 Flash Preise: Einführungspreise, Denk-Token und die realen Kosten pro Aufgabe

Gemini 3.8 Flash: Preise, Tokenverbrauch und Kostenkontrolle

Gemini 3.8 Flash kostet 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens – derselbe Einführungspreis wie bei Gemini 3.7 Flash. Dieser Preis gilt bis zum 31. Dezember 2026. Ab dem 1. Januar 2027 verdoppeln sich die Preise auf 1,50 $ beziehungsweise 7,50 $. Die gleiche Verdoppelung gilt an diesem Tag auch für Gemini 3.6 Flash und 3.7 Flash.

Apidog heute ausprobieren

Der Listenpreis pro Token ist also zunächst unverändert. Gestiegen ist jedoch die Anzahl der Tokens, die Gemini 3.8 Flash für eine Aufgabe verwendet.

Google beschreibt das Modell als leistungsfähigeres „Arbeitstier“: Es führt mehr Denkprozesse aus, ruft Tools iterativ auf und kann bei komplexen Aufgaben designbedingt mehr Tokens verbrauchen. Artificial Analysis hat diesen Effekt gemessen: Der Intelligence Index kostete mit Gemini 3.8 Flash auf hoher Denkstufe 0,58 $ pro Aufgabe gegenüber 0,40 $ bei Gemini 3.7 Flash – bei rund 30 % mehr Ausgabe-Tokens.

Gleicher Tokenpreis, höhere Rechnung.

Dieser Leitfaden zeigt:

  • die Preise von Gemini 3.8 Flash,
  • wie Denk-Tokens abgerechnet werden,
  • welche Auswirkungen die Denkstufe auf die Kosten hat,
  • wie sich 1.000 Aufgaben pro Tag auswirken,
  • wie Gemini 3.8 Flash im Vergleich zu Flash-Lite, Claude Sonnet 5 und GPT-5.6 Luna abschneidet,
  • wie Sie Kostenregressionen mit Apidog erkennen.

Für den grundlegenden Modellüberblick lesen Sie zunächst Was ist Gemini 3.8 Flash?.

Gemini-3.8-Flash-Preise auf einen Blick

Alle Preise gelten pro 1 Million Tokens auf der kostenpflichtigen Stufe.

Tarif Einführung bis 31. Dez. 2026 Standard ab 1. Jan. 2027
Eingabe: Text, Bild, Video, Audio, PDF 0,75 $ 1,50 $
Ausgabe inklusive Denk-Tokens 3,75 $ 7,50 $
Kontext-Cache-Lesen 0,075 $ 0,15 $
Cache-Speicher pro 1 Mio. Tokens/Stunde 0,50 $ 1,00 $
Batch-API-Eingabe, 50 % Rabatt 0,375 $ 0,75 $
Batch-API-Ausgabe, 50 % Rabatt 1,875 $ 3,75 $
Google-Search-Verankerung 5.000 kostenlose Anfragen pro Monat, danach 14 $ pro 1.000 Anfragen Gleich
Kostenlose Stufe 0 $, ratenbegrenzt; Daten werden zur Verbesserung von Google-Produkten verwendet Gleich

Die vollständige offizielle Gemini-API-Preisseite enthält die Details.

Drei Punkte sind besonders wichtig:

  1. Denk-Tokens werden als Ausgabe-Tokens mit 3,75 $ abgerechnet – nicht als Eingabe-Tokens.
  2. Der Einführungspreis endet definitiv am 31. Dezember 2026.
  3. Auch Gemini 3.6 Flash und 3.7 Flash werden am 1. Januar 2027 teurer. Ein älteres Modell schützt Sie daher nicht automatisch vor der Preiserhöhung.

Die Preisaufschlüsselung für Gemini 3.7 Flash zeigt dieselben Raten für ein Modell, das pro Aufgabe weniger Tokens verbraucht.

Denk-Tokens sind Ausgabe-Tokens

Gemini 3.8 Flash verarbeitet eine Anfrage zunächst intern und antwortet anschließend. Jeder Token dieses Denkprozesses wird als Ausgabe-Token gezählt.

In einer generateContent-Antwort finden Sie die Werte in usageMetadata:

  • promptTokenCount: Eingabe-Tokens,
  • thoughtsTokenCount: interne Denk-Tokens,
  • candidatesTokenCount: sichtbare Ausgabe-Tokens.

Denk- und sichtbare Ausgabe-Tokens werden gemeinsam mit 3,75 $ pro Million Tokens abgerechnet.

Die Denkintensität steuern Sie über:

thinking_level: low | medium | high
Enter fullscreen mode Exit fullscreen mode

Der Standardwert für Gemini 3.8 Flash ist medium. Die Stufe minimal wurde entfernt und führt zu einem Validierungsfehler. Übernommene Konfigurationen müssen diesen Wert daher auf low abbilden.

Google beschreibt die Denkstufen als relativen Aufwand, nicht als festes Token-Budget. Denk-Tokens lassen sich deshalb nicht direkt begrenzen, wie es beim älteren ganzzahligen Attribut thinking_budget möglich war. Für die praktischen Unterschiede zwischen den Stufen siehe den Leitfaden zu den Denkstufen von Gemini 3.8 Flash.

Beispielrechnung

Angenommen, eine Anfrage verwendet:

  • 10.000 Eingabe-Tokens,
  • 2.000 sichtbare Ausgabe-Tokens,
  • 6.000 Denk-Tokens.

Bei den Einführungspreisen ergibt sich:

Eingabe: 10.000 × 0,75 $ / 1.000.000 = 0,0075 $
Ausgabe: (2.000 + 6.000) × 3,75 $ / 1.000.000 = 0,03 $
Gesamt: 0,0375 $ pro Anfrage
Enter fullscreen mode Exit fullscreen mode

Die Denk-Tokens verursachen 75 % der Ausgabekosten und 60 % der Gesamtkosten.

Ab dem 1. Januar 2027 kostet dieselbe Anfrage:

Eingabe: 0,015 $
Ausgabe: 0,06 $
Gesamt: 0,075 $
Enter fullscreen mode Exit fullscreen mode

„Gleicher Preis wie Gemini 3.7 Flash“ ist daher nur die halbe Wahrheit: Der Preis pro Token bleibt zunächst gleich, der Tokenverbrauch steigt.

Warum die Kosten pro Aufgabe steigen

Googles Startbeitrag zu Gemini 3.8 Flash beschreibt den Kompromiss direkt: Bei komplexen Aufgaben führt das Modell zusätzliche Denkprozesse aus und ruft Tools iterativ auf, um Ergebnisse zu überprüfen.

Mehr Verarbeitungsschritte bedeuten:

  • mehr Denk-Tokens,
  • mehr Tool-Aufrufe in Agent-Schleifen,
  • höhere Kosten pro Aufgabe,
  • häufig längere Laufzeiten.

Google empfiehlt, bei Bedarf die Denkstufe zu reduzieren oder bei Gemini 3.7 Flash zu bleiben.

Artificial Analysis hat den Effekt im Benchmark zu Gemini 3.8 Flash quantifiziert:

Konfiguration Kosten pro Aufgabe Zeit pro Aufgabe
Gemini 3.8 Flash, high 0,58 $ 2,5 Min.
Gemini 3.8 Flash, medium 0,41 $ nicht veröffentlicht
Gemini 3.8 Flash, low 0,24 $ 0,8 Min.
Gemini 3.7 Flash, high 0,40 $ 2,2 Min.

Die Werte stammen aus dem Intelligence Index von Artificial Analysis.

Daraus folgen drei praktische Vergleiche:

  • high bei Gemini 3.8 Flash kostet gegenüber Gemini 3.7 Flash rund 45 % mehr pro Aufgabe: 0,58 / 0,40 = 1,45.
  • Der Wechsel von high zu medium reduziert die Kosten bei Gemini 3.8 Flash um etwa 29 %.
  • Der Wechsel von high zu low reduziert die Kosten um etwa 59 %.

medium bei Gemini 3.8 Flash liegt damit nur etwa einen Cent über high bei Gemini 3.7 Flash. Der Vergleich zwischen Gemini 3.8 Flash und 3.7 Flash hilft bei der Entscheidung pro Arbeitslast.

Artificial Analysis nennt außerdem einen Mischpreis von 0,58 $ pro Million Tokens bei einem Eingabe-Ausgabe-Verhältnis von 3:1. Dass dieser Wert mit den Kosten pro Aufgabe bei high übereinstimmt, ist Zufall: Der Mischpreis hängt vom Tokenverhältnis ab, während die Kosten pro Aufgabe davon abhängen, wie viele Tokens das Modell tatsächlich erzeugt.

Einführungspreise vor dem 31. Dezember nutzen

„Einführungspreis sichern“ bedeutet nicht, dass Sie Nutzung für 2027 im Voraus bezahlen können. Google rechnet jeden Token mit dem Preis ab, der zum Zeitpunkt seines Verbrauchs gilt.

Sie können jedoch batchfähige oder diskretionäre Arbeiten vorziehen:

  • Führen Sie Rückläufe und einmalige Dokumentenverarbeitung noch 2026 über die Batch API aus.
  • Erstellen Sie Evaluierungssets und Basiswerte für den Tokenverbrauch vor der Preisänderung.
  • Legen Sie für jede Produktionsroute eine Denkstufe fest.
  • Wechseln Sie Routen, die mit low zuverlässig bestehen, bereits vor Januar auf low.

Batch-Beispiel

Ein Rücklauf mit insgesamt 100 Millionen Tokens – 75 Millionen Eingabe- und 25 Millionen Ausgabe-Tokens – kostet 2026 im Batch:

75 × 0,375 $ + 25 × 1,875 $
= 28,13 $ + 46,88 $
= 74,99 $
Enter fullscreen mode Exit fullscreen mode

Ab Januar 2027 kostet derselbe Rücklauf 149,98 $.

Für einen breiteren Marktüberblick lesen Sie den Vergleich der günstigsten LLM-API-Anbieter. Premium-Alternativen behandelt der Vergleich von Fable 5.1 und GPT-5.6 Sol.

Vergleich mit Flash-Lite, Sonnet 5 und GPT-5.6 Luna

Preise pro 1 Million Tokens:

Modell Eingabe Ausgabe Anmerkungen
Gemini 3.8 Flash, Einführung 0,75 $ 3,75 $ Denk-Tokens als Ausgabe; Cache-Lesen 0,075 $
Gemini 3.8 Flash, ab 1. Jan. 1,50 $ 7,50 $ Cache-Lesen 0,15 $
Gemini 3.5 Flash-Lite 0,30 $ 2,50 $ Ca. 350 Tokens/s
Claude Sonnet 5 2 $ 10 $ Dauerhaft; die Preiserhöhung vom 1. September wurde storniert
GPT-5.6 Luna 1 $ 6 $ das 1,3-Fache.
  • Flash-Lite bleibt durchgehend günstiger.

Der reine Tokenpreis reicht für eine Modellauswahl nicht aus. Ein Modell mit höherem Tokenpreis kann pro Aufgabe günstiger sein, wenn es deutlich weniger Tokens verbraucht. Lassen Sie deshalb denselben Aufgabensatz durch jedes Modell laufen und vergleichen Sie die tatsächlichen Nutzungswerte.

Der Gemini-3.8-Flash-API-Leitfaden zeigt, wie Sie usageMetadata sowohl mit der Interactions API als auch mit der älteren generateContent-API auslesen.

Kostenregressionen mit Apidog erkennen

Das typische Problem bei Gemini 3.8 Flash ist nicht zwingend eine falsche Antwort. Es ist eine korrekte Antwort, die nach einer Prompt-Änderung oder einer neuen Denkstufe plötzlich 40 % mehr Tokens verwendet.

Mit Apidog können Sie Tokenzahlen wie Statuscodes behandeln und Assertions darauf ausführen.

1. API-Schlüssel als Umgebungsvariable speichern

Erstellen Sie in einer Apidog-Umgebung die Variable GEMINI_API_KEY und verwenden Sie sie im Header:

x-goog-[REDACTED CREDENTIAL]
Enter fullscreen mode Exit fullscreen mode

Der Schlüssel bleibt damit aus gespeicherten Anfragen und Skripten heraus.

2. Golden Prompt senden

Speichern Sie für jede Produktionsroute eine repräsentative POST-Anfrage an:

https://generativelanguage.googleapis.com/v1beta/models/gemini-3.8-flash:generateContent
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie dabei eine explizite Denkstufe, zum Beispiel:

{
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
Enter fullscreen mode Exit fullscreen mode

3. Nutzungsfelder prüfen

Fügen Sie ein Post-Processor-Skript hinzu, das den Lauf bei einer Überschreitung Ihrer Basiswerte fehlschlagen lässt:

const usage = pm.response.json().usageMetadata;

pm.test("Denk-Tokens innerhalb des Budgets", () => {
  pm.expect(usage.thoughtsTokenCount).to.be.below(8000);
});

pm.test("sichtbare Ausgabe innerhalb des Budgets", () => {
  pm.expect(usage.candidatesTokenCount).to.be.below(2500);
});

pm.test("Anfragekosten innerhalb des Budgets", () => {
  const cost = usage.promptTokenCount * 0.75 / 1e6
    + (usage.thoughtsTokenCount + usage.candidatesTokenCount) * 3.75 / 1e6;

  pm.expect(cost).to.be.below(0.05);
});
Enter fullscreen mode Exit fullscreen mode

Apidog-Assertion zur Token-Nutzung

4. Tests regelmäßig ausführen

Fügen Sie die Anfrage in ein Testszenario ein und planen Sie regelmäßige Läufe. Ein Anstieg des Tokenverbrauchs wird dann am selben Tag als fehlgeschlagener Test sichtbar.

Der Leitfaden zum Planen von API-Tests in Apidog beschreibt die Einrichtung. Aktualisieren Sie am 1. Januar 2027 die beiden Preiskonstanten im Skript:

const inputPrice = 1.50;
const outputPrice = 7.50;
Enter fullscreen mode Exit fullscreen mode

Das gleiche Testszenario eignet sich für den Anbietervergleich. Erstellen Sie Kopien für Flash-Lite, Sonnet 5 und Luna und vergleichen Sie die Nutzungsfelder nebeneinander.

Apidog herunterladen; der kostenlose Plan deckt diesen Workflow ab.

FAQ

Kostet Gemini 3.8 Flash mehr als 3.7 Flash?

Pro Token zunächst nicht. Beide Modelle kosten bis zum 31. Dezember 2026 0,75 $ für Eingabe-Tokens und 3,75 $ für Ausgabe-Tokens. Danach steigen die Preise auf 1,50 $ und 7,50 $.

Pro Aufgabe kostet Gemini 3.8 Flash jedoch mehr: Artificial Analysis maß 0,58 $ pro Indexaufgabe bei high, gegenüber 0,40 $ bei Gemini 3.7 Flash. Der Grund sind rund 30 % mehr Ausgabe-Tokens.

Werden Denk-Tokens separat abgerechnet?

Nein. Sie werden als Ausgabe-Tokens mit 3,75 $ pro Million Tokens abgerechnet und erscheinen unter usageMetadata.thoughtsTokenCount.

Sie steuern den Verbrauch indirekt über thinking_level. Ein festes Token-Budget gibt es bei Gemini 3.8 Flash nicht. Die Einstellung minimal führt zu einem Fehler.

Gibt es eine kostenlose Stufe?

Ja. Die kostenlose Stufe von AI Studio berechnet nichts für Eingabe oder Ausgabe, ist aber ratenbegrenzt. Google verwendet Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte.

Die Verbraucher-App Gemini bietet Gemini 3.8 Flash nur für AI-Pro- und Ultra-Abonnenten an. Weitere Informationen enthält der Leitfaden zur kostenlosen Nutzung von Gemini 3.8 Flash.

Was passiert mit den Kosten am 1. Januar 2027?

Eingabe-, Ausgabe-, Cache-Lese-, Cache-Speicher- und Batch-Preise verdoppeln sich. Bleibt der Tokenverbrauch pro Aufgabe gleich, verdoppelt sich auch Ihre Rechnung.

Die Preise von Gemini 3.6 Flash und 3.7 Flash steigen am selben Tag.

Welche Denkstufe hält die Kosten niedrig?

Artificial Analysis nennt folgende Orientierung:

  • low: 0,24 $ pro Indexaufgabe,
  • medium: 0,41 $,
  • high: 0,58 $.

Führen Sie eigene Evaluierungen durch und wählen Sie die niedrigste Denkstufe, die Ihre Qualitätsanforderungen erfüllt. Überwachen Sie zusätzlich die Tokenzahlen, damit die Konfiguration nicht unbemerkt abweicht.

Was Sie diese Woche tun sollten

  1. Erfassen Sie den aktuellen Tokenverbrauch pro Route.
  2. Evaluieren Sie low, medium und high mit einem repräsentativen Aufgabensatz.
  3. Setzen Sie pro Route die niedrigste ausreichend gute Denkstufe.
  4. Verschieben Sie batchfähige Arbeiten vor den 31. Dezember 2026.
  5. Überwachen Sie thoughtsTokenCount, candidatesTokenCount und die berechneten Kosten mit Apidog.
  6. Aktualisieren Sie die Preiskonstanten am 1. Januar 2027.

Gemini 3.8 Flash ist beim Tokenpreis mit Gemini 3.7 Flash vergleichbar, verbraucht aber Tokens wie ein größeres Modell. Behandeln Sie die Denkstufe deshalb als echte Kosteneinstellung – nicht als reine Qualitätsoption.

Top comments (0)