DEV Community

Cover image for Gemini 3.6 Flash Preise: Was es 2026 wirklich kostet
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Gemini 3.6 Flash Preise: Was es 2026 wirklich kostet

Gemini 3.6 Flash kostet $1.50 pro 1 Mio. Eingabetokens und $7.50 pro 1 Mio. Ausgabetokens. Damit ist es günstiger als das Modell, das es ersetzt. Google veröffentlichte das Update am 21. Juli 2026. Für API-Projekte bedeutet das: Der bewährte Flash-Tarif ist schneller und zugleich kostengünstiger geworden.

Teste Apidog noch heute

Dieser Leitfaden zeigt die Token-Preise, Kosten für Kontext-Caching, die Grenzen des kostenlosen Tarifs und eine konkrete Monatskalkulation. Alle Preise stammen aus den offiziellen Gemini API-Preisdokumenten und der Ankündigung zum Release. Eine allgemeine Einführung findest du unter Was ist Gemini 3.6 Flash?.

Wichtig zur Versionsnummer: Das Hauptmodell heißt Gemini 3.6 Flash. Die günstigere Lite-Variante bleibt bei Gemini 3.5 Flash-Lite. Beide wurden gemeinsam veröffentlicht, tragen aber unterschiedliche Versionsnummern.

Gemini 3.6 Flash: Preise auf einen Blick

Posten Kosten
Eingabe $1.50 pro 1 Mio. Tokens
Ausgabe, inklusive Denk-Tokens $7.50 pro 1 Mio. Tokens
Kontext-Caching: Lesen zwischengespeicherter Eingaben $0.15 pro 1 Mio. Tokens
Kontext-Caching: Speicherung $1.00 pro 1 Mio. Tokens pro Stunde
Kostenloser Tarif Ja, über Google AI Studio, ratelimitiert

Beachte dabei zwei Details:

  1. Denk-Tokens sind bereits im Ausgabepreis enthalten. Wenn das Modell vor der Antwort mehr Reasoning ausführt, zählen diese Tokens zur Ausgabe und werden mit $7.50 pro 1 Mio. Tokens abgerechnet.
  2. Kontext-Caching hat Lese- und Speicherkosten. Der Cache senkt die Kosten für wiederholte Eingaben, verursacht aber eine stündliche Speichergebühr. Er lohnt sich daher vor allem für häufig wiederverwendete Prompt-Präfixe, System-Prompts oder Referenzdokumente.

Vergleich: Gemini 3.6 Flash vs. Gemini 3.5 Flash

Die Ausgaberate ist von $9.00 pro 1 Mio. Tokens bei Gemini 3.5 Flash auf $7.50 bei Gemini 3.6 Flash gefallen.

Das entspricht rund 17 % niedrigeren Kosten pro Ausgabetoken.

Zusätzlich berichtet Google auf der DeepMind Flash-Modellseite, dass Gemini 3.6 Flash für dieselbe Aufgabe ungefähr 17 % weniger Ausgabetokens erzeugt. Das Modell benötigt weniger Denkschritte und Tool-Aufrufe bei mehrstufigen Aufgaben.

Damit wirken zwei Effekte zusammen:

  • geringerer Preis pro Ausgabetoken
  • weniger erzeugte Ausgabetokens

Wenn du bisher mit Gemini 3.5 Flash budgetiert hast, vergleiche die Werte mit der Gemini-3.5-Flash-Preisübersicht. Einen Funktions- und Benchmark-Vergleich findest du unter Gemini 3.6 Flash vs. 3.5 Flash.

Kostenloser Tarif: Wofür er geeignet ist

Über Google AI Studio kannst du Gemini 3.6 Flash ohne Kreditkarte testen und Prototypen bauen.

Der kostenlose Tarif eignet sich für:

  • lokale Experimente
  • Prompt-Tests
  • Proofs of Concept
  • leichte Entwicklungs- und Testworkloads

Für Produktionsverkehr ist er nicht gedacht:

  • Der Tarif ist ratelimitiert.
  • Google kann Daten aus dem kostenlosen Tarif zur Produktverbesserung verwenden.
  • Sensible, proprietäre oder Kundendaten gehören daher nicht in diesen Tarif.

Plane den Wechsel auf einen kostenpflichtigen API-Schlüssel ein, bevor du eine Anwendung produktiv schaltest. Details zur Einrichtung findest du unter Gemini 3.6 Flash kostenlos nutzen.

Kostenbeispiel: Agent mit viel Kontext und kurzen Antworten

Angenommen, dein Agent verarbeitet pro Tag:

  • 2 Mio. Eingabetokens
  • 500.000 Ausgabetokens

Das passt beispielsweise zu einem RAG-Assistenten, der viele Dokumente liest und kompakte Antworten erzeugt.

Tageskosten für Gemini 3.6 Flash

Eingabe:
2.000.000 / 1.000.000 × $1.50 = $3.00

Ausgabe:
500.000 / 1.000.000 × $7.50 = $3.75

Gesamt pro Tag:
$3.00 + $3.75 = $6.75

Gesamt pro Monat bei 30 Tagen:
$6.75 × 30 = $202.50
Enter fullscreen mode Exit fullscreen mode

Du kannst dieselbe Rechnung direkt in Code abbilden:

const inputTokens = 2_000_000;
const outputTokens = 500_000;

const inputPricePerMillion = 1.50;
const outputPricePerMillion = 7.50;

const dailyInputCost = (inputTokens / 1_000_000) * inputPricePerMillion;
const dailyOutputCost = (outputTokens / 1_000_000) * outputPricePerMillion;

const dailyCost = dailyInputCost + dailyOutputCost;
const monthlyCost = dailyCost * 30;

console.log({
  dailyInputCost,
  dailyOutputCost,
  dailyCost,
  monthlyCost,
});
Enter fullscreen mode Exit fullscreen mode

Erwartetes Ergebnis:

{
  dailyInputCost: 3,
  dailyOutputCost: 3.75,
  dailyCost: 6.75,
  monthlyCost: 202.5
}
Enter fullscreen mode Exit fullscreen mode

Warum die tatsächliche Ersparnis größer sein kann

Nehmen wir an, dieselbe Aufgabe hätte mit Gemini 3.5 Flash 600.000 Ausgabetokens erzeugt.

Modell Ausgabetokens Preis pro 1 Mio. Kosten pro Tag
Gemini 3.5 Flash 600.000 $9.00 $5.40
Gemini 3.6 Flash 500.000 $7.50 $3.75

Die Ersparnis bei der Ausgabe beträgt:

$5.40 - $3.75 = $1.65 pro Tag
$1.65 × 30 = $49.50 pro Monat
Enter fullscreen mode Exit fullscreen mode

Das sind rund 31 % weniger Ausgabekosten. Der Effekt ist größer als die einzelne Preissenkung, weil Gemini 3.6 Flash sowohl weniger kostet als auch weniger Ausgabetokens erzeugen kann.

Flash-Lite: Günstiger für einfache Workloads

Für einfache Aufgaben gibt es Gemini 3.5 Flash-Lite:

Posten Kosten
Eingabe $0.30 pro 1 Mio. Tokens
Ausgabe $2.50 pro 1 Mio. Tokens
Cache-Lesevorgänge $0.03 pro 1 Mio. Tokens
Cache-Speicherung $1.00 pro 1 Mio. Tokens pro Stunde

Flash-Lite erzeugt laut den genannten Angaben etwa 350 Ausgabetokens pro Sekunde.

Bei derselben Arbeitslast aus dem Beispiel:

2 Mio. Eingabetokens
500.000 Ausgabetokens
Enter fullscreen mode Exit fullscreen mode

ergibt sich:

Eingabe:
2 × $0.30 = $0.60

Ausgabe:
0.5 × $2.50 = $1.25

Gesamt pro Tag:
$1.85

Gesamt pro Monat:
$55.50
Enter fullscreen mode Exit fullscreen mode

Das ist bei gleicher Tokenmenge ungefähr 70 % günstiger als Gemini 3.6 Flash.

Nutze Flash-Lite gezielt für:

  • Klassifizierung
  • Extraktion
  • Routing
  • kurze strukturierte Antworten
  • andere Aufgaben mit hohem Volumen und geringer Komplexität

Nutze Gemini 3.6 Flash für komplexere mehrstufige Denkprozesse. Das ist kein bloßes „kleineres“ Modell, sondern ein anderer Punkt auf der Kosten-, Qualitäts- und Latenzkurve.

Weitere Details:

So misst und kontrollierst du deine Kosten

Diese vier Maßnahmen haben den größten Hebel.

1. Wiederholten Kontext cachen

Wenn viele Requests denselben System-Prompt oder dieselben Referenzdokumente enthalten, kann Kontext-Caching die Lesekosten von $1.50 auf $0.15 pro 1 Mio. Tokens senken.

Berücksichtige aber immer die Speichergebühr von $1.00 pro 1 Mio. Tokens pro Stunde. Caching lohnt sich, wenn du denselben Kontext innerhalb kurzer Zeit häufig wiederverwendest.

2. Prompts und Ausgaben begrenzen

Die Ausgabe ist fünfmal teurer als die Eingabe. Trotzdem werden auch große Eingabeprompt bei hohem Traffic teuer.

Praktische Maßnahmen:

  • Boilerplate im System-Prompt reduzieren
  • irrelevante Dokumentabschnitte vor dem Request entfernen
  • maximale Ausgabetokens begrenzen
  • strukturierte, kurze Ausgabeformate verlangen

3. Einfache Requests an Flash-Lite routen

Verwende nicht für jede Aufgabe dasselbe Modell. Ein einfaches Routing kann beispielsweise so aussehen:

function selectModel(taskType) {
  const simpleTasks = ["classification", "extraction", "routing"];

  return simpleTasks.includes(taskType)
    ? "gemini-3.5-flash-lite"
    : "gemini-3.6-flash";
}
Enter fullscreen mode Exit fullscreen mode

Damit reservierst du Gemini 3.6 Flash für anspruchsvollere Aufgaben und senkst die Kosten für Routine-Requests.

4. Tatsächlichen Token-Verbrauch auswerten

Schätzungen reichen nicht aus. Prüfe bei jeder Gemini-Antwort die usageMetadata. Diese Metadaten enthalten die tatsächliche Zahl der Eingabe-, Ausgabe- und Denk-Tokens, auf denen deine Rechnung basiert.

Speichere die Werte pro Request, zum Beispiel in Logs oder Metriken:

const usage = response.usageMetadata;

console.log({
  inputTokens: usage.promptTokenCount,
  outputTokens: usage.candidatesTokenCount,
  totalTokens: usage.totalTokenCount,
});
Enter fullscreen mode Exit fullscreen mode

So erkennst du Prompt-Änderungen, die den Verbrauch unerwartet erhöhen.

In Apidog kannst du POST-Requests an die Gemini API erstellen, API-Schlüssel über Umgebungsvariablen verwalten und echte Prompts gegen den Endpunkt testen. Prüfe die usageMetadata direkt in der Response und ergänze Assertions, damit ein unerwarteter Anstieg der Ausgabetokens einen Test fehlschlagen lässt.

Du kannst API-Tests auch planen, um Kostenregressionen frühzeitig zu erkennen. Zum Einstieg kannst du Apidog herunterladen und einen Gemini-Request vor der Produktionsintegration nachbauen.

FAQ

Wie viel kostet Gemini 3.6 Flash pro 1 Mio. Tokens?

$1.50 für Eingabetokens und $7.50 für Ausgabetokens. Cache-Lesevorgänge kosten $0.15 pro 1 Mio. Tokens, die Cache-Speicherung $1.00 pro 1 Mio. Tokens und Stunde.

Enthält der Ausgabepreis Denk-Tokens?

Ja. Denk-Tokens werden mit der Ausgaberate von $7.50 abgerechnet. Es gibt keinen separaten Preis, aber mehr Reasoning erhöht die gesamte Tokenmenge und damit die Kosten.

Gibt es einen kostenlosen Tarif?

Ja, über Google AI Studio. Er ist ratelimitiert und für Prototyping sowie Tests gedacht. Da Google Daten aus dem kostenlosen Tarif zur Produktverbesserung verwenden kann, solltest du keine sensiblen Daten darüber verarbeiten.

Ist Gemini 3.6 Flash günstiger als Gemini 3.5 Flash?

Ja. Die Ausgaberate sank von $9.00 auf $7.50 pro 1 Mio. Tokens. Zusätzlich kann Gemini 3.6 Flash für dieselbe Aufgabe etwa 17 % weniger Ausgabetokens erzeugen. Dadurch kann die Ausgaberechnung im Beispiel um rund 31 % sinken.

Wann sollte ich Flash-Lite verwenden?

Für einfache Aufgaben mit hohem Volumen, etwa Klassifizierung, Extraktion und Routing. Mit $0.30 für Eingaben und $2.50 für Ausgaben ist Flash-Lite deutlich günstiger, während Gemini 3.6 Flash besser für komplexere Denkaufgaben geeignet ist.

Gemini 3.6 Flash kombiniert niedrigere Preise mit geringerem Ausgabetoken-Verbrauch. Budgetiere mit $1.50 pro 1 Mio. Eingabetokens und $7.50 pro 1 Mio. Ausgabetokens, berücksichtige Denk-Tokens in der Ausgabe und nutze Caching sowie Flash-Lite-Routing gezielt.

Für den historischen Vergleich der Gemini-API-Kosten hilft die Gemini-3.0-API-Kostenübersicht. Miss anschließend deine realen Requests in Apidog, damit dein geplantes Token-Budget auch deiner tatsächlichen Rechnung entspricht.

Top comments (0)