Gemini 3.6 Flash kostet $1.50 pro 1 Mio. Eingabetokens und $7.50 pro 1 Mio. Ausgabetokens. Damit ist es günstiger als das Modell, das es ersetzt. Google veröffentlichte das Update am 21. Juli 2026. Für API-Projekte bedeutet das: Der bewährte Flash-Tarif ist schneller und zugleich kostengünstiger geworden.
Dieser Leitfaden zeigt die Token-Preise, Kosten für Kontext-Caching, die Grenzen des kostenlosen Tarifs und eine konkrete Monatskalkulation. Alle Preise stammen aus den offiziellen Gemini API-Preisdokumenten und der Ankündigung zum Release. Eine allgemeine Einführung findest du unter Was ist Gemini 3.6 Flash?.
Wichtig zur Versionsnummer: Das Hauptmodell heißt Gemini 3.6 Flash. Die günstigere Lite-Variante bleibt bei Gemini 3.5 Flash-Lite. Beide wurden gemeinsam veröffentlicht, tragen aber unterschiedliche Versionsnummern.
Gemini 3.6 Flash: Preise auf einen Blick
| Posten | Kosten |
|---|---|
| Eingabe | $1.50 pro 1 Mio. Tokens |
| Ausgabe, inklusive Denk-Tokens | $7.50 pro 1 Mio. Tokens |
| Kontext-Caching: Lesen zwischengespeicherter Eingaben | $0.15 pro 1 Mio. Tokens |
| Kontext-Caching: Speicherung | $1.00 pro 1 Mio. Tokens pro Stunde |
| Kostenloser Tarif | Ja, über Google AI Studio, ratelimitiert |
Beachte dabei zwei Details:
- Denk-Tokens sind bereits im Ausgabepreis enthalten. Wenn das Modell vor der Antwort mehr Reasoning ausführt, zählen diese Tokens zur Ausgabe und werden mit $7.50 pro 1 Mio. Tokens abgerechnet.
- Kontext-Caching hat Lese- und Speicherkosten. Der Cache senkt die Kosten für wiederholte Eingaben, verursacht aber eine stündliche Speichergebühr. Er lohnt sich daher vor allem für häufig wiederverwendete Prompt-Präfixe, System-Prompts oder Referenzdokumente.
Vergleich: Gemini 3.6 Flash vs. Gemini 3.5 Flash
Die Ausgaberate ist von $9.00 pro 1 Mio. Tokens bei Gemini 3.5 Flash auf $7.50 bei Gemini 3.6 Flash gefallen.
Das entspricht rund 17 % niedrigeren Kosten pro Ausgabetoken.
Zusätzlich berichtet Google auf der DeepMind Flash-Modellseite, dass Gemini 3.6 Flash für dieselbe Aufgabe ungefähr 17 % weniger Ausgabetokens erzeugt. Das Modell benötigt weniger Denkschritte und Tool-Aufrufe bei mehrstufigen Aufgaben.
Damit wirken zwei Effekte zusammen:
- geringerer Preis pro Ausgabetoken
- weniger erzeugte Ausgabetokens
Wenn du bisher mit Gemini 3.5 Flash budgetiert hast, vergleiche die Werte mit der Gemini-3.5-Flash-Preisübersicht. Einen Funktions- und Benchmark-Vergleich findest du unter Gemini 3.6 Flash vs. 3.5 Flash.
Kostenloser Tarif: Wofür er geeignet ist
Über Google AI Studio kannst du Gemini 3.6 Flash ohne Kreditkarte testen und Prototypen bauen.
Der kostenlose Tarif eignet sich für:
- lokale Experimente
- Prompt-Tests
- Proofs of Concept
- leichte Entwicklungs- und Testworkloads
Für Produktionsverkehr ist er nicht gedacht:
- Der Tarif ist ratelimitiert.
- Google kann Daten aus dem kostenlosen Tarif zur Produktverbesserung verwenden.
- Sensible, proprietäre oder Kundendaten gehören daher nicht in diesen Tarif.
Plane den Wechsel auf einen kostenpflichtigen API-Schlüssel ein, bevor du eine Anwendung produktiv schaltest. Details zur Einrichtung findest du unter Gemini 3.6 Flash kostenlos nutzen.
Kostenbeispiel: Agent mit viel Kontext und kurzen Antworten
Angenommen, dein Agent verarbeitet pro Tag:
- 2 Mio. Eingabetokens
- 500.000 Ausgabetokens
Das passt beispielsweise zu einem RAG-Assistenten, der viele Dokumente liest und kompakte Antworten erzeugt.
Tageskosten für Gemini 3.6 Flash
Eingabe:
2.000.000 / 1.000.000 × $1.50 = $3.00
Ausgabe:
500.000 / 1.000.000 × $7.50 = $3.75
Gesamt pro Tag:
$3.00 + $3.75 = $6.75
Gesamt pro Monat bei 30 Tagen:
$6.75 × 30 = $202.50
Du kannst dieselbe Rechnung direkt in Code abbilden:
const inputTokens = 2_000_000;
const outputTokens = 500_000;
const inputPricePerMillion = 1.50;
const outputPricePerMillion = 7.50;
const dailyInputCost = (inputTokens / 1_000_000) * inputPricePerMillion;
const dailyOutputCost = (outputTokens / 1_000_000) * outputPricePerMillion;
const dailyCost = dailyInputCost + dailyOutputCost;
const monthlyCost = dailyCost * 30;
console.log({
dailyInputCost,
dailyOutputCost,
dailyCost,
monthlyCost,
});
Erwartetes Ergebnis:
{
dailyInputCost: 3,
dailyOutputCost: 3.75,
dailyCost: 6.75,
monthlyCost: 202.5
}
Warum die tatsächliche Ersparnis größer sein kann
Nehmen wir an, dieselbe Aufgabe hätte mit Gemini 3.5 Flash 600.000 Ausgabetokens erzeugt.
| Modell | Ausgabetokens | Preis pro 1 Mio. | Kosten pro Tag |
|---|---|---|---|
| Gemini 3.5 Flash | 600.000 | $9.00 | $5.40 |
| Gemini 3.6 Flash | 500.000 | $7.50 | $3.75 |
Die Ersparnis bei der Ausgabe beträgt:
$5.40 - $3.75 = $1.65 pro Tag
$1.65 × 30 = $49.50 pro Monat
Das sind rund 31 % weniger Ausgabekosten. Der Effekt ist größer als die einzelne Preissenkung, weil Gemini 3.6 Flash sowohl weniger kostet als auch weniger Ausgabetokens erzeugen kann.
Flash-Lite: Günstiger für einfache Workloads
Für einfache Aufgaben gibt es Gemini 3.5 Flash-Lite:
| Posten | Kosten |
|---|---|
| Eingabe | $0.30 pro 1 Mio. Tokens |
| Ausgabe | $2.50 pro 1 Mio. Tokens |
| Cache-Lesevorgänge | $0.03 pro 1 Mio. Tokens |
| Cache-Speicherung | $1.00 pro 1 Mio. Tokens pro Stunde |
Flash-Lite erzeugt laut den genannten Angaben etwa 350 Ausgabetokens pro Sekunde.
Bei derselben Arbeitslast aus dem Beispiel:
2 Mio. Eingabetokens
500.000 Ausgabetokens
ergibt sich:
Eingabe:
2 × $0.30 = $0.60
Ausgabe:
0.5 × $2.50 = $1.25
Gesamt pro Tag:
$1.85
Gesamt pro Monat:
$55.50
Das ist bei gleicher Tokenmenge ungefähr 70 % günstiger als Gemini 3.6 Flash.
Nutze Flash-Lite gezielt für:
- Klassifizierung
- Extraktion
- Routing
- kurze strukturierte Antworten
- andere Aufgaben mit hohem Volumen und geringer Komplexität
Nutze Gemini 3.6 Flash für komplexere mehrstufige Denkprozesse. Das ist kein bloßes „kleineres“ Modell, sondern ein anderer Punkt auf der Kosten-, Qualitäts- und Latenzkurve.
Weitere Details:
So misst und kontrollierst du deine Kosten
Diese vier Maßnahmen haben den größten Hebel.
1. Wiederholten Kontext cachen
Wenn viele Requests denselben System-Prompt oder dieselben Referenzdokumente enthalten, kann Kontext-Caching die Lesekosten von $1.50 auf $0.15 pro 1 Mio. Tokens senken.
Berücksichtige aber immer die Speichergebühr von $1.00 pro 1 Mio. Tokens pro Stunde. Caching lohnt sich, wenn du denselben Kontext innerhalb kurzer Zeit häufig wiederverwendest.
2. Prompts und Ausgaben begrenzen
Die Ausgabe ist fünfmal teurer als die Eingabe. Trotzdem werden auch große Eingabeprompt bei hohem Traffic teuer.
Praktische Maßnahmen:
- Boilerplate im System-Prompt reduzieren
- irrelevante Dokumentabschnitte vor dem Request entfernen
- maximale Ausgabetokens begrenzen
- strukturierte, kurze Ausgabeformate verlangen
3. Einfache Requests an Flash-Lite routen
Verwende nicht für jede Aufgabe dasselbe Modell. Ein einfaches Routing kann beispielsweise so aussehen:
function selectModel(taskType) {
const simpleTasks = ["classification", "extraction", "routing"];
return simpleTasks.includes(taskType)
? "gemini-3.5-flash-lite"
: "gemini-3.6-flash";
}
Damit reservierst du Gemini 3.6 Flash für anspruchsvollere Aufgaben und senkst die Kosten für Routine-Requests.
4. Tatsächlichen Token-Verbrauch auswerten
Schätzungen reichen nicht aus. Prüfe bei jeder Gemini-Antwort die usageMetadata. Diese Metadaten enthalten die tatsächliche Zahl der Eingabe-, Ausgabe- und Denk-Tokens, auf denen deine Rechnung basiert.
Speichere die Werte pro Request, zum Beispiel in Logs oder Metriken:
const usage = response.usageMetadata;
console.log({
inputTokens: usage.promptTokenCount,
outputTokens: usage.candidatesTokenCount,
totalTokens: usage.totalTokenCount,
});
So erkennst du Prompt-Änderungen, die den Verbrauch unerwartet erhöhen.
In Apidog kannst du POST-Requests an die Gemini API erstellen, API-Schlüssel über Umgebungsvariablen verwalten und echte Prompts gegen den Endpunkt testen. Prüfe die usageMetadata direkt in der Response und ergänze Assertions, damit ein unerwarteter Anstieg der Ausgabetokens einen Test fehlschlagen lässt.
Du kannst API-Tests auch planen, um Kostenregressionen frühzeitig zu erkennen. Zum Einstieg kannst du Apidog herunterladen und einen Gemini-Request vor der Produktionsintegration nachbauen.
FAQ
Wie viel kostet Gemini 3.6 Flash pro 1 Mio. Tokens?
$1.50 für Eingabetokens und $7.50 für Ausgabetokens. Cache-Lesevorgänge kosten $0.15 pro 1 Mio. Tokens, die Cache-Speicherung $1.00 pro 1 Mio. Tokens und Stunde.
Enthält der Ausgabepreis Denk-Tokens?
Ja. Denk-Tokens werden mit der Ausgaberate von $7.50 abgerechnet. Es gibt keinen separaten Preis, aber mehr Reasoning erhöht die gesamte Tokenmenge und damit die Kosten.
Gibt es einen kostenlosen Tarif?
Ja, über Google AI Studio. Er ist ratelimitiert und für Prototyping sowie Tests gedacht. Da Google Daten aus dem kostenlosen Tarif zur Produktverbesserung verwenden kann, solltest du keine sensiblen Daten darüber verarbeiten.
Ist Gemini 3.6 Flash günstiger als Gemini 3.5 Flash?
Ja. Die Ausgaberate sank von $9.00 auf $7.50 pro 1 Mio. Tokens. Zusätzlich kann Gemini 3.6 Flash für dieselbe Aufgabe etwa 17 % weniger Ausgabetokens erzeugen. Dadurch kann die Ausgaberechnung im Beispiel um rund 31 % sinken.
Wann sollte ich Flash-Lite verwenden?
Für einfache Aufgaben mit hohem Volumen, etwa Klassifizierung, Extraktion und Routing. Mit $0.30 für Eingaben und $2.50 für Ausgaben ist Flash-Lite deutlich günstiger, während Gemini 3.6 Flash besser für komplexere Denkaufgaben geeignet ist.
Gemini 3.6 Flash kombiniert niedrigere Preise mit geringerem Ausgabetoken-Verbrauch. Budgetiere mit $1.50 pro 1 Mio. Eingabetokens und $7.50 pro 1 Mio. Ausgabetokens, berücksichtige Denk-Tokens in der Ausgabe und nutze Caching sowie Flash-Lite-Routing gezielt.
Für den historischen Vergleich der Gemini-API-Kosten hilft die Gemini-3.0-API-Kostenübersicht. Miss anschließend deine realen Requests in Apidog, damit dein geplantes Token-Budget auch deiner tatsächlichen Rechnung entspricht.
Top comments (0)