Gemini 3.6 Flash ist Googles neues „Arbeitspferd“-Modell für APIs mit hohem Durchsatz. Es wurde am 21. Juli 2026 allgemein verfügbar, ersetzt Gemini 3.5 Flash und soll bei vergleichbarer Qualität weniger Ausgabe-Tokens erzeugen. Wenn Sie produktive Workloads wie Extraktion, Zusammenfassung, Klassifikation, Chat oder Tool-Aufrufe kosteneffizient betreiben möchten, ist dies die vorgesehene Modellstufe.
Apidog noch heute ausprobieren
Dieser Leitfaden zeigt die Spezifikationen, Preise, Benchmarks und Zugriffsmöglichkeiten. Außerdem erfahren Sie, wie Sie einen API-Aufruf reproduzierbar testen und Regressionstests einrichten, bevor Sie bestehenden Traffic migrieren.
Was ist Gemini 3.6 Flash?
Gemini 3.6 Flash ist das Mittelklasse-Modell mit hohem Durchsatz in Googles Gemini-Familie. Es ist auf häufige Produktionsaufgaben optimiert:
- Zusammenfassen und Extrahieren
- Klassifizieren und strukturierte Antworten erzeugen
- Chat-Anwendungen
- Mehrstufige Tool-Aufrufe und Agenten-Workflows
- Verarbeitung von Text, Bildern, Video, Audio und PDFs als Eingabe
Google veröffentlichte am 21. Juli 2026 drei Modelle:
- Gemini 3.6 Flash: Arbeitspferd für Qualität, Kosten und Durchsatz
- Gemini 3.5 Flash-Lite: günstigere und schnellere Stufe für sehr hohe Volumina
- Gemini 3.5 Flash Cyber: abgesichertes Sicherheitsmodell für Regierungen und vertrauenswürdige Partner
Details zu den anderen Stufen finden Sie im Artikel zu Gemini 3.5 Flash-Lite und im Artikel zu Gemini 3.5 Flash Cyber.
Achten Sie auf die Modell-ID: Die Versionsnummern der neuen Flash-Modelle sind nicht einheitlich.
gemini-3.6-flash
gemini-3.5-flash-lite
Das sind unterschiedliche Modellstufen, keine Schreibvarianten.
Die offizielle Ankündigung steht im Google Blog. Die Modellkarte finden Sie auf der DeepMind Flash-Seite.
Was ist neu gegenüber Gemini 3.5 Flash?
Die wichtigste Änderung ist die Token-Effizienz. Gemini 3.6 Flash verwendet laut Google etwa 17 % weniger Ausgabe-Tokens als Gemini 3.5 Flash für dieselbe Arbeit.
Das wirkt sich direkt auf zwei Produktionsmetriken aus:
- Kosten: Ausgabe-Tokens sind teurer als Eingabe-Tokens.
- Latenz: Weniger generierte Tokens verkürzen typischerweise die Streaming-Dauer.
Auch der Ausgabepreis wurde gesenkt:
| Modell | Preis pro 1 Mio. Ausgabe-Tokens |
|---|---|
| Gemini 3.5 Flash | 9,00 $ |
| Gemini 3.6 Flash | 7,50 $ |
Zusätzlich ist Gemini 3.6 Flash laut Google stärker beim Codieren, bei der Computernutzung und bei mehrstufigen Tool-Workflows. Für Agenten ist das relevant: Weniger Logikschritte und Tool-Aufrufe reduzieren sowohl End-to-End-Latenz als auch Kosten.
Wenn Sie bestehenden Traffic migrieren möchten, lesen Sie den direkten Vergleich: Gemini 3.6 Flash vs. Gemini 3.5 Flash.
Gemini 3.6 Flash: Spezifikationen
| Attribut | Gemini 3.6 Flash |
|---|---|
| Modell-ID | gemini-3.6-flash |
| Eingabekontextfenster | 1 Mio. Tokens |
| Maximale Ausgabe | 64k Tokens |
| Eingabemodalitäten | Text, Bild, Video, Audio, PDF |
| Ausgabe | Nur Text |
| Eingabepreis | 1,50 $ pro 1 Mio. Tokens |
| Ausgabepreis | 7,50 $ pro 1 Mio. Tokens, inklusive Denk-Tokens |
| Kostenlose Stufe | Ja, über Google AI Studio, ratenbegrenzt |
| Veröffentlicht | 21. Juli 2026 |
Praktische Auswirkungen der Limits
Das Kontextfenster von 1 Mio. Tokens ermöglicht es, große Eingaben wie diese in einer Anfrage zu verarbeiten:
- umfangreiche Dokumentensammlungen
- lange Audio- oder Video-Transkripte
- große Codebasen
- viele Support-Tickets oder Log-Einträge
Die Ausgabe ist jedoch auf 64k Tokens pro Antwort begrenzt. Für sehr lange Generierungen sollten Sie Ihre Pipeline in mehrere Schritte aufteilen, beispielsweise:
1. Eingabe in Abschnitte zerlegen
2. Jeden Abschnitt zusammenfassen oder extrahieren
3. Teilergebnisse in einem finalen Aufruf konsolidieren
Wie es in Benchmarks abschneidet
Benchmarks sind keine Garantie für Ihre Prompts oder Daten. Sie helfen aber bei der Vorauswahl, bevor Sie eigene Tests mit realistischen Eingaben durchführen.
Google berichtet unter anderem folgende Werte:
| Benchmark | Ergebnis |
|---|---|
| SWE-Bench Pro | 58,7 % |
| DeepSWE v1.1 | 49 % |
| Terminal-bench 2.1 | 78,0 % |
| OSWorld-Verified | 83,0 % |
| GDPVal-AA v2 | 1421 Elo |
Beim Coding erreicht Gemini 3.6 Flash laut Google 58,7 % auf SWE-Bench Pro und 49 % auf DeepSWE v1.1. Auf Terminal-bench 2.1, der die Ausführung von Befehlen in einer Terminal-Umgebung bewertet, liegt es bei 78,0 %.
Bei der Computernutzung steigt der Wert auf OSWorld-Verified von 78,4 % bei Gemini 3.5 Flash auf 83,0 % bei Gemini 3.6 Flash. Das ist insbesondere für Agenten relevant, die mit echten Benutzeroberflächen arbeiten.
Beim langen Kontext sollten Sie eigene Tests durchführen:
- Bei 128k Tokens liegt die durchschnittliche Abfragegenauigkeit bei 91,8 %.
- Bei einer punktweisen Abfrage nahe dem vollständigen 1M-Token-Fenster sinkt sie auf 54,0 %.
Praxisregel: Testen Sie Retrieval, Extraktion und Fragen-Antworten immer mit der Kontextlänge, die Ihre Anwendung tatsächlich verwendet.
Preise auf einen Blick
Gemini 3.6 Flash kostet:
- 1,50 $ pro 1 Mio. Eingabe-Tokens
- 7,50 $ pro 1 Mio. Ausgabe-Tokens
Der Ausgabepreis enthält Denk-Tokens. Auch Tokens, die nicht in der endgültigen Antwort sichtbar sind, können daher in die Abrechnung einfließen.
Für wiederkehrende große Prompts gibt es Kontext-Caching:
- 0,15 $ pro 1 Mio. Tokens für das Caching
- 1,00 $ pro 1 Mio. Tokens pro Stunde für die Speicherung
Caching ist besonders sinnvoll, wenn Sie denselben System-Prompt, dieselbe Wissensbasis oder dieselben langen Referenzdokumente wiederholt verwenden.
Eine kostenlose, ratenbegrenzte Stufe ist über Google AI Studio verfügbar. Sie eignet sich für Prototypen und erste Tests. Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden; für Produktionsdaten sollten Sie die jeweiligen Bedingungen prüfen.
Weitere Details:
So greifen Sie auf Gemini 3.6 Flash zu
Sie können Gemini 3.6 Flash über mehrere Google-Produkte verwenden:
Gemini API über Google AI Studio
Erstellen Sie einen API-Schlüssel und rufen Siegemini-3.6-flashüber REST oder ein SDK auf.Google Antigravity
Googles agentische Entwicklungsoberfläche stellt das Modell bereit.Gemini Enterprise Agent Platform
Für Teams, die verwaltete Agenten erstellen und betreiben.Gemini-App
Für direkte Chats mit dem Modell.
Für Entwickler ist die Gemini API in der Regel der relevante Zugang.
API-Aufruf vorbereiten
Erstellen Sie zunächst einen API-Schlüssel in Google AI Studio und speichern Sie ihn als Umgebungsvariable:
export GEMINI_API_KEY="Ihr_API_Schlüssel"
Verwenden Sie anschließend die Modell-ID gemini-3.6-flash in Ihrer Anfrage. Halten Sie API-Schlüssel außerhalb des Quellcodes und prüfen Sie vor dem produktiven Einsatz Authentifizierung, Limits und Abrechnungsprojekt.
Eine detaillierte Anleitung finden Sie unter:
Wo Gemini 3.6 Flash in die Produktpalette passt
Die Flash-Modelle lassen sich als Kosten- und Qualitätsleiter betrachten:
| Modell | Wann einsetzen |
|---|---|
| Gemini 3.5 Flash-Lite | Sehr hohe Volumina, niedrige Latenz, einfachere Aufgaben |
| Gemini 3.6 Flash | Standardmodell für anspruchsvollere Produktionsaufgaben |
| Gemini 3.5 Flash Cyber | Abgesicherte Sicherheitsanwendungen für berechtigte Organisationen |
Gemini 3.5 Flash-Lite ist günstiger:
- 0,30 $ pro 1 Mio. Eingabe-Tokens
- 2,50 $ pro 1 Mio. Ausgabe-Tokens
- etwa 350 Ausgabe-Tokens pro Sekunde
Wählen Sie Flash-Lite für einfache, latenzkritische und hochvolumige Aufgaben. Verwenden Sie Gemini 3.6 Flash, wenn die Aufgabe schwieriger ist oder die Ausgabe zuverlässiger sein muss.
Wichtig: Gemini 3.5 Pro ist nicht öffentlich veröffentlicht. Google testet es nach eigenen Angaben weiterhin mit Partnern. Auch ein Gemini-4-Pre-Training-Lauf wurde lediglich angeteasert. Beides ist heute nicht als öffentliches Modell verfügbar.
Für die vorherige Generation bietet der Artikel Was ist Gemini 3.5? den passenden Hintergrund.
Gemini 3.6 Flash in Apidog testen
Modellseiten und Benchmarks zeigen Durchschnitts- oder Best-Case-Werte. Ob Gemini 3.6 Flash Ihre Prompts, Ihre Antwortschemata und Ihre Kontextlängen zuverlässig verarbeitet, klären nur eigene API-Tests.
Apidog ist ein API-Client und eine Testplattform. Sie können den Gemini-Endpunkt wie jeden anderen REST-Endpunkt konfigurieren und validieren.
Einrichtung als reproduzierbarer Test
- Erstellen Sie eine
POST-Anfrage für den Gemini-API-Endpunkt. - Setzen Sie die Modell-ID auf
gemini-3.6-flash. - Speichern Sie Ihren API-Schlüssel in einer Umgebungsvariable, nicht direkt in URL oder Request-Body.
- Senden Sie Beispielprompts mit repräsentativen Eingaben.
- Prüfen Sie Statuscode, Antwortstruktur und relevante JSON-Felder mit Assertions.
- Speichern Sie die Anfrage als Regressionstest.
- Planen Sie die Ausführung, um Änderungen nach Modell-Updates früh zu erkennen.
Sinnvolle Assertions prüfen zum Beispiel:
- HTTP-Status ist erfolgreich
- erwartete Textausgabe ist vorhanden
- Antwort entspricht Ihrem JSON-Schema
- Antwortzeit bleibt unter Ihrem Latenzbudget
- extrahierte Pflichtfelder sind nicht leer
Apidog führt das Modell nicht aus und ersetzt kein KI-Framework. Es hilft Ihnen dabei, Anfragen zu erstellen, zu senden, zu dokumentieren und gegen feste Erwartungen zu testen. So erkennen Sie schneller, ob ein Modell-Update Antwortform, Latenz oder die Qualität Ihrer kritischen Prompts verändert.
Apidog herunterladen, um den ersten Test einzurichten.
FAQ
Ist Gemini 3.6 Flash kostenlos?
Es gibt eine kostenlose, ratenbegrenzte Stufe über Google AI Studio. Sie ist für Prototypen geeignet. Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden. Für Produktions-Traffic gelten die Token-Preise von 1,50 $ pro 1 Mio. Eingabe-Tokens und 7,50 $ pro 1 Mio. Ausgabe-Tokens.
Ist Gemini 3.6 Flash besser als Gemini 3.5 Flash?
Für die meisten Standardaufgaben ja. Es verwendet laut Google etwa 17 % weniger Ausgabe-Tokens, der Ausgabepreis sank von 9,00 $ auf 7,50 $ pro 1 Mio. Tokens, und es erzielt bessere Werte bei Coding und Computernutzung. Bei OSWorld-Verified steigt der Wert beispielsweise von 78,4 % auf 83,0 %.
Ist Gemini 3.5 Pro veröffentlicht?
Nein. Google testet Gemini 3.5 Pro weiterhin mit Partnern. Es gibt in dieser Veröffentlichungswelle kein öffentlich verfügbares Pro-Modell.
Was ist die Modell-ID?
Verwenden Sie:
gemini-3.6-flash
Verwechseln Sie sie nicht mit gemini-3.5-flash-lite, dem günstigeren Flash-Lite-Modell.
Was kann Gemini 3.6 Flash nicht?
Gemini 3.6 Flash gibt nur Text aus. Es kann Bilder, Audio, Video und PDFs als Eingabe verarbeiten, erzeugt aber keine Bilder, Audio- oder Videodateien. Außerdem sinkt die Erinnerungsleistung nahe dem vollständigen 1M-Token-Kontextfenster auf etwa 54,0 % bei punktweiser Abfrage.
Fazit
Gemini 3.6 Flash ist für den Großteil des Gemini-API-Traffics gedacht: günstiger, token-effizienter und laut Google besser für agentische Workflows als Gemini 3.5 Flash.
Migrieren Sie nicht blind. Erstellen Sie zuerst einige gespeicherte API-Tests mit Ihren realen Prompts, Kontextlängen und Antwortanforderungen. Damit können Sie vor einer breiten Umstellung Qualität, Kosten, Antwortformat und Latenz vergleichen — und spätere Modelländerungen schnell erkennen.


Top comments (0)