DEV Community

Cover image for Was ist Gemini 3.6 Flash?
Emre Demir
Emre Demir

Posted on • Originally published at apidog.com

Was ist Gemini 3.6 Flash?

Gemini 3.6 Flash ist Googles neues „Arbeitspferd“-Modell für APIs mit hohem Durchsatz. Es wurde am 21. Juli 2026 allgemein verfügbar, ersetzt Gemini 3.5 Flash und soll bei vergleichbarer Qualität weniger Ausgabe-Tokens erzeugen. Wenn Sie produktive Workloads wie Extraktion, Zusammenfassung, Klassifikation, Chat oder Tool-Aufrufe kosteneffizient betreiben möchten, ist dies die vorgesehene Modellstufe.

Apidog noch heute ausprobieren

Dieser Leitfaden zeigt die Spezifikationen, Preise, Benchmarks und Zugriffsmöglichkeiten. Außerdem erfahren Sie, wie Sie einen API-Aufruf reproduzierbar testen und Regressionstests einrichten, bevor Sie bestehenden Traffic migrieren.

Was ist Gemini 3.6 Flash?

Gemini 3.6 Flash ist das Mittelklasse-Modell mit hohem Durchsatz in Googles Gemini-Familie. Es ist auf häufige Produktionsaufgaben optimiert:

  • Zusammenfassen und Extrahieren
  • Klassifizieren und strukturierte Antworten erzeugen
  • Chat-Anwendungen
  • Mehrstufige Tool-Aufrufe und Agenten-Workflows
  • Verarbeitung von Text, Bildern, Video, Audio und PDFs als Eingabe

Gemini 3.6 Flash

Google veröffentlichte am 21. Juli 2026 drei Modelle:

  • Gemini 3.6 Flash: Arbeitspferd für Qualität, Kosten und Durchsatz
  • Gemini 3.5 Flash-Lite: günstigere und schnellere Stufe für sehr hohe Volumina
  • Gemini 3.5 Flash Cyber: abgesichertes Sicherheitsmodell für Regierungen und vertrauenswürdige Partner

Details zu den anderen Stufen finden Sie im Artikel zu Gemini 3.5 Flash-Lite und im Artikel zu Gemini 3.5 Flash Cyber.

Gemini Flash-Modellstufen

Achten Sie auf die Modell-ID: Die Versionsnummern der neuen Flash-Modelle sind nicht einheitlich.

gemini-3.6-flash
gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Das sind unterschiedliche Modellstufen, keine Schreibvarianten.

Die offizielle Ankündigung steht im Google Blog. Die Modellkarte finden Sie auf der DeepMind Flash-Seite.

Was ist neu gegenüber Gemini 3.5 Flash?

Die wichtigste Änderung ist die Token-Effizienz. Gemini 3.6 Flash verwendet laut Google etwa 17 % weniger Ausgabe-Tokens als Gemini 3.5 Flash für dieselbe Arbeit.

Das wirkt sich direkt auf zwei Produktionsmetriken aus:

  1. Kosten: Ausgabe-Tokens sind teurer als Eingabe-Tokens.
  2. Latenz: Weniger generierte Tokens verkürzen typischerweise die Streaming-Dauer.

Auch der Ausgabepreis wurde gesenkt:

Modell Preis pro 1 Mio. Ausgabe-Tokens
Gemini 3.5 Flash 9,00 $
Gemini 3.6 Flash 7,50 $

Zusätzlich ist Gemini 3.6 Flash laut Google stärker beim Codieren, bei der Computernutzung und bei mehrstufigen Tool-Workflows. Für Agenten ist das relevant: Weniger Logikschritte und Tool-Aufrufe reduzieren sowohl End-to-End-Latenz als auch Kosten.

Wenn Sie bestehenden Traffic migrieren möchten, lesen Sie den direkten Vergleich: Gemini 3.6 Flash vs. Gemini 3.5 Flash.

Gemini 3.6 Flash: Spezifikationen

Attribut Gemini 3.6 Flash
Modell-ID gemini-3.6-flash
Eingabekontextfenster 1 Mio. Tokens
Maximale Ausgabe 64k Tokens
Eingabemodalitäten Text, Bild, Video, Audio, PDF
Ausgabe Nur Text
Eingabepreis 1,50 $ pro 1 Mio. Tokens
Ausgabepreis 7,50 $ pro 1 Mio. Tokens, inklusive Denk-Tokens
Kostenlose Stufe Ja, über Google AI Studio, ratenbegrenzt
Veröffentlicht 21. Juli 2026

Praktische Auswirkungen der Limits

Das Kontextfenster von 1 Mio. Tokens ermöglicht es, große Eingaben wie diese in einer Anfrage zu verarbeiten:

  • umfangreiche Dokumentensammlungen
  • lange Audio- oder Video-Transkripte
  • große Codebasen
  • viele Support-Tickets oder Log-Einträge

Die Ausgabe ist jedoch auf 64k Tokens pro Antwort begrenzt. Für sehr lange Generierungen sollten Sie Ihre Pipeline in mehrere Schritte aufteilen, beispielsweise:

1. Eingabe in Abschnitte zerlegen
2. Jeden Abschnitt zusammenfassen oder extrahieren
3. Teilergebnisse in einem finalen Aufruf konsolidieren
Enter fullscreen mode Exit fullscreen mode

Wie es in Benchmarks abschneidet

Benchmarks sind keine Garantie für Ihre Prompts oder Daten. Sie helfen aber bei der Vorauswahl, bevor Sie eigene Tests mit realistischen Eingaben durchführen.

Google berichtet unter anderem folgende Werte:

Benchmark Ergebnis
SWE-Bench Pro 58,7 %
DeepSWE v1.1 49 %
Terminal-bench 2.1 78,0 %
OSWorld-Verified 83,0 %
GDPVal-AA v2 1421 Elo

Beim Coding erreicht Gemini 3.6 Flash laut Google 58,7 % auf SWE-Bench Pro und 49 % auf DeepSWE v1.1. Auf Terminal-bench 2.1, der die Ausführung von Befehlen in einer Terminal-Umgebung bewertet, liegt es bei 78,0 %.

Bei der Computernutzung steigt der Wert auf OSWorld-Verified von 78,4 % bei Gemini 3.5 Flash auf 83,0 % bei Gemini 3.6 Flash. Das ist insbesondere für Agenten relevant, die mit echten Benutzeroberflächen arbeiten.

Beim langen Kontext sollten Sie eigene Tests durchführen:

  • Bei 128k Tokens liegt die durchschnittliche Abfragegenauigkeit bei 91,8 %.
  • Bei einer punktweisen Abfrage nahe dem vollständigen 1M-Token-Fenster sinkt sie auf 54,0 %.

Praxisregel: Testen Sie Retrieval, Extraktion und Fragen-Antworten immer mit der Kontextlänge, die Ihre Anwendung tatsächlich verwendet.

Preise auf einen Blick

Gemini 3.6 Flash kostet:

  • 1,50 $ pro 1 Mio. Eingabe-Tokens
  • 7,50 $ pro 1 Mio. Ausgabe-Tokens

Der Ausgabepreis enthält Denk-Tokens. Auch Tokens, die nicht in der endgültigen Antwort sichtbar sind, können daher in die Abrechnung einfließen.

Für wiederkehrende große Prompts gibt es Kontext-Caching:

  • 0,15 $ pro 1 Mio. Tokens für das Caching
  • 1,00 $ pro 1 Mio. Tokens pro Stunde für die Speicherung

Caching ist besonders sinnvoll, wenn Sie denselben System-Prompt, dieselbe Wissensbasis oder dieselben langen Referenzdokumente wiederholt verwenden.

Eine kostenlose, ratenbegrenzte Stufe ist über Google AI Studio verfügbar. Sie eignet sich für Prototypen und erste Tests. Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden; für Produktionsdaten sollten Sie die jeweiligen Bedingungen prüfen.

Weitere Details:

So greifen Sie auf Gemini 3.6 Flash zu

Sie können Gemini 3.6 Flash über mehrere Google-Produkte verwenden:

  • Gemini API über Google AI Studio

    Erstellen Sie einen API-Schlüssel und rufen Sie gemini-3.6-flash über REST oder ein SDK auf.

  • Google Antigravity

    Googles agentische Entwicklungsoberfläche stellt das Modell bereit.

  • Gemini Enterprise Agent Platform

    Für Teams, die verwaltete Agenten erstellen und betreiben.

  • Gemini-App

    Für direkte Chats mit dem Modell.

Für Entwickler ist die Gemini API in der Regel der relevante Zugang.

API-Aufruf vorbereiten

Erstellen Sie zunächst einen API-Schlüssel in Google AI Studio und speichern Sie ihn als Umgebungsvariable:

export GEMINI_API_KEY="Ihr_API_Schlüssel"
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie anschließend die Modell-ID gemini-3.6-flash in Ihrer Anfrage. Halten Sie API-Schlüssel außerhalb des Quellcodes und prüfen Sie vor dem produktiven Einsatz Authentifizierung, Limits und Abrechnungsprojekt.

Eine detaillierte Anleitung finden Sie unter:

Wo Gemini 3.6 Flash in die Produktpalette passt

Die Flash-Modelle lassen sich als Kosten- und Qualitätsleiter betrachten:

Modell Wann einsetzen
Gemini 3.5 Flash-Lite Sehr hohe Volumina, niedrige Latenz, einfachere Aufgaben
Gemini 3.6 Flash Standardmodell für anspruchsvollere Produktionsaufgaben
Gemini 3.5 Flash Cyber Abgesicherte Sicherheitsanwendungen für berechtigte Organisationen

Gemini 3.5 Flash-Lite ist günstiger:

  • 0,30 $ pro 1 Mio. Eingabe-Tokens
  • 2,50 $ pro 1 Mio. Ausgabe-Tokens
  • etwa 350 Ausgabe-Tokens pro Sekunde

Wählen Sie Flash-Lite für einfache, latenzkritische und hochvolumige Aufgaben. Verwenden Sie Gemini 3.6 Flash, wenn die Aufgabe schwieriger ist oder die Ausgabe zuverlässiger sein muss.

Wichtig: Gemini 3.5 Pro ist nicht öffentlich veröffentlicht. Google testet es nach eigenen Angaben weiterhin mit Partnern. Auch ein Gemini-4-Pre-Training-Lauf wurde lediglich angeteasert. Beides ist heute nicht als öffentliches Modell verfügbar.

Für die vorherige Generation bietet der Artikel Was ist Gemini 3.5? den passenden Hintergrund.

Gemini 3.6 Flash in Apidog testen

Modellseiten und Benchmarks zeigen Durchschnitts- oder Best-Case-Werte. Ob Gemini 3.6 Flash Ihre Prompts, Ihre Antwortschemata und Ihre Kontextlängen zuverlässig verarbeitet, klären nur eigene API-Tests.

Apidog ist ein API-Client und eine Testplattform. Sie können den Gemini-Endpunkt wie jeden anderen REST-Endpunkt konfigurieren und validieren.

Einrichtung als reproduzierbarer Test

  1. Erstellen Sie eine POST-Anfrage für den Gemini-API-Endpunkt.
  2. Setzen Sie die Modell-ID auf gemini-3.6-flash.
  3. Speichern Sie Ihren API-Schlüssel in einer Umgebungsvariable, nicht direkt in URL oder Request-Body.
  4. Senden Sie Beispielprompts mit repräsentativen Eingaben.
  5. Prüfen Sie Statuscode, Antwortstruktur und relevante JSON-Felder mit Assertions.
  6. Speichern Sie die Anfrage als Regressionstest.
  7. Planen Sie die Ausführung, um Änderungen nach Modell-Updates früh zu erkennen.

Sinnvolle Assertions prüfen zum Beispiel:

- HTTP-Status ist erfolgreich
- erwartete Textausgabe ist vorhanden
- Antwort entspricht Ihrem JSON-Schema
- Antwortzeit bleibt unter Ihrem Latenzbudget
- extrahierte Pflichtfelder sind nicht leer
Enter fullscreen mode Exit fullscreen mode

Apidog führt das Modell nicht aus und ersetzt kein KI-Framework. Es hilft Ihnen dabei, Anfragen zu erstellen, zu senden, zu dokumentieren und gegen feste Erwartungen zu testen. So erkennen Sie schneller, ob ein Modell-Update Antwortform, Latenz oder die Qualität Ihrer kritischen Prompts verändert.

Apidog herunterladen, um den ersten Test einzurichten.

FAQ

Ist Gemini 3.6 Flash kostenlos?

Es gibt eine kostenlose, ratenbegrenzte Stufe über Google AI Studio. Sie ist für Prototypen geeignet. Google kann Daten aus der kostenlosen Stufe zur Verbesserung seiner Produkte verwenden. Für Produktions-Traffic gelten die Token-Preise von 1,50 $ pro 1 Mio. Eingabe-Tokens und 7,50 $ pro 1 Mio. Ausgabe-Tokens.

Ist Gemini 3.6 Flash besser als Gemini 3.5 Flash?

Für die meisten Standardaufgaben ja. Es verwendet laut Google etwa 17 % weniger Ausgabe-Tokens, der Ausgabepreis sank von 9,00 $ auf 7,50 $ pro 1 Mio. Tokens, und es erzielt bessere Werte bei Coding und Computernutzung. Bei OSWorld-Verified steigt der Wert beispielsweise von 78,4 % auf 83,0 %.

Ist Gemini 3.5 Pro veröffentlicht?

Nein. Google testet Gemini 3.5 Pro weiterhin mit Partnern. Es gibt in dieser Veröffentlichungswelle kein öffentlich verfügbares Pro-Modell.

Was ist die Modell-ID?

Verwenden Sie:

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Verwechseln Sie sie nicht mit gemini-3.5-flash-lite, dem günstigeren Flash-Lite-Modell.

Was kann Gemini 3.6 Flash nicht?

Gemini 3.6 Flash gibt nur Text aus. Es kann Bilder, Audio, Video und PDFs als Eingabe verarbeiten, erzeugt aber keine Bilder, Audio- oder Videodateien. Außerdem sinkt die Erinnerungsleistung nahe dem vollständigen 1M-Token-Kontextfenster auf etwa 54,0 % bei punktweiser Abfrage.

Fazit

Gemini 3.6 Flash ist für den Großteil des Gemini-API-Traffics gedacht: günstiger, token-effizienter und laut Google besser für agentische Workflows als Gemini 3.5 Flash.

Migrieren Sie nicht blind. Erstellen Sie zuerst einige gespeicherte API-Tests mit Ihren realen Prompts, Kontextlängen und Antwortanforderungen. Damit können Sie vor einer breiten Umstellung Qualität, Kosten, Antwortformat und Latenz vergleichen — und spätere Modelländerungen schnell erkennen.

Top comments (0)