DEV Community

Cover image for Wie Gemini 3.8 Flash kostenlos nutzen?
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Wie Gemini 3.8 Flash kostenlos nutzen?

Gemini 3.8 Flash kostenlos nutzen: API-Zugang, Limits und erste Anfrage

Gemini 3.8 Flash wurde am 2. September 2026 veröffentlicht. Anders als viele andere große Releases bietet es einen echten kostenlosen Zugang: Sie können das Modell in Google AI Studio testen oder es über die Gemini API im kostenlosen Tarif aufrufen. Dafür benötigen Sie lediglich einen API-Schlüssel, dessen Erstellung etwa eine Minute dauert. Google bezeichnet es als „unser intelligentestes Flash-Modell“. Im kostenlosen Tarif erhalten Sie dieselbe Modell-ID gemini-3.8-flash wie zahlende Kunden – keine abgespeckte Variante.

Apidog heute ausprobieren

Gemini 3.8 Flash

Es gibt drei wichtige Einschränkungen: Der kostenlose Tarif ist ratenbegrenzt, Google darf Daten daraus zur Produktverbesserung verwenden, und die Gemini-App enthält 3.8 Flash nicht im kostenlosen Plan. Für die App benötigen Sie Google AI Pro oder Ultra.

Wenn Sie zuerst die technischen Grundlagen lesen möchten, starten Sie mit Was ist Gemini 3.8 Flash?. Für eine erste Anfrage in wenigen Minuten folgen Sie den Schritten unten.

Kostenloser Zugang auf einen Blick

Oberfläche Kosten Gemini 3.8 Flash enthalten? Einschränkung
Google AI Studio 0 $ Ja Ratenbegrenzt; Daten werden zur Produktverbesserung genutzt
Gemini API, kostenloser Tarif 0 $ Ja Dieselben Limits wie in AI Studio
Gemini-App, kostenloser Plan 0 $ Nein 3.8 Flash erfordert Google AI Pro oder Ultra
KI-Modus in der Google-Suche 0 $ Ja, für private Nutzer Keine API und keine Kontrolle über das Denkniveau
Gemini in Google Tabellen Planabhängig Ja, für private Nutzer Keine API
Google Search Grounding 5.000 Anfragen/Monat kostenlos Geteilt über Gemini 3.x Danach 14 $ pro 1.000 Anfragen
Batch-API 50 % Rabatt auf bezahlte Tarife Ja Nicht kostenlos, aber der günstigste kostenpflichtige Weg
Gemini 3.8 Flash Cyber Nicht erhältlich Nein Nur im Fairwind-Programm, keine öffentliche API

Schritt 1: AI Studio öffnen und gemini-3.8-flash auswählen

Öffnen Sie Google AI Studio und melden Sie sich mit einem Google-Konto an. Sie benötigen weder ein Abrechnungskonto noch eine Kreditkarte.

Wählen Sie im Modellauswähler gemini-3.8-flash. Das ist die stabile Modell-ID ohne Preview-Suffix. Für das Denkniveau stehen drei Werte zur Verfügung:

  • low
  • medium
  • high

medium ist voreingestellt. minimal wird bei diesem Modell nicht unterstützt. Wenn Sie den Wert über die API senden, erhalten Sie einen Validierungsfehler statt eines stillen Fallbacks. Die Unterschiede zwischen den Stufen beschreibt der Leitfaden zu den Denkniveaus.

Einstellungen für den kostenlosen Tarif

Lassen Sie die Temperatur zunächst auf dem Standardwert 1.0. Google empfiehlt für Gemini-3-Modelle, die Temperatur nicht zu senken, da niedrigere Werte zu Schleifen oder schlechteren Antworten führen können.

Beginnen Sie außerdem mit low. Gemini 3.8 Flash ist dafür ausgelegt, bei komplexen Aufgaben intensiver zu arbeiten, kleinere Denkschritte auszuführen und Tools iterativ aufzurufen. Google weist darauf hin, dass das Modell bei langen und komplexen Aufgaben konstruktionsbedingt mehr Token verwenden kann.

Da der kostenlose Tarif unter anderem Token pro Minute begrenzt, kann 3.8 Flash Ihr Kontingent schneller verbrauchen als 3.7 Flash. Mit low bleiben erste Experimente überschaubar.

Schritt 2: Einen kostenlosen API-Schlüssel erstellen

Öffnen Sie in AI Studio die Seite für API-Schlüssel und erstellen Sie einen Schlüssel in einem neuen oder bestehenden Projekt. Der Schlüssel funktioniert sofort im kostenlosen Tarif. Auf der Preisseite der Gemini API wird der Input und Output von 3.8 Flash im kostenlosen Tarif als „Kostenlos“ aufgeführt.

Falls Sie noch keinen Schlüssel erstellt haben, hilft die Anleitung zum Gemini API-Schlüssel.

Speichern Sie den Schlüssel als Umgebungsvariable:

export GEMINI_API_KEY="paste-your-key-here"
Enter fullscreen mode Exit fullscreen mode

Behandeln Sie den Schlüssel wie ein Passwort. Der kostenlose Tarif ist nicht mit einer Abrechnung verknüpft, daher kann ein geleakter Schlüssel keine Rechnung verursachen. Er kann jedoch Ihr tägliches Kontingent verbrauchen, bevor Sie es selbst nutzen.

Schritt 3: Die erste kostenlose Anfrage senden

Gemini 3.x läuft inzwischen hauptsächlich über die Interactions API. Dafür benötigen Sie kein SDK:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"low"}}'
Enter fullscreen mode Exit fullscreen mode

Die Antwort besteht aus einer Liste von Ausführungsschritten. Dazu gehören Modellgedanken und gegebenenfalls Tool-Aufrufe. Der letzte Schritt ist normalerweise ein model_output-Schritt mit dem sichtbaren Antworttext.

Bestehender Code mit generateContent funktioniert weiterhin. Google bezeichnet diesen Endpunkt als veraltet, unterstützt ihn aber vollständig und ohne angekündigtes Enddatum. Dort legen Sie das Denkniveau über generationConfig.thinkingConfig.thinkingLevel fest.

Der Gemini-3.8-Flash-API-Leitfaden enthält beide API-Varianten, Python-Beispiele und Multi-Turn-Anfragen mit previous_interaction_id.

Erhalten Sie den HTTP-Status 429, haben Sie wahrscheinlich das Ratenlimit des kostenlosen Tarifs erreicht. Warten Sie entweder, bis das Limit zurückgesetzt wird, oder wechseln Sie zu einem kostenpflichtigen Tarif.

Was der kostenlose Tarif kostet

In Dollar kostet der Tarif nichts. Praktisch zahlen Sie jedoch mit drei Dingen:

1. Ratenlimits

Der kostenlose Tarif begrenzt unter anderem:

  • Anfragen pro Minute
  • Token pro Minute
  • Anfragen pro Tag und Modell

Google veröffentlicht die genauen Werte auf der AI-Studio-Ratenlimit-Seite, nicht dauerhaft im Dokumentationstext. Die Werte können sich ohne Changelog-Eintrag ändern. Prüfen Sie daher immer die aktuelle Seite und verlassen Sie sich nicht auf Zahlen aus älteren Blogbeiträgen.

Das Ratenlimit-Dokument erklärt außerdem, wie die verschiedenen Tarife gestaffelt sind.

2. Ihre Daten

Google gibt an, dass Prompts und Ausgaben aus dem kostenlosen Tarif zur Verbesserung seiner Produkte verwendet werden.

Das ist für Benchmarks, Experimente und Spielzeug-Apps akzeptabel. Verwenden Sie den kostenlosen Tarif jedoch nicht für:

  • Kundendaten
  • unveröffentlichten Quellcode
  • vertrauliche Geschäftsunterlagen
  • Inhalte unter einer Geheimhaltungsvereinbarung

Kostenpflichtige Tarife gelten unter anderen Datenbedingungen. Wenn Sie diese benötigen, verknüpfen Sie die Abrechnung, bevor Sie sensible Daten senden.

3. Token-Verbrauch

Artificial Analysis maß bei 3.8 Flash mit Denkniveau high ungefähr 48.000 Output-Token pro Aufgabe. Das sind etwa 30 % mehr als bei 3.7 Flash.

Denk-Token werden auf dieselben Token-pro-Minute-Limits angerechnet wie die sichtbare Ausgabe. Ein Modell, das intensiver denkt, verbraucht Ihr kostenloses Kontingent daher schneller. Verwenden Sie standardmäßig low oder medium, bis Sie mehr Spielraum benötigen.

Die Gemini-App ist kein kostenloser API-Ersatz

Viele Suchergebnisse zu „Gemini 3.8 Flash kostenlos“ vermischen die Entwickler- und die Verbraucherangebote.

Auf der Verbraucherseite ist 3.8 Flash in der Gemini-App für Google-AI-Pro- und Ultra-Abonnenten verfügbar. Der kostenlose App-Plan erhält es laut der Startberichterstattung nicht. Wenn Sie die App ohne Abonnement öffnen und ein Flash-Modell sehen, handelt es sich nicht um 3.8 Flash.

Ohne zusätzliches Abonnement können private Nutzer 3.8 Flash über folgende Oberflächen verwenden:

  • den KI-Modus in der Google-Suche
  • Gemini in Google Tabellen

Beide eignen sich, um Antworten zu lesen. Für Entwicklung bieten sie jedoch keine Kontrolle über das Denkniveau, keine Token-Zählung und keine API. Für Prototypen und Tests sind deshalb AI Studio und der kostenlose Gemini-API-Tarif die relevanten Optionen.

Kostenloses Grounding: 5.000 Google-Search-Anfragen pro Monat

Google Search Grounding ermöglicht es dem Modell, aktuelle Webergebnisse in seine Antworten einzubeziehen. Im kostenlosen Kontingent sind 5.000 Anfragen pro Monat enthalten.

Dieses Kontingent wird über alle Gemini-3.x-Modelle geteilt. Ein Grounding-Experiment mit Gemini 3 Pro und eines mit Gemini 3.8 Flash greifen also auf denselben Pool zu. Nach den 5.000 Anfragen kostet Grounding 14 $ pro 1.000 Anfragen.

Für einen Prototyp mit aktuellen Daten ist das Kontingent großzügig. Für ein produktives Feature sollten Sie die Grounding-Kosten jedoch als eigenen Budgetposten einplanen.

Wenn das kostenlose Kontingent aufgebraucht ist

Eine 429 mitten in einer Demo oder ein erreichtes Tageslimit sind klare Signale. Die günstigsten kostenpflichtigen Optionen sind:

1. Abrechnung verknüpfen und Stufe 1 aktivieren

Wenn Sie in AI Studio eine Abrechnung mit Ihrem Projekt verknüpfen, wechseln Sie in Stufe 1. Dadurch steigen die Ratenlimits; außerdem wird ein Ausgabenlimit von 250 $ festgelegt.

Die weiteren Stufen sind:

  • Stufe 2: nach 100 $ Ausgaben und drei Tagen, Limit 2.000 $
  • Stufe 3: nach 1.000 $ Ausgaben und 30 Tagen

Für Stufe 1 müssen Sie nichts ausgeben. Die Verknüpfung der Abrechnung reicht aus.

2. Den Einführungspreis nutzen

Bis zum 31. Dezember 2026 kostet Gemini 3.8 Flash:

  • 0,75 $ pro Million Input-Token
  • 3,75 $ pro Million Output-Token

Denk-Token werden als Output abgerechnet. Ab dem 1. Januar 2027 steigen die Preise auf 1,50 $ beziehungsweise 7,50 $ pro Million Token.

1.000 Anfragen mit jeweils 2.000 Input- und 500 Output-Token kosten zum Einführungspreis ungefähr 3,38 $. Die Preisübersicht zu Gemini 3.8 Flash zeigt die Berechnung pro Aufgabe. Ein niedrigerer Preis pro Token bedeutet bei diesem Modell nicht automatisch eine günstigere Anfrage, wenn der Token-Verbrauch steigt.

3. Aufschiebbare Aufgaben per Batch verarbeiten

Die Batch-API halbiert den Preis. Bis Jahresende zahlen Sie:

  • 0,375 $ pro Million Input-Token
  • 1,875 $ pro Million Output-Token

Dieselben 1.000 Anfragen kosten damit ungefähr 1,69 $. Tier-1-Konten können bis zu drei Millionen Token gleichzeitig in der Warteschlange haben.

Batches eignen sich für:

  • Evaluierungen
  • Datenanreicherung
  • nächtliche Jobs
  • nicht zeitkritische Nachladungen

Der Gemini-Batch-Modus-Leitfaden beschreibt das Anfrageformat.

4. Stabile Kontexte cachen

Context Caching kostet zum Einführungspreis 0,075 $ pro Million gecachter Token – ein Zehntel des Preises für frischen Input.

Ein langer System-Prompt oder ein Dokument, das Sie bei jeder Runde erneut senden, ist der beste Kandidat für Caching.

Was Sie im kostenlosen Tarif nicht erhalten

Die wichtigsten Einschränkungen im Überblick:

  • Gemini-App: 3.8 Flash ist dort nur mit Google AI Pro oder Ultra verfügbar.
  • Datenschutz: Daten aus dem kostenlosen Tarif werden zur Verbesserung von Google-Produkten verwendet. Eine Deaktivierung gibt es im kostenlosen Tarif nicht.
  • Produktionsspielraum: Die Limits sind auf der Ratenlimit-Seite aufgeführt und für Evaluierungen sowie kleine Tools gedacht, nicht für einen Launch.
  • Gemini 3.8 Flash Cyber: Das sicherheitsorientierte Modell ist dem Fairwind-Programm für Regierungen, Infrastrukturbetreiber und Software-Wartungsfirmen vorbehalten. Es gibt keine öffentliche API, keinen öffentlichen Preis und kein Self-Hosting.
  • Live API, Bild- und Audiogenerierung: Diese Funktionen werden von 3.8 Flash in keinem Tarif unterstützt. Als Input sind Text, Bild, Video, Audio und PDF möglich; der Output ist Text.
  • Unbegrenzter Zugang: Angebote mit „unbegrenztem“ Gemini-Zugriff verwenden häufig den Schlüssel einer anderen Person oder stellen ein anderes Modell bereit. Der Leitfaden für kostenlosen Gemini-API-Zugang erklärt, woran Sie solche Angebote erkennen. Der frühere Leitfaden zu Gemini 3.6 Flash beschreibt ein ähnliches Vorgehen für die Vorgängerversion.

Das kostenlose Kontingent mit Apidog besser nutzen

Ein kostenloser Tarif belohnt reproduzierbare Tests. Manuell neu eingegebene Prompts, versehentliche 429-Fehler und unnötige Anfragen mit hohem Denkniveau verbrauchen Kontingent, das Sie nicht zurückbekommen.

Mit Apidog können Sie die wichtigsten Abläufe als wiederholbare API-Tests speichern.

  1. Legen Sie GEMINI_API_KEY als Umgebungsvariable in einer Apidog-Umgebung an.
  2. Halten Sie den Schlüssel aus Request-Bodies und geteilten Sammlungen heraus.
  3. Speichern Sie den Interactions-Aufruf und den generateContent-Aufruf als benannte Requests.
  4. Hinterlegen Sie Prompt, Modell und thinking_level als Variablen.
  5. Wechseln Sie das Denkniveau über Variablen, statt den JSON-Body manuell zu bearbeiten.
  6. Fügen Sie eine Assertion für den Statuscode hinzu, damit eine 429 als fehlgeschlagener Test erscheint.
  7. Prüfen Sie am alten Endpunkt usageMetadata.thoughtsTokenCount, um den Anteil der Denk-Token zu sehen.

Laden Sie Apidog herunter und richten Sie anschließend einen kleinen Smoke-Test ein: beispielsweise eine Anfrage mit thinking_level: low pro Tag.

So erkennen Sie Änderungen am Modellverhalten oder an den kostenlosen Limits, bevor sie Ihre Nutzer betreffen. Mit der Anleitung API-Tests in Apidog planen konfigurieren Sie die passenden Zeitpläne.

Häufig gestellte Fragen

Ist Gemini 3.8 Flash kostenlos?

Ja. Sie können es über Google AI Studio und den kostenlosen Tarif der Gemini API verwenden. Es gelten Ratenlimits, und Google darf Daten aus dem kostenlosen Tarif zur Verbesserung seiner Produkte verwenden. Die Modell-ID ist dieselbe gemini-3.8-flash, die auch kostenpflichtige Tarife nutzen.

Kann ich Gemini 3.8 Flash kostenlos in der Gemini-App nutzen?

Nein. In der Gemini-App ist 3.8 Flash für Google-AI-Pro- und Ultra-Abonnenten verfügbar. Ohne Abonnement können private Nutzer das Modell im KI-Modus der Google-Suche und in Gemini für Google Tabellen verwenden.

Wie hoch sind die kostenlosen Ratenlimits?

Google zeigt die Limits pro Modell auf der AI-Studio-Ratenlimit-Seite an. Die Werte ändern sich und stehen nicht dauerhaft im Dokumentationstext. Wenn Sie mehr Kapazität benötigen, aktiviert die Verknüpfung eines Abrechnungskontos Stufe 1, ohne dass Sie zunächst Geld ausgeben müssen.

Ist das Denkniveau im kostenlosen Tarif enthalten?

Ja. low, medium und high funktionieren im kostenlosen Tarif. medium ist voreingestellt; minimal führt bei 3.8 Flash zu einem Fehler. Da Denk-Token auf die Token-Limits angerechnet werden, nutzt low das kostenlose Kontingent am längsten.

Ist Gemini 3.8 Flash Cyber kostenlos verfügbar?

Nein. Gemini 3.8 Flash Cyber ist außerhalb des Fairwind-Programms überhaupt nicht verfügbar. Reguläre Entwickler können Gemini 3.8 Flash verwenden und daran eigene API-Sicherheitstests durchführen.

Kostenlos starten, später entscheiden

Der kostenlose Tarif ist eine echte Evaluierungsumgebung für Gemini 3.8 Flash. Erstellen Sie einen API-Schlüssel, starten Sie mit thinking_level: low, halten Sie sensible Daten fern und prüfen Sie die aktuellen Ratenlimits direkt in AI Studio.

Wenn 429-Fehler regelmäßig auftreten, aktivieren Sie Stufe 1 durch die Verknüpfung der Abrechnung. Nutzen Sie Batch für asynchrone Aufgaben und Caching für wiederkehrende Kontexte. Mit 0,375 $ pro Million Input-Token bis Dezember 2026 kann der erste kostenpflichtige Monat günstiger sein als die Wartezeit auf das nächste kostenlose Kontingent.

Top comments (0)