Gemini 3.8 Flash ist heute verfügbar: ein stabiles Modell mit kostenloser Stufe. Bis zum 31.12.2026 kostet es 0,75 $ für Eingabe- und 3,75 $ für Ausgabe-Tokens pro 1 Mio. Tokens; danach 1,50 $ bzw. 7,50 $. Die Ausgabebeschränkung liegt bei 65.536 Tokens. Gemini 4 Argon ist nicht dasselbe Modell: Googles Veröffentlichung nennt während einer Einführungsphase unbekannter Länge 2 $ für Eingabe und 10 $ für Ausgabe, anschließend 4 $ und 20 $. Google gibt für Argon eine Ausgabebeschränkung von 1 Mio. Tokens an, aber das Modell ist heute nur für Fairwind-Programmpartner verfügbar. Wenn Sie in diesem Quartal liefern müssen, setzen Sie Flash ein und halten Sie Argon als Konfigurationswechsel bereit.
Dieser Beitrag vergleicht Spezifikationen, gemeinsame Benchmark-Zeilen, Cyber-Evaluierungen und Kosten für denselben API-Aufruf. Anschließend folgt eine konkrete Entscheidungsregel und ein Setup, mit dem Sie später nur eine Variable ändern müssen. Weitere Hintergründe: Was ist Gemini 4 Argon? und was ist Gemini 3.8 Flash?.
Seite an Seite: Was Sie heute aufrufen können
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Verfügbarkeit | Stabil auf der Gemini API, AI Studio, Antigravity und Gemini Enterprise | Untergruppe von Fairwind-Programmpartnern, als verwaltetes Modell auf Gemini Enterprise |
| Modell-ID | gemini-3.8-flash |
Nicht veröffentlicht |
| Preis pro 1 Mio. Tokens (Eingabe / Ausgabe) | 0,75 $ / 3,75 $ bis 31.12.2026, danach 1,50 $ / 7,50 $ | 2 $ / 10 $ zur Einführung, danach 4 $ / 20 $ |
| Gecachter Input pro 1 Mio. | 0,075 $, danach 0,15 $ | 0,10 $ zur Einführung, danach 0,20 $ (95 % Rabatt auf Input) |
| Ausgabebeschränkung | 65.536 Tokens | 1 Mio. Tokens laut Google |
| Eingabefenster | 1.048.576 Tokens | Nicht veröffentlicht |
| Denk-Level |
low, medium (Standard), high; minimal liefert HTTP 400 |
Nicht dokumentiert |
| Kostenlose API-Stufe | Ja, ratenbegrenzt | Keine angekündigt |
| Verbraucherzugang | Gemini-App mit AI Pro und Ultra, AI-Modus in der Suche | Noch nicht; AI-Ultra-Abonnenten sind in der ersten Welle, ohne Datum |
Einige Angaben brauchen Kontext:
- Google hat Argons Eingabefenster nicht veröffentlicht, obwohl die Langkontext-Evaluierung Prompts bis 1 Mio. Tokens nutzte.
- Google nennt für Argon ein Ausgabelimit von 1 Mio. Tokens. Der Drittanbieter-Evaluator Vals AI listet für seine getestete Konfiguration dagegen 262.000 Tokens maximale Ausgabe.
- Argons Evaluierungen liefen mit den „höchsten Denkeinstellungen“. Ein hohes Level ist daher wahrscheinlich, aber Google hat weder verfügbare Level noch einen Standardwert dokumentiert.
- Die Flash-Level sind in Googles Denk-Dokumentation sowie im Leitfaden zu den Denk-Leveln von 3.8 Flash beschrieben.
Flashs kostenlose Stufe ist ratenbegrenzt. Google weist außerdem darauf hin, dass Daten aus der kostenlosen Stufe „zur Verbesserung unserer Produkte verwendet werden“. Für Argon wurde keine kostenlose Nutzung angekündigt. Der Argon-Erklärer zum kostenlosen Zugang zeigt verfügbare Alternativen.
Die Benchmark-Zeilen, die beide Veröffentlichungen teilen
Die Veröffentlichungstabellen beider Modelle enthalten zwei vergleichbare Zeilen. Es handelt sich um von Google gemeldete Werte; Argons Methodik schreibt beide Benchmarks Vals AI zu.
| Benchmark | Gemini 3.8 Flash (Tabelle vom 2. Sep.) | Gemini 4 Argon (Tabelle vom 30. Sep.) |
|---|---|---|
| Vals Finanzagent v2 | 61,4 % | 65,4 % |
| Harvey Rechtsagent-Benchmark | 10,0 % | 19,6 % |
Die Tabellen erschienen im Abstand von einem Monat und mit unterschiedlichen Vergleichsmodellen. Behandeln Sie die Differenz deshalb als Richtungswert, nicht als kontrollierten A/B-Test.
Praktisch relevant sind dennoch zwei Punkte:
- Rechtsagenten: Argon erreicht 19,6 % gegenüber 10,0 % für Flash — fast das Doppelte.
- Finanzagenten: Die Differenz beträgt 4 Prozentpunkte zugunsten von Argon.
Weitere Werte aus Argons Tabelle haben im Text keine direkte 3.8-Flash-Entsprechung. Googles 3.8-Flash-Tabelle berichtete etwa HLE-Verified, während Argon diesen Wert nicht aufführt. Flashs DeepSWE-Score erschien nur in Modellkartenbildern.
Auf der Text-Bestenliste von Arena, einem Ranking eines Drittanbieters, liegt Argon (High) bei vorläufigen Stimmen auf Platz 1, Gemini 3.8 Flash (High) auf Platz 11. Die vollständige Argon-Tabelle mit Messenden pro Zeile finden Sie in der Argon-Benchmarks-Aufschlüsselung.
Cyber: Argon vs. 3.8 Flash Cyber
Die DeepMind-Cyber-Seite vergleicht Argon mit Gemini 3.8 Flash Cyber, einem zugangsbeschränkten Cyber-Geschwistermodell von Flash:
| Cyber-Evaluierung | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Entdeckung von Schwachstellen in der realen Welt | 85,8 % | 71,0 % |
| Wiz-Penetrationstest-Benchmark | 70,9 % | 58,2 % |
Beide Modelle sind zugangsbeschränkt:
- Gemini 3.8 Flash Cyber: GA hinter einer Zulassungsliste auf der Gemini Enterprise Agent Platform.
- Gemini 4 Argon: Nur für Fairwind-Partner verfügbar.
Wenn Sie kein Fairwind-Partner sind, ändern diese Werte nichts an Ihrer aktuellen Implementierung: Das allgemeine Gemini 3.8 Flash ist das Modell, auf dem Sie heute aufbauen können.
Kosten desselben Aufrufs bei beiden Modellen
Nehmen wir einen API-Aufruf mit:
- 100.000 Eingabe-Tokens
- 8.000 Ausgabe-Tokens
Bei aktuellen Gemini-Modellen, einschließlich 3.8 Flash, werden Denk-Tokens als Ausgabe abgerechnet. Die 8.000 Ausgabe-Tokens schließen sie daher ein. Google hat nicht erläutert, wie Argon Denk-Tokens abrechnet; die folgenden Argon-Werte nehmen an, dass das Modell dem aktuellen Gemini-Verhalten folgt.
| Modell und Zeitraum | Eingabekosten | Ausgabekosten | Gesamt pro Aufruf |
|---|---|---|---|
| 3.8 Flash, Einführung | 0,1 Mio. × 0,75 $ = 0,075 $ | 0,008 Mio. × 3,75 $ = 0,030 $ | 0,105 $ |
| 3.8 Flash, ab 01.01.2027 | 0,1 Mio. × 1,50 $ = 0,150 $ | 0,008 Mio. × 7,50 $ = 0,060 $ | 0,210 $ |
| Argon, Einführung | 0,1 Mio. × 2 $ = 0,200 $ | 0,008 Mio. × 10 $ = 0,080 $ | 0,280 $ |
| Argon, Standard | 0,1 Mio. × 4 $ = 0,400 $ | 0,008 Mio. × 20 $ = 0,160 $ | 0,560 $ |
Argons Pro-Token-Preise liegen sowohl in der Einführungs- als auch in der Standardphase bei dem Faktor 8 / 3, also etwa 2,67-mal über Flash.
Bei 1.000 Aufrufen dieses Typs pro Tag:
Gemini 3.8 Flash zur Einführung: 1.000 × 0,105 $ = 105 $/Tag
Gemini 4 Argon zur Einführung: 1.000 × 0,280 $ = 280 $/Tag
Drei Faktoren können dieses Verhältnis in Ihrer Anwendung verändern:
Unterschiedliche Token-Anzahlen
Derselbe Prompt erzeugt auf unterschiedlichen Modellen unterschiedliche Ausgabe- und Denk-Token-Anzahlen. Argons veröffentlichte Evaluierungen liefen mit den höchsten Denkeinstellungen. Für 3.8 Flash warnt Google, dass höhere Denkstufen mehr Tokens verbrauchen können.-
Lange Ausgaben ändern die Architektur
Eine Antwort mit 200.000 Tokens passt nicht in Flashs Limit von 65.536 Tokens. Sie müssten die Aufgabe auf mehrere Aufrufe aufteilen. Unter Argons angegebenem Limit wäre dies ein Aufruf:- 200.000 Ausgabe-Tokens: 2,00 $ zur Einführung oder 4,00 $ zum Standardpreis.
- 1 Mio. Ausgabe-Tokens: 10 $ zur Einführung oder 20 $ zum Standardpreis.
Nur Flash hat ein bekanntes Ende der Einführungsphase
Flashs Einführungspreise enden am 31.12.2026. Google hat kein Enddatum für Argons Einführungspreise genannt.
Flash bietet laut Gemini-API-Preisseite außerdem Batch-Verarbeitung mit 50 % Rabatt: 0,375 $ für Input und 1,875 $ für Output pro 1 Mio. Tokens bis 31. Dezember. Für Argon hat Google keine Batch-Preise veröffentlicht.
Details dazu finden Sie im Argon-Preis-Leitfaden und im Preis-Leitfaden für Gemini 3.8 Flash.
Sollten Sie auf Argon warten oder Flash verwenden?
Verwenden Sie jetzt 3.8 Flash, wenn
- Sie budgetgebunden sind. Flash kostet pro Token 3/8 von Argon; Batch halbiert den Preis zusätzlich.
- Sie hohes Volumen verarbeiten. Klassifizierung, Extraktion, Routing und Chat summieren sich bei 10 $ pro 1 Mio. Ausgabe-Tokens schnell.
- Sie sofort liefern müssen. Flash hat eine stabile Modell-ID, eine kostenlose Stufe für Prototyping und einen veröffentlichten Preisplan.
- Ihre Antworten in 65.536 Tokens passen. Das trifft auf die meisten API-Workloads zu.
Planen Sie Argon ein, wenn
- Ihre Workflows langfristig sind. Google beschreibt Argon als Modell, das tiefgreifende Schlussfolgerungen über komplexe, langfristige Workflows hinweg aufrechterhalten soll.
- Sie Ausgaben über 64.000 Tokens benötigen. Vollständige Modul-Umschreibungen, lange Berichte und große Migrationen passen zu einem Ausgabelimit von 1 Mio. Tokens.
- Sie Rechts- oder Finanzagenten betreiben. Das sind die zwei gemeinsamen Benchmark-Zeilen, in denen Argon führt.
- Sie Fairwind-berechtigt sind. Argon ist das Modell, das im Programm aktuell im Fokus steht.
Die praktische Strategie ist nicht „Flash oder Argon“, sondern Routing:
Standard-Workloads und hohes Volumen -> Gemini 3.8 Flash
Lange oder besonders anspruchsvolle Workflows -> Gemini 4 Argon, sobald verfügbar
Dafür sollte sich nur die Modellkonfiguration ändern, nicht Ihre gesamte Anfrageimplementierung.
Eine gespeicherte Anfrage, zwei Modelle
Speichern Sie den Modellnamen in einer Umgebungsvariablen. Führen Sie Ihre produktiven Anfragen heute mit 3.8 Flash aus. Sobald Google Argons Modell-ID veröffentlicht, tauschen Sie nur diese Variable aus.
Google hat Argons Modell-ID noch nicht veröffentlicht. Raten Sie nicht und verwenden Sie keinen vermuteten Namen in Produktionscode.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "Summarize this contract clause in 3 bullets."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
},
"maxOutputTokens": 8192
}
}'
Empfohlenes Setup
- Setzen Sie
GEMINI_API_KEYundGEMINI_MODELin Ihrer Umgebung. - Starten Sie mit:
export GEMINI_MODEL="gemini-3.8-flash"
- Begrenzen Sie
maxOutputTokens, damit eine unerwartet lange Antwort Ihr Budget nicht überschreitet. - Speichern Sie
usageMetadataaus jeder Antwort. - Definieren Sie Grenzwerte für Ausgabe- und Denk-Tokens.
- Führen Sie denselben Testsatz später mit Argon aus und vergleichen Sie Qualität, Latenz und Token-Verbrauch.
In Apidog können Sie GEMINI_API_KEY und GEMINI_MODEL als Umgebungsvariablen speichern, die Anfrage wiederverwendbar ablegen und Prüfungen ergänzen:
- HTTP-Status
200 - Felder, die Ihre Anwendung tatsächlich liest
- Obergrenze für
usageMetadata.thoughtsTokenCount - Obergrenze für
usageMetadatapassend zu Ihrem Kostenlimit
Fügen Sie die Anfrage anschließend einem Testszenario hinzu, führen Sie sie mit Flash aus und speichern Sie den Bericht als Baseline.
Vorbehalte für den Argon-Starttag
Google sagt, dass „alle neuen Modelle“ auf der Interactions API starten werden. Es ist nicht bestätigt, ob Argon generateContent unterstützt. Speichern Sie daher zusätzlich eine Interactions-Variante:
POST https://generativelanguage.googleapis.com/v1beta/interactions
Dort verwenden Sie generation_config.thinking_level.
Auch Argons Namen für Denk-Level sind nicht dokumentiert. Das für Flash verwendete medium wird möglicherweise nicht unterstützt. Wenn Argon verfügbar ist:
- Aktualisieren Sie ausschließlich
GEMINI_MODEL. - Führen Sie denselben Prompt- und Testdatensatz erneut aus.
- Vergleichen Sie Antworten und
usageMetadatanebeneinander. - Aktivieren Sie Argon nur für die Workloads, bei denen der Qualitätsgewinn die Mehrkosten rechtfertigt.
FAQ
Ist Gemini 4 Argon besser als Gemini 3.8 Flash?
Ja, in den zwei Zeilen, die beide Starttabellen gemeinsam haben: 65,4 % gegenüber 61,4 % beim Vals Finance Agent v2 und 19,6 % gegenüber 10,0 % beim Harvey’s Legal Agent Benchmark. Argon kostet aber etwa 2,67-mal so viel pro Token und ist noch nicht allgemein verfügbar.
Soll ich auf Gemini 4 Argon warten?
Nein, wenn Sie liefern müssen. Google hat kein Veröffentlichungsdatum genannt, sondern nur „so bald wie möglich“, beginnend mit zahlenden API-Kunden und AI-Ultra-Abonnenten.
Gemini 3.8 Flash oder Argon für ein neues Projekt?
Beginnen Sie mit 3.8 Flash und speichern Sie das Modell in einer Variablen. Verschieben Sie Anfragen mit langen Ausgaben oder hoher rechtlicher und finanzieller Komplexität erst zu Argon, nachdem Sie es mit Ihren eigenen Prompts getestet haben.
Gibt es eine kostenlose Möglichkeit, Argon zu nutzen?
Nein. Google hat keine kostenlose Stufe angekündigt. Der Argon-Erklärer zum kostenlosen Zugang zeigt die kostenlosen Gemini-Modelle, die heute verfügbar sind.
Ersetzt Argon Gemini 3.8 Flash?
Google hat sich dazu nicht geäußert. Google bezeichnet Argon als neues „Frontier“-Modell; Reuters berichtet, es sei größer als die vorherige Pro-Linie. Damit gehört es zu einer anderen Kategorie als Flash.
Nächster Schritt
Richten Sie die Anfrage heute ein, führen Sie sie mit Gemini 3.8 Flash aus und speichern Sie den Bericht. Sobald Argon verfügbar ist, können Sie innerhalb weniger Minuten prüfen, ob die höhere Qualität den Preis für Ihren Traffic rechtfertigt.
Laden Sie Apidog herunter, um den Vergleich als wiederholbaren API-Test aufzubauen.
Top comments (0)