Gemini 4 Argon kostet während einer Einführungsphase 2 $ pro 1 Mio. Eingabe-Tokens und 10 $ pro 1 Mio. Ausgabe-Tokens. Danach steigen die Preise auf 4 $ beziehungsweise 20 $. Zwischengespeicherte Eingaben erhalten 95 % Rabatt auf den Eingabepreis: 0,10 $ während der Einführung und 0,20 $ danach. Google hat weder die Dauer der Einführungsphase noch eine allgemein verfügbare Modell-ID genannt. Argon wird zunächst nur für Cyberverteidiger im Fairwind-Programm eingeführt.
Apidog noch heute ausprobieren
Dieser Beitrag übersetzt die Preisliste in umsetzbare Budgetzahlen: Modellvergleich, vier Kostenbeispiele, Kosten pro Aufgabe und konkrete Kostenkontrollen. Eine Einführung zum Modell finden Sie unter Was Gemini 4 Argon ist, Informationen zum Zugang unter Ist Gemini 4 Argon kostenlos. Sie können die Kostenprüfung bereits heute in Apidog mit einem verfügbaren Gemini-Modell einrichten und später nur die Modellvariable austauschen.
Das Preisblatt
Google veröffentlichte die Preise im Launch-Post für Gemini 4 Argon. Die Preise nach der Einführungsphase stehen in Fußnote 1: „Nach Ablauf der Einführungsphase gelten die Preise von 4 $ pro 1 Mio. Eingabe-Tokens und 20 $ pro 1 Mio. Ausgabe-Tokens.“
| Gemini 4 Argon, pro 1 Mio. Tokens | Einführung | Standard (nach Einführung) |
|---|---|---|
| Eingabe | $2.00 | $4.00 |
| Zwischengespeicherte Eingabe (95 % Rabatt auf Eingabe) | $0.10 | $0.20 |
| Ausgabe | $10.00 | $20.00 |
| Maximale Ausgabe pro Antwort (Google) | 1 Mio. Tokens | 1 Mio. Tokens |
| Kosten für eine vollständige 1 Mio.-Token-Ausgabe | $10.00 | $20.00 |
Die Cache-Preise folgen direkt aus der 95-%-Regel:
Einführung: 2,00 $ × 0,05 = 0,10 $ pro 1 Mio. Tokens
Standard: 4,00 $ × 0,05 = 0,20 $ pro 1 Mio. Tokens
Google hat noch kein Eingabekontextfenster und keine Modell-ID veröffentlicht. Das dokumentierte Ausgabelimit liegt bei 1 Mio. Tokens und ist laut Google höher als die vorherigen 64K Tokens. Der Drittanbieter-Evaluator Vals AI listet für die getestete Konfiguration allerdings eine maximale Ausgabe von 262K Tokens.
Argon mit aktuellen Frontier- und Gemini-Modellen vergleichen
Alle Preise gelten pro 1 Mio. Tokens.
| Modell | Eingabe | Zwischengespeicherte Eingabe | Ausgabe | Max. Ausgabe |
|---|---|---|---|---|
| Gemini 4 Argon (Einführung) | $2 | $0.10 | $10 | 1M |
| Gemini 4 Argon (Standard) | $4 | $0.20 | $20 | 1M |
| GPT-6 Astra | $10 | $1 | $50 | 128,000 |
| Claude Opus 5.5 | $4 | $0.20 | $20 | 128K (300K im Batch, Beta) |
| Claude Sonnet 5.5 | $2 | $0.20 | $10 | 128K (300K im Batch, Beta) |
| GPT-6.1 Sol | $2 | $0.10 | $10 | 128,000 |
| Claude Fable 5.1 | $10 | $0.25 | $50 | 128K |
| gemini-3.1-pro-preview (Prompt <=200K / >200K) | $2 / $4 | $0.20 / $0.40 | $12 / $18 | 65,536 |
| gemini-3.8-flash (Einführung / ab 01.01.2027) | $0.75 / $1.50 | $0.075 / $0.15 | $3.75 / $7.50 | 65,536 |
Die Vergleichspreise stammen aus den Dokumentationen der Anbieter: OpenAIs GPT-6-Astra-Seite, Anthropics Preisseite und Googles Gemini-API-Preisseite.
Wichtige Einordnung:
- Standard-Argon entspricht Claude Opus 5.5. Beide kosten 4 $ für Eingabe, 20 $ für Ausgabe und 0,20 $ für zwischengespeicherte Eingabe.
- Einführungs-Argon entspricht Claude Sonnet 5.5 und GPT-6.1 Sol. Alle liegen bei 2 $ Eingabe und 10 $ Ausgabe. Der Cache-Preis von 0,10 $ entspricht GPT-6.1 Sol.
- GPT-6 Astra und Claude Fable 5.1 sind deutlich teurer. Sie kosten das Fünffache des Einführungs-Argon und das 2,5-Fache des Standard-Argon. Details: Claude Fable 5.1 Preise.
- Argon liegt bei der Einführung unter gemini-3.1-pro-preview. Die Ausgabe kostet 10 $ statt 12 $ pro 1 Mio. Tokens.
- Lange Prompts können den Tarif verändern. OpenAI verdoppelt über 272K Eingabe-Tokens den Eingabe- und Cache-Preis und erhöht den Ausgabepreis für die gesamte Anfrage um das 1,5-Fache. Gemini 3.1 Pro hat eine Stufe über 200K Tokens. Anthropic hat diese Stufe nicht. Google hat für Argon noch keine entsprechende Regel veröffentlicht.
Für einen Fähigkeitsvergleich siehe Gemini 4 Argon vs. GPT-6 Astra vs. Claude Opus 5.5.
Denk-Tokens als Ausgabe budgetieren
Bei aktuellen Gemini-Modellen werden Denk-Tokens als Ausgabe berechnet. Googles Thinking-Dokumentation beschreibt die Antwortpreisgestaltung als Summe aus Ausgabe-Tokens und Denk-Tokens.
Google hat diese Regel noch nicht ausdrücklich für Argon dokumentiert. Planen Sie dennoch konservativ:
kostenpflichtige Ausgabe = sichtbare Ausgabe-Tokens + Denk-Tokens
Google führte Argons Evaluierungen mit den höchsten Denkeinstellungen aus. Lesen Sie den Preis von 10 $ pro 1 Mio. Ausgabe-Tokens daher als Preis für Antwort und Überlegung.
Vier durchgerechnete Szenarien
Verwenden Sie für jede Anfrage dieselbe Grundformel:
Kosten = Eingabe-Tokens / 1.000.000 × Eingabepreis
+ Ausgabe-Tokens / 1.000.000 × Ausgabepreis
Die Szenarien 1 bis 3 verwenden kein Caching.
1. Typischer API-Aufruf: 20K Eingabe, 5K Ausgabe
Einführung
20.000 / 1.000.000 × 2 $ = 0,04 $ Eingabe
5.000 / 1.000.000 × 10 $ = 0,05 $ Ausgabe
Gesamt 0,09 $
Standard
20.000 / 1.000.000 × 4 $ = 0,08 $ Eingabe
5.000 / 1.000.000 × 20 $ = 0,10 $ Ausgabe
Gesamt 0,18 $
Bei 1.000 Aufrufen pro Tag ergibt das:
| Tarif | Kosten pro Aufruf | Kosten pro Tag |
|---|---|---|
| Einführung | $0.09 | $90 |
| Standard | $0.18 | $180 |
Zum Vergleich kostet derselbe Aufruf:
- Claude Opus 5.5: 0,18 $
- GPT-6 Astra: 0,45 $ (
0,20 $ + 0,25 $) - gemini-3.1-pro-preview: 0,10 $ (
0,04 $ + 0,06 $) - gemini-3.8-flash zum Einführungspreis: etwa 0,034 $ (
0,015 $ + 0,019 $)
2. Lange Agentenrunde: 200K Eingabe, 50K Ausgabe
Einführung
200.000 / 1.000.000 × 2 $ = 0,40 $ Eingabe
50.000 / 1.000.000 × 10 $ = 0,50 $ Ausgabe
Gesamt 0,90 $
Standard
200.000 / 1.000.000 × 4 $ = 0,80 $ Eingabe
50.000 / 1.000.000 × 20 $ = 1,00 $ Ausgabe
Gesamt 1,80 $
GPT-6 Astra würde für denselben Umfang 4,50 $ berechnen:
200K × 10 $ / 1M = 2,00 $
50K × 50 $ / 1M = 2,50 $
Gesamt 4,50 $
gemini-3.1-pro-preview liegt bei 1,00 $, erreicht bei 200K Tokens aber genau seine Tarifgrenze. Längere Prompts werden dort mit 4 $ Eingabe und 18 $ Ausgabe pro 1 Mio. Tokens berechnet. Falls Argon später eine ähnliche Stufe erhält, steigen die Kosten langer Agentenrunden.
3. Maximale Antwort: 1 Mio. Ausgabe-Tokens
Die Ausgabe allein kostet:
| Tarif | Berechnung | Kosten |
|---|---|---|
| Einführung | 1.000.000 / 1.000.000 × 10 $ |
$10.00 |
| Standard | 1.000.000 / 1.000.000 × 20 $ |
$20.00 |
Mit einem Prompt von 100K Tokens kommt Eingabe hinzu:
| Tarif | Ausgabe | 100K Eingabe | Gesamt |
|---|---|---|---|
| Einführung | $10.00 | $0.20 | $10.20 |
| Standard | $20.00 | $0.40 | $20.40 |
Kein anderes Modell in der Vergleichstabelle erzeugt diese Menge in einer synchronen Antwort. Die Wettbewerber begrenzen auf 128K, das vorherige Gemini-Pro-Modell auf 65.536 Tokens.
Bei der von Vals AI gelisteten maximalen Ausgabe von 262K Tokens ergibt sich:
| Tarif | Kosten für 262K Ausgabe |
|---|---|
| Einführung | $2.62 |
| Standard | $5.24 |
Für Streaming, Timeouts und Gateways siehe Gemini 4 Argons 1 Mio. Ausgabe-Tokens.
4. Einen 500K-Token-Prompt zehnmal zwischenspeichern
Angenommen, Sie senden eine 500K-Token-Codebasis oder einen Vertragssatz zehnmal und erhalten jeweils 5K Tokens Ausgabe. Der erste Aufruf bezahlt die vollständige Eingabe; die folgenden neun lesen aus dem Cache.
| 10 Aufrufe, 500K Prompt, je 5K Ausgabe | Einführung | Standard |
|---|---|---|
| Eingabe ohne Caching (10 × 500K) | $10.00 | $20.00 |
| Eingabe mit Cache (1 voll + 9 gecacht) | $1.00 + 9 × $0.05 = $1.45 | $2.00 + 9 × $0.10 = $2.90 |
| Ausgabe (10 × 5K) | $0.50 | $1.00 |
| Gesamt mit Caching | $1.95 | $3.90 |
| Gesamt ohne Caching | $10.50 | $21.00 |
Caching reduziert die Eingaberechnung in diesem Beispiel um 85,5 %.
Beachten Sie dabei zwei offene Punkte:
- Google hat nicht angegeben, ob Argon Cache-Speichergebühren verlangt. Bei gemini-3.1-pro-preview kosten 500K Tokens für eine Stunde Speicherzeit zusätzlich 2,25 $.
- Ein 500K-Token-Prompt liegt über der 200K-Grenze von Gemini 3.1 Pro. Für Argon ist noch nicht bekannt, ob lange Prompts einen eigenen Tarif erhalten.
Argons Standard-Cache-Rate von 0,20 $ entspricht Claude Opus 5.5. Die Break-even-Logik können Sie daher aus der Claude Opus 5.5 Prompt-Caching-Kostenberechnung übernehmen.
Nicht nur Tokenpreis, sondern Kosten pro Aufgabe messen
Der Preis pro Token ist keine vollständige Aussage über die Kosten einer Aufgabe.
Artificial Analysis listet 1,99 $ pro Aufgabe für seinen Intelligence Index auf Gemini 4 Argon mit hoher Einstellung zu Einführungspreisen. The Decoder nennt für denselben Lauf 3,98 $ zu Standardpreisen. Artificial Analysis bewertet Argon mit 53, genau wie GPT-6 Astra mit maximaler Einstellung, das dort mit 3,26 $ pro Aufgabe gelistet ist.
Der wesentliche Faktor ist das Token-Volumen:
| Modell / Einstellung | Ausgabe-Tokens pro Aufgabe | Ausgabekosten |
|---|---|---|
| Argon, hoch, Einführung | ca. 62K | $0.62 |
| GPT-6 Astra, maximal | ca. 27K | $1.35 |
Berechnung:
Argon: 62.000 / 1.000.000 × 10 $ = 0,62 $
Astra: 27.000 / 1.000.000 × 50 $ = 1,35 $
Argon verwendet dabei ungefähr 2,3-mal so viele Ausgabe-Tokens wie Astra. Deshalb kann Argons vollständiger Aufgabenpreis zu Standardtarifen mit 3,98 $ über den 3,26 $ für Astra liegen, obwohl Argons Standardtarife pro Token 60 % unter Astra liegen.
Vals AI zeigt denselben Effekt im Vals Index:
| Modell | Kosten pro Test |
|---|---|
| Gemini 4 Argon | $15.68 |
| Claude Opus 5.5 | $32.14 |
| Claude Sonnet 5.5 | $21.34 |
| GPT-6.1 Sol | $3.24 |
Vals AI listet Argon mit dem Standardtarif von 4 $ Eingabe und 20 $ Ausgabe. Claude Sonnet 5.5 und GPT-6.1 Sol teilen zwar Argons Einführungspreis auf dem Papier, ihre Kosten pro Test unterscheiden sich aber um mehr als das Sechsfache.
Praktische Regel: Budgetieren Sie mit den Token-Zählungen Ihrer eigenen Produktion, nicht mit einer allgemeinen Preisliste oder Benchmark-Kosten pro Aufgabe.
Kostenkontrollen vor dem Argon-Start einrichten
Richten Sie die folgenden Kontrollen jetzt mit einem verfügbaren Gemini-Modell ein.
1. Ausgabe begrenzen
Bei generateContent setzt generationConfig.maxOutputTokens die Obergrenze.
{
"generationConfig": {
"maxOutputTokens": 8192
}
}
Google sagt, dass neue Modelle über die Interactions API starten werden. Verwenden Sie dort die entsprechende Begrenzung, sobald die Argon-Dokumentation verfügbar ist.
Eine maximale Ausgabe von 1 Mio. Tokens bedeutet bereits ohne Eingabe:
10 $ pro Aufruf während der Einführung
20 $ pro Aufruf zum Standardtarif
Setzen Sie deshalb ein Limit, das Ihrer tatsächlichen Antwortgröße entspricht.
2. Stabile Inhalte cachen
Cache-Kandidaten sind Inhalte, die sich über viele Aufrufe nicht ändern:
- Systemanweisungen
- Tool- und JSON-Schemas
- API-Spezifikationen
- Referenzdokumente
- große Codebasen
- Vertrags- oder Richtlinientexte
Der 95-%-Rabatt greift nur, wenn Sie diese stabilen Eingaben tatsächlich wiederverwenden.
3. Denk-Level gezielt testen
Google hat Argons Denk-Level noch nicht veröffentlicht. Bei aktuellen Modellen gilt:
-
gemini-3.1-pro-preview: standardmäßighigh -
gemini-3.8-flash: standardmäßigmedium
Sobald Argons Einstellungen dokumentiert sind, testen Sie mindestens zwei Konfigurationen:
- Höchstes Denk-Level als Qualitätsbaseline
- Niedrigeres Denk-Level für Routineaufgaben
Messen Sie pro Variante Qualität, Latenz und Token-Verbrauch. Behalten Sie das günstigere Level nur, wenn es die Anforderungen Ihrer Aufgabe weiterhin erfüllt.
4. usageMetadata speichern und Kosten prüfen
Jede generateContent-Antwort enthält usageMetadata. Speichern Sie Ihre Anfrage in Apidog, legen Sie den Modellnamen als Umgebungsvariable GEMINI_MODEL ab und berechnen Sie die Kosten nach jeder Antwort.
Verwenden Sie diese Formel:
cost = uncached_input / 1,000,000 × input_rate
+ cached_input / 1,000,000 × cached_rate
+ (output + thinking) / 1,000,000 × output_rate
Beispiel für eine Nach-Antwort-Prüfung in JavaScript:
const usage = pm.response.json().usageMetadata || {};
const uncachedInput = usage.promptTokenCount || 0;
const cachedInput = usage.cachedContentTokenCount || 0;
const output = usage.candidatesTokenCount || 0;
const thinking = usage.thoughtsTokenCount || 0;
// Einführungspreise für Gemini 4 Argon
const inputRate = 2.00;
const cachedRate = 0.10;
const outputRate = 10.00;
const cost =
(uncachedInput / 1_000_000) * inputRate +
(cachedInput / 1_000_000) * cachedRate +
((output + thinking) / 1_000_000) * outputRate;
const maxCostPerRequest = 0.50;
pm.environment.set("LAST_REQUEST_COST_USD", cost.toFixed(6));
pm.test(`Anfrage bleibt unter ${maxCostPerRequest} $`, () => {
pm.expect(cost).to.be.below(maxCostPerRequest);
});
Führen Sie diese Prüfung heute mit gemini-3.8-flash aus. Sobald Google die Argon-Modell-ID veröffentlicht, ändern Sie nur GEMINI_MODEL und die Preisvariablen.
Was Google noch nicht bepreist oder dokumentiert hat
Für eine belastbare Produktionsplanung fehlen noch mehrere Angaben:
- Dauer der Einführungsphase
- Startdatum für 4 $ Eingabe und 20 $ Ausgabe
- mögliche Preisstufe für Prompts über 200K Tokens
- Batch- oder Flex-Preise
- Gemini 3.1 Pro bietet beides mit 1 $/2 $ Eingabe und 6 $/9 $ Ausgabe
- Gebühren für Cache-Speicherung
- Ratenbegrenzungen
- kostenloser Tarif
- allgemein verfügbare Modell-ID
Planen Sie deshalb mit einem Preisbereich statt mit einem einzelnen festen Wert.
FAQ
Wie viel kostet Gemini 4 Argon pro Million Tokens?
Während der Einführung 2 $ für Eingabe und 10 $ für Ausgabe. Danach 4 $ und 20 $. Zwischengespeicherte Eingabe kostet 0,10 $ während der Einführung und 0,20 $ danach.
Wie lange dauert der Einführungspreis?
Google hat keine Dauer und kein Enddatum genannt.
Werden Denk-Tokens als Ausgabe berechnet?
Bei aktuellen Gemini-Modellen ja. Google hat die Regel für Argon noch nicht spezifisch dokumentiert.
Wie viel kostet eine Antwort mit 1 Mio. Ausgabe-Tokens?
10 $ zum Einführungspreis und 20 $ zum Standardpreis, jeweils vor Eingabekosten.
Ist Argon günstiger als Claude Opus 5.5 oder GPT-6 Astra?
Pro Token entspricht Standard-Argon Claude Opus 5.5 und liegt 60 % unter GPT-6 Astra. Pro Aufgabe hängt der Preis vom Token-Verbrauch ab. Artificial Analysis misst für Argon ungefähr das 2,3-Fache der Ausgabe-Tokens von Astra. Für ein günstigeres Gemini-Modell, das heute verfügbar ist, siehe Gemini 3.8 Flash-Preise.
Kann ich Argon heute bezahlen?
Nein. Das Modell wird zunächst nur an Partner des Fairwind-Programms ausgeliefert. Bezahlte API-Kunden und Google-AI-Ultra-Abonnenten sollen folgen, aber ohne veröffentlichtes Datum.
Jetzt budgetieren, später messen
Berechnen Sie Ihren aktuellen Traffic mit beiden Tarifen:
Einführungsbereich:
Eingabe-Tokens × 2 $ / 1 Mio.
Ausgabe-Tokens × 10 $ / 1 Mio.
Standardbereich:
Eingabe-Tokens × 4 $ / 1 Mio.
Ausgabe-Tokens × 20 $ / 1 Mio.
Erstellen Sie danach die Messung:
- Apidog herunterladen.
- Eine Anfrage gegen
gemini-3.8-flashspeichern. -
GEMINI_MODELals Umgebungsvariable verwenden. -
usageMetadatanach jeder Antwort auswerten. - Eine Kostenobergrenze als Test-Assertion setzen.
- Nach Veröffentlichung der Argon-ID nur die Modellvariable und Preiswerte ändern.
So sehen Sie vom ersten Tag an Ihre tatsächlichen Kosten pro Aufruf statt nur theoretische Preise pro Million Tokens.

Top comments (0)