DEV Community

Cover image for Gemini 4 Argon Preisübersicht: $2/$10 Einführungspreis, $4/$20 regulär und 1M-Token Antwort Kosten
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 4 Argon Preisübersicht: $2/$10 Einführungspreis, $4/$20 regulär und 1M-Token Antwort Kosten

Gemini 4 Argon kostet während einer Einführungsphase 2 $ pro 1 Mio. Eingabe-Tokens und 10 $ pro 1 Mio. Ausgabe-Tokens. Danach steigen die Preise auf 4 $ beziehungsweise 20 $. Zwischengespeicherte Eingaben erhalten 95 % Rabatt auf den Eingabepreis: 0,10 $ während der Einführung und 0,20 $ danach. Google hat weder die Dauer der Einführungsphase noch eine allgemein verfügbare Modell-ID genannt. Argon wird zunächst nur für Cyberverteidiger im Fairwind-Programm eingeführt.

Apidog noch heute ausprobieren

Dieser Beitrag übersetzt die Preisliste in umsetzbare Budgetzahlen: Modellvergleich, vier Kostenbeispiele, Kosten pro Aufgabe und konkrete Kostenkontrollen. Eine Einführung zum Modell finden Sie unter Was Gemini 4 Argon ist, Informationen zum Zugang unter Ist Gemini 4 Argon kostenlos. Sie können die Kostenprüfung bereits heute in Apidog mit einem verfügbaren Gemini-Modell einrichten und später nur die Modellvariable austauschen.

fe

Das Preisblatt

Google veröffentlichte die Preise im Launch-Post für Gemini 4 Argon. Die Preise nach der Einführungsphase stehen in Fußnote 1: „Nach Ablauf der Einführungsphase gelten die Preise von 4 $ pro 1 Mio. Eingabe-Tokens und 20 $ pro 1 Mio. Ausgabe-Tokens.“

Gemini 4 Argon, pro 1 Mio. Tokens Einführung Standard (nach Einführung)
Eingabe $2.00 $4.00
Zwischengespeicherte Eingabe (95 % Rabatt auf Eingabe) $0.10 $0.20
Ausgabe $10.00 $20.00
Maximale Ausgabe pro Antwort (Google) 1 Mio. Tokens 1 Mio. Tokens
Kosten für eine vollständige 1 Mio.-Token-Ausgabe $10.00 $20.00

Die Cache-Preise folgen direkt aus der 95-%-Regel:

Einführung: 2,00 $ × 0,05 = 0,10 $ pro 1 Mio. Tokens
Standard:   4,00 $ × 0,05 = 0,20 $ pro 1 Mio. Tokens
Enter fullscreen mode Exit fullscreen mode

Google hat noch kein Eingabekontextfenster und keine Modell-ID veröffentlicht. Das dokumentierte Ausgabelimit liegt bei 1 Mio. Tokens und ist laut Google höher als die vorherigen 64K Tokens. Der Drittanbieter-Evaluator Vals AI listet für die getestete Konfiguration allerdings eine maximale Ausgabe von 262K Tokens.

Argon mit aktuellen Frontier- und Gemini-Modellen vergleichen

Alle Preise gelten pro 1 Mio. Tokens.

Modell Eingabe Zwischengespeicherte Eingabe Ausgabe Max. Ausgabe
Gemini 4 Argon (Einführung) $2 $0.10 $10 1M
Gemini 4 Argon (Standard) $4 $0.20 $20 1M
GPT-6 Astra $10 $1 $50 128,000
Claude Opus 5.5 $4 $0.20 $20 128K (300K im Batch, Beta)
Claude Sonnet 5.5 $2 $0.20 $10 128K (300K im Batch, Beta)
GPT-6.1 Sol $2 $0.10 $10 128,000
Claude Fable 5.1 $10 $0.25 $50 128K
gemini-3.1-pro-preview (Prompt <=200K / >200K) $2 / $4 $0.20 / $0.40 $12 / $18 65,536
gemini-3.8-flash (Einführung / ab 01.01.2027) $0.75 / $1.50 $0.075 / $0.15 $3.75 / $7.50 65,536

Die Vergleichspreise stammen aus den Dokumentationen der Anbieter: OpenAIs GPT-6-Astra-Seite, Anthropics Preisseite und Googles Gemini-API-Preisseite.

Wichtige Einordnung:

  • Standard-Argon entspricht Claude Opus 5.5. Beide kosten 4 $ für Eingabe, 20 $ für Ausgabe und 0,20 $ für zwischengespeicherte Eingabe.
  • Einführungs-Argon entspricht Claude Sonnet 5.5 und GPT-6.1 Sol. Alle liegen bei 2 $ Eingabe und 10 $ Ausgabe. Der Cache-Preis von 0,10 $ entspricht GPT-6.1 Sol.
  • GPT-6 Astra und Claude Fable 5.1 sind deutlich teurer. Sie kosten das Fünffache des Einführungs-Argon und das 2,5-Fache des Standard-Argon. Details: Claude Fable 5.1 Preise.
  • Argon liegt bei der Einführung unter gemini-3.1-pro-preview. Die Ausgabe kostet 10 $ statt 12 $ pro 1 Mio. Tokens.
  • Lange Prompts können den Tarif verändern. OpenAI verdoppelt über 272K Eingabe-Tokens den Eingabe- und Cache-Preis und erhöht den Ausgabepreis für die gesamte Anfrage um das 1,5-Fache. Gemini 3.1 Pro hat eine Stufe über 200K Tokens. Anthropic hat diese Stufe nicht. Google hat für Argon noch keine entsprechende Regel veröffentlicht.

Für einen Fähigkeitsvergleich siehe Gemini 4 Argon vs. GPT-6 Astra vs. Claude Opus 5.5.

Denk-Tokens als Ausgabe budgetieren

Bei aktuellen Gemini-Modellen werden Denk-Tokens als Ausgabe berechnet. Googles Thinking-Dokumentation beschreibt die Antwortpreisgestaltung als Summe aus Ausgabe-Tokens und Denk-Tokens.

Google hat diese Regel noch nicht ausdrücklich für Argon dokumentiert. Planen Sie dennoch konservativ:

kostenpflichtige Ausgabe = sichtbare Ausgabe-Tokens + Denk-Tokens
Enter fullscreen mode Exit fullscreen mode

Google führte Argons Evaluierungen mit den höchsten Denkeinstellungen aus. Lesen Sie den Preis von 10 $ pro 1 Mio. Ausgabe-Tokens daher als Preis für Antwort und Überlegung.

Vier durchgerechnete Szenarien

Verwenden Sie für jede Anfrage dieselbe Grundformel:

Kosten = Eingabe-Tokens / 1.000.000 × Eingabepreis
       + Ausgabe-Tokens / 1.000.000 × Ausgabepreis
Enter fullscreen mode Exit fullscreen mode

Die Szenarien 1 bis 3 verwenden kein Caching.

1. Typischer API-Aufruf: 20K Eingabe, 5K Ausgabe

Einführung

20.000 / 1.000.000 × 2 $  = 0,04 $ Eingabe
 5.000 / 1.000.000 × 10 $ = 0,05 $ Ausgabe
Gesamt                       0,09 $
Enter fullscreen mode Exit fullscreen mode

Standard

20.000 / 1.000.000 × 4 $  = 0,08 $ Eingabe
 5.000 / 1.000.000 × 20 $ = 0,10 $ Ausgabe
Gesamt                       0,18 $
Enter fullscreen mode Exit fullscreen mode

Bei 1.000 Aufrufen pro Tag ergibt das:

Tarif Kosten pro Aufruf Kosten pro Tag
Einführung $0.09 $90
Standard $0.18 $180

Zum Vergleich kostet derselbe Aufruf:

  • Claude Opus 5.5: 0,18 $
  • GPT-6 Astra: 0,45 $ (0,20 $ + 0,25 $)
  • gemini-3.1-pro-preview: 0,10 $ (0,04 $ + 0,06 $)
  • gemini-3.8-flash zum Einführungspreis: etwa 0,034 $ (0,015 $ + 0,019 $)

2. Lange Agentenrunde: 200K Eingabe, 50K Ausgabe

Einführung

200.000 / 1.000.000 × 2 $  = 0,40 $ Eingabe
 50.000 / 1.000.000 × 10 $ = 0,50 $ Ausgabe
Gesamt                        0,90 $
Enter fullscreen mode Exit fullscreen mode

Standard

200.000 / 1.000.000 × 4 $  = 0,80 $ Eingabe
 50.000 / 1.000.000 × 20 $ = 1,00 $ Ausgabe
Gesamt                        1,80 $
Enter fullscreen mode Exit fullscreen mode

GPT-6 Astra würde für denselben Umfang 4,50 $ berechnen:

200K × 10 $ / 1M = 2,00 $
 50K × 50 $ / 1M = 2,50 $
Gesamt             4,50 $
Enter fullscreen mode Exit fullscreen mode

gemini-3.1-pro-preview liegt bei 1,00 $, erreicht bei 200K Tokens aber genau seine Tarifgrenze. Längere Prompts werden dort mit 4 $ Eingabe und 18 $ Ausgabe pro 1 Mio. Tokens berechnet. Falls Argon später eine ähnliche Stufe erhält, steigen die Kosten langer Agentenrunden.

3. Maximale Antwort: 1 Mio. Ausgabe-Tokens

Die Ausgabe allein kostet:

Tarif Berechnung Kosten
Einführung 1.000.000 / 1.000.000 × 10 $ $10.00
Standard 1.000.000 / 1.000.000 × 20 $ $20.00

Mit einem Prompt von 100K Tokens kommt Eingabe hinzu:

Tarif Ausgabe 100K Eingabe Gesamt
Einführung $10.00 $0.20 $10.20
Standard $20.00 $0.40 $20.40

Kein anderes Modell in der Vergleichstabelle erzeugt diese Menge in einer synchronen Antwort. Die Wettbewerber begrenzen auf 128K, das vorherige Gemini-Pro-Modell auf 65.536 Tokens.

Bei der von Vals AI gelisteten maximalen Ausgabe von 262K Tokens ergibt sich:

Tarif Kosten für 262K Ausgabe
Einführung $2.62
Standard $5.24

Für Streaming, Timeouts und Gateways siehe Gemini 4 Argons 1 Mio. Ausgabe-Tokens.

4. Einen 500K-Token-Prompt zehnmal zwischenspeichern

Angenommen, Sie senden eine 500K-Token-Codebasis oder einen Vertragssatz zehnmal und erhalten jeweils 5K Tokens Ausgabe. Der erste Aufruf bezahlt die vollständige Eingabe; die folgenden neun lesen aus dem Cache.

10 Aufrufe, 500K Prompt, je 5K Ausgabe Einführung Standard
Eingabe ohne Caching (10 × 500K) $10.00 $20.00
Eingabe mit Cache (1 voll + 9 gecacht) $1.00 + 9 × $0.05 = $1.45 $2.00 + 9 × $0.10 = $2.90
Ausgabe (10 × 5K) $0.50 $1.00
Gesamt mit Caching $1.95 $3.90
Gesamt ohne Caching $10.50 $21.00

Caching reduziert die Eingaberechnung in diesem Beispiel um 85,5 %.

Beachten Sie dabei zwei offene Punkte:

  1. Google hat nicht angegeben, ob Argon Cache-Speichergebühren verlangt. Bei gemini-3.1-pro-preview kosten 500K Tokens für eine Stunde Speicherzeit zusätzlich 2,25 $.
  2. Ein 500K-Token-Prompt liegt über der 200K-Grenze von Gemini 3.1 Pro. Für Argon ist noch nicht bekannt, ob lange Prompts einen eigenen Tarif erhalten.

Argons Standard-Cache-Rate von 0,20 $ entspricht Claude Opus 5.5. Die Break-even-Logik können Sie daher aus der Claude Opus 5.5 Prompt-Caching-Kostenberechnung übernehmen.

Nicht nur Tokenpreis, sondern Kosten pro Aufgabe messen

Der Preis pro Token ist keine vollständige Aussage über die Kosten einer Aufgabe.

Artificial Analysis listet 1,99 $ pro Aufgabe für seinen Intelligence Index auf Gemini 4 Argon mit hoher Einstellung zu Einführungspreisen. The Decoder nennt für denselben Lauf 3,98 $ zu Standardpreisen. Artificial Analysis bewertet Argon mit 53, genau wie GPT-6 Astra mit maximaler Einstellung, das dort mit 3,26 $ pro Aufgabe gelistet ist.

Der wesentliche Faktor ist das Token-Volumen:

Modell / Einstellung Ausgabe-Tokens pro Aufgabe Ausgabekosten
Argon, hoch, Einführung ca. 62K $0.62
GPT-6 Astra, maximal ca. 27K $1.35

Berechnung:

Argon: 62.000 / 1.000.000 × 10 $ = 0,62 $
Astra: 27.000 / 1.000.000 × 50 $ = 1,35 $
Enter fullscreen mode Exit fullscreen mode

Argon verwendet dabei ungefähr 2,3-mal so viele Ausgabe-Tokens wie Astra. Deshalb kann Argons vollständiger Aufgabenpreis zu Standardtarifen mit 3,98 $ über den 3,26 $ für Astra liegen, obwohl Argons Standardtarife pro Token 60 % unter Astra liegen.

Vals AI zeigt denselben Effekt im Vals Index:

Modell Kosten pro Test
Gemini 4 Argon $15.68
Claude Opus 5.5 $32.14
Claude Sonnet 5.5 $21.34
GPT-6.1 Sol $3.24

Vals AI listet Argon mit dem Standardtarif von 4 $ Eingabe und 20 $ Ausgabe. Claude Sonnet 5.5 und GPT-6.1 Sol teilen zwar Argons Einführungspreis auf dem Papier, ihre Kosten pro Test unterscheiden sich aber um mehr als das Sechsfache.

Praktische Regel: Budgetieren Sie mit den Token-Zählungen Ihrer eigenen Produktion, nicht mit einer allgemeinen Preisliste oder Benchmark-Kosten pro Aufgabe.

Kostenkontrollen vor dem Argon-Start einrichten

Richten Sie die folgenden Kontrollen jetzt mit einem verfügbaren Gemini-Modell ein.

1. Ausgabe begrenzen

Bei generateContent setzt generationConfig.maxOutputTokens die Obergrenze.

{
  "generationConfig": {
    "maxOutputTokens": 8192
  }
}
Enter fullscreen mode Exit fullscreen mode

Google sagt, dass neue Modelle über die Interactions API starten werden. Verwenden Sie dort die entsprechende Begrenzung, sobald die Argon-Dokumentation verfügbar ist.

Eine maximale Ausgabe von 1 Mio. Tokens bedeutet bereits ohne Eingabe:

10 $ pro Aufruf während der Einführung
20 $ pro Aufruf zum Standardtarif
Enter fullscreen mode Exit fullscreen mode

Setzen Sie deshalb ein Limit, das Ihrer tatsächlichen Antwortgröße entspricht.

2. Stabile Inhalte cachen

Cache-Kandidaten sind Inhalte, die sich über viele Aufrufe nicht ändern:

  • Systemanweisungen
  • Tool- und JSON-Schemas
  • API-Spezifikationen
  • Referenzdokumente
  • große Codebasen
  • Vertrags- oder Richtlinientexte

Der 95-%-Rabatt greift nur, wenn Sie diese stabilen Eingaben tatsächlich wiederverwenden.

3. Denk-Level gezielt testen

Google hat Argons Denk-Level noch nicht veröffentlicht. Bei aktuellen Modellen gilt:

  • gemini-3.1-pro-preview: standardmäßig high
  • gemini-3.8-flash: standardmäßig medium

Sobald Argons Einstellungen dokumentiert sind, testen Sie mindestens zwei Konfigurationen:

  1. Höchstes Denk-Level als Qualitätsbaseline
  2. Niedrigeres Denk-Level für Routineaufgaben

Messen Sie pro Variante Qualität, Latenz und Token-Verbrauch. Behalten Sie das günstigere Level nur, wenn es die Anforderungen Ihrer Aufgabe weiterhin erfüllt.

4. usageMetadata speichern und Kosten prüfen

Jede generateContent-Antwort enthält usageMetadata. Speichern Sie Ihre Anfrage in Apidog, legen Sie den Modellnamen als Umgebungsvariable GEMINI_MODEL ab und berechnen Sie die Kosten nach jeder Antwort.

Verwenden Sie diese Formel:

cost = uncached_input / 1,000,000 × input_rate
     + cached_input   / 1,000,000 × cached_rate
     + (output + thinking) / 1,000,000 × output_rate
Enter fullscreen mode Exit fullscreen mode

Beispiel für eine Nach-Antwort-Prüfung in JavaScript:

const usage = pm.response.json().usageMetadata || {};

const uncachedInput = usage.promptTokenCount || 0;
const cachedInput = usage.cachedContentTokenCount || 0;
const output = usage.candidatesTokenCount || 0;
const thinking = usage.thoughtsTokenCount || 0;

// Einführungspreise für Gemini 4 Argon
const inputRate = 2.00;
const cachedRate = 0.10;
const outputRate = 10.00;

const cost =
  (uncachedInput / 1_000_000) * inputRate +
  (cachedInput / 1_000_000) * cachedRate +
  ((output + thinking) / 1_000_000) * outputRate;

const maxCostPerRequest = 0.50;

pm.environment.set("LAST_REQUEST_COST_USD", cost.toFixed(6));

pm.test(`Anfrage bleibt unter ${maxCostPerRequest} $`, () => {
  pm.expect(cost).to.be.below(maxCostPerRequest);
});
Enter fullscreen mode Exit fullscreen mode

Führen Sie diese Prüfung heute mit gemini-3.8-flash aus. Sobald Google die Argon-Modell-ID veröffentlicht, ändern Sie nur GEMINI_MODEL und die Preisvariablen.

Was Google noch nicht bepreist oder dokumentiert hat

Für eine belastbare Produktionsplanung fehlen noch mehrere Angaben:

  • Dauer der Einführungsphase
  • Startdatum für 4 $ Eingabe und 20 $ Ausgabe
  • mögliche Preisstufe für Prompts über 200K Tokens
  • Batch- oder Flex-Preise
    • Gemini 3.1 Pro bietet beides mit 1 $/2 $ Eingabe und 6 $/9 $ Ausgabe
  • Gebühren für Cache-Speicherung
  • Ratenbegrenzungen
  • kostenloser Tarif
  • allgemein verfügbare Modell-ID

Planen Sie deshalb mit einem Preisbereich statt mit einem einzelnen festen Wert.

FAQ

Wie viel kostet Gemini 4 Argon pro Million Tokens?

Während der Einführung 2 $ für Eingabe und 10 $ für Ausgabe. Danach 4 $ und 20 $. Zwischengespeicherte Eingabe kostet 0,10 $ während der Einführung und 0,20 $ danach.

Wie lange dauert der Einführungspreis?

Google hat keine Dauer und kein Enddatum genannt.

Werden Denk-Tokens als Ausgabe berechnet?

Bei aktuellen Gemini-Modellen ja. Google hat die Regel für Argon noch nicht spezifisch dokumentiert.

Wie viel kostet eine Antwort mit 1 Mio. Ausgabe-Tokens?

10 $ zum Einführungspreis und 20 $ zum Standardpreis, jeweils vor Eingabekosten.

Ist Argon günstiger als Claude Opus 5.5 oder GPT-6 Astra?

Pro Token entspricht Standard-Argon Claude Opus 5.5 und liegt 60 % unter GPT-6 Astra. Pro Aufgabe hängt der Preis vom Token-Verbrauch ab. Artificial Analysis misst für Argon ungefähr das 2,3-Fache der Ausgabe-Tokens von Astra. Für ein günstigeres Gemini-Modell, das heute verfügbar ist, siehe Gemini 3.8 Flash-Preise.

Kann ich Argon heute bezahlen?

Nein. Das Modell wird zunächst nur an Partner des Fairwind-Programms ausgeliefert. Bezahlte API-Kunden und Google-AI-Ultra-Abonnenten sollen folgen, aber ohne veröffentlichtes Datum.

Jetzt budgetieren, später messen

Berechnen Sie Ihren aktuellen Traffic mit beiden Tarifen:

Einführungsbereich:
Eingabe-Tokens × 2 $ / 1 Mio.
Ausgabe-Tokens × 10 $ / 1 Mio.

Standardbereich:
Eingabe-Tokens × 4 $ / 1 Mio.
Ausgabe-Tokens × 20 $ / 1 Mio.
Enter fullscreen mode Exit fullscreen mode

Erstellen Sie danach die Messung:

  1. Apidog herunterladen.
  2. Eine Anfrage gegen gemini-3.8-flash speichern.
  3. GEMINI_MODEL als Umgebungsvariable verwenden.
  4. usageMetadata nach jeder Antwort auswerten.
  5. Eine Kostenobergrenze als Test-Assertion setzen.
  6. Nach Veröffentlichung der Argon-ID nur die Modellvariable und Preiswerte ändern.

So sehen Sie vom ersten Tag an Ihre tatsächlichen Kosten pro Aufruf statt nur theoretische Preise pro Million Tokens.

Top comments (0)