DEV Community

Cover image for Gemini 4 Argon API: Aktueller Stand, Kosten und Code vorbereiten
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 4 Argon API: Aktueller Stand, Kosten und Code vorbereiten

Es gibt noch keine öffentliche Gemini-4-Argon-API, und Google hat keine Modell-ID veröffentlicht. Google kündigte Argon am 30. September 2026 an; aktuell ist es nur für Verteidiger des Fairwind Programms verfügbar. Diese Fairwind-Partner verwenden Argon als verwaltetes Modell in Gemini Enterprise. Artificial Analysis führt Google AI Studio als einzigen API-Anbieter für Argon auf, jedoch ohne Geschwindigkeits- oder Latenzdaten. Das spricht eher für einen vorab genehmigten Pre-Release-Zugang als für einen öffentlich zugänglichen Endpunkt. Google sagt, dass der breitere Rollout mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten beginnt.

Apidog noch heute ausprobieren

Diese Zeit zwischen Ankündigung und öffentlichem Zugang können Sie nutzen: Bereiten Sie Ihre Integration mit Gemini 3.8 Flash vor, halten Sie die Modell-ID konfigurierbar und bauen Sie Tests, Mocks sowie Kostenlimits vorab. Wenn Argon verfügbar ist, soll der Wechsel nur eine Änderung von GEMINI_MODEL sein.

Für Hintergrund zum Modell siehe Was ist Gemini 4 Argon? und für die Rollout-Phasen den Artikel zum Gemini-4-Argon-Veröffentlichungsdatum.

Was über die Gemini-4-Argon-API bestätigt ist – und was nicht

Googles Einführungsbeitrag nennt Preise und ein Ausgabelimit. Viele Integrationsdetails sind noch nicht veröffentlicht.

Posten Status Details
Eingabepreis Bestätigt 2 $ pro 1 Million Tokens während der Einführung, danach 4 $
Ausgabepreis Bestätigt 10 $ pro 1 Million Tokens während der Einführung, danach 20 $
Gecachter Input Bestätigt 95 % Rabatt auf Input: 0,10 $ während der Einführung, danach 0,20 $
Ausgabelimit Bestätigt Bis zu 1 Million Tokens, erhöht von 64K
API-Oberfläche Signalisiert Neue Modelle starten laut Google auf der Interactions API
Modell-ID Nicht veröffentlicht Fehlt auf Modell-, Preis- und Changelog-Seiten
Eingabe-Kontextfenster Nicht veröffentlicht Evaluierungen nutzten Prompts bis 1 Million Tokens, das ist keine Spezifikation
Denk-Level Nicht veröffentlicht Evaluierungen liefen mit den „höchsten Denkeinstellungen“; Namen und Standard unbekannt
Ratenbegrenzungen Nicht veröffentlicht Keine Stufen angekündigt
Batch-Unterstützung Nicht veröffentlicht Keine Batch- oder Flex-Preise genannt
Lang-Prompt-Stufe Nicht veröffentlicht Für Argon ist keine Preisregel für lange Prompts veröffentlicht
Dauer der Einführungsphase Nicht veröffentlicht Kein Enddatum für die Preise von 2 $/10 $

Die Erwartung für die API-Oberfläche basiert auf den Interactions-API-Dokumenten: Neue Modelle werden dort eingeführt. Google hat jedoch nicht bestätigt, ob Argon zusätzlich über generateContent verfügbar sein wird.

Auch beim Ausgabelimit sollten Sie konservativ planen: Google nennt 1 Million Tokens für das Modell, während Vals AI für eine getestete Konfiguration maximal 262K Ausgabe-Tokens aufführt. Prüfen Sie daher beim Go-Live den tatsächlichen outputTokenLimit des verfügbaren Endpunkts. Der Leitfaden zu 1 Million Ausgabe-Tokens behandelt Auswirkungen auf Streaming, Timeouts und Speicherung.

Gemini 4 Argon API Übersicht

Eine Anfrage mit 20.000 Input-Tokens und 5.000 Ausgabe-Tokens kostet zu Einführungspreisen:

20.000 × 2 $ / 1M  = 0,04 $
 5.000 × 10 $ / 1M = 0,05 $
----------------------------
Gesamt             = 0,09 $
Enter fullscreen mode Exit fullscreen mode

Zu Standardpreisen von 4 $/20 $ wären es 0,18 $. Die vollständigen Szenarien, einschließlich gecachter Eingaben und sehr großer Antworten, finden Sie in der Preisübersicht für Gemini 4 Argon.

Keine Modell-ID aus Drittquellen fest codieren

Auf Benchmark-Seiten, Aggregatoren oder in Open-Source-Pull-Requests finden Sie möglicherweise vermeintliche Argon-Modell-IDs. Behandeln Sie diese Werte als Platzhalter.

Eine geratene ID kann beim Deployment zu einem 404 führen. Noch problematischer ist ein stiller Fallback, wenn ein Wrapper Fehler zu breit abfängt. Legen Sie den Modellnamen deshalb ausschließlich in der Konfiguration ab:

export GEMINI_MODEL="gemini-3.8-flash"
Enter fullscreen mode Exit fullscreen mode

Wenn Google die offizielle Argon-ID veröffentlicht, ändern Sie nur diese Variable:

export GEMINI_MODEL="<offizielle-argon-modell-id>"
Enter fullscreen mode Exit fullscreen mode

Integration heute mit Gemini 3.8 Flash vorbereiten

Gemini 3.8 Flash (gemini-3.8-flash) verwendet die Endpunkte, Header und Antwortstrukturen, die Argon voraussichtlich ebenfalls verwenden wird. Laut den genannten Angaben kostet es bis zum 31. Dezember 2026 0,75 $ Input und 3,75 $ Output pro 1 Million Tokens.

Speichern Sie den Schlüssel ausschließlich in einer Umgebungsvariable:

export GEMINI_API_KEY="..."
export GEMINI_MODEL="gemini-3.8-flash"
export GEMINI_THINKING="medium"
Enter fullscreen mode Exit fullscreen mode

Die komplette Einrichtung beschreibt der Gemini-3.8-Flash-API-Leitfaden.

Schritt 1: Anfrage über die Interactions API senden

Die Interactions API ist Googles primäre API. Halten Sie Modell und Denk-Level konfigurierbar, weil Argons unterstützte Denk-Level noch nicht bekannt sind.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {
      \"thinking_level\": \"${THINKING}\"
    }
  }"
Enter fullscreen mode Exit fullscreen mode

Mit dem Python SDK benötigen Sie google-genai 2.3.0 oder neuer:

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # liest GEMINI_API_KEY aus der Umgebung

interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Für Gemini 3.8 Flash sind low, medium und high gültig. medium ist der Standard; minimal führt zu HTTP 400. Details zu Qualität, Latenz und Kosten finden Sie im Leitfaden zu Denk-Leveln.

Für mehrstufige Abläufe übergeben Sie die ID der vorherigen Antwort als previous_interaction_id. Wenn Sie die serverseitige Speicherung deaktivieren möchten, senden Sie store: false.

Schritt 2: Den generateContent-Pfad als Fallback beibehalten

Bestehende Anwendungen verwenden häufig noch generateContent. Laut Google wird dieser Endpunkt weiterhin unterstützt. Halten Sie den Pfad funktionsfähig, aber bevorzugen Sie für neue Modelle die Interactions API.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s \
  "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{
      \"parts\": [{
        \"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
      }]
    }],
    \"generationConfig\": {
      \"thinkingConfig\": {
        \"thinkingLevel\": \"${THINKING}\"
      }
    }
  }"
Enter fullscreen mode Exit fullscreen mode

Achten Sie auf die unterschiedlichen JSON-Pfade:

API Denk-Level
Interactions API generation_config.thinking_level
generateContent generationConfig.thinkingConfig.thinkingLevel

Wenn Ihr Client beide APIs kapselt, routen Sie neue Modelle standardmäßig über Interactions. Für Tool-Aufrufe gelten ebenfalls API-spezifische Payloads; siehe Gemini 3.8 Flash Funktionsaufrufe.

Schritt 3: Go-Live-Check mit models.list automatisieren

Aktualisieren Sie Ihre Konfiguration nicht anhand von Spekulationen oder Changelogs allein. Fragen Sie die Models-API regelmäßig ab. Sie liefert verfügbare Modelle, Token-Limits und unterstützte Methoden.

import os
import sys
import requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)
resp.raise_for_status()

hits = [
    model
    for model in resp.json().get("models", [])
    if "argon" in model["name"].lower()
]

for model in hits:
    print(
        model["name"],
        "in:", model.get("inputTokenLimit"),
        "out:", model.get("outputTokenLimit"),
        "methods:", model.get("supportedGenerationMethods"),
    )

sys.exit(1 if hits else 0)  # Fehlerstatus kann einen Alert auslösen
Enter fullscreen mode Exit fullscreen mode

Führen Sie den Check stündlich per Cron oder CI-Zeitplan aus – mit einem Schlüssel aus demselben Projekt wie Ihre Produktionsanwendung.

Sobald ein Treffer erscheint, erhalten Sie direkt:

  1. die offizielle Modell-ID,
  2. das tatsächliche outputTokenLimit,
  3. die unterstützten Generierungsmethoden.

Schritt 4: Antwort mocken, bevor Argon verfügbar ist

Sie brauchen Argon nicht, um Ihren Client fertigzustellen. Speichern Sie die Anfrage aus Schritt 2 in Apidog und verwenden Sie GEMINI_API_KEY sowie GEMINI_MODEL als Umgebungsvariablen.

Praktischer Ablauf:

  1. Senden Sie die Anfrage einmal an Gemini 3.8 Flash.
  2. Speichern Sie die echte Antwort als Response Example.
  3. Setzen Sie in den Projekt-Einstellungen unter Mock-Einstellungen die Methode auf Response example first.
  4. Verwenden Sie die Mock-URL für Frontend, Queue-Worker und Parser.

Der Mock repräsentiert das aktuelle Gemini-Antwortschema, nicht ein bestätigtes Argon-spezifisches Schema. Da Argon auf derselben API erwartet wird, ist das eine sinnvolle Arbeitsannahme.

Um große Antworten zu testen, erhöhen Sie in Ihrem gespeicherten Beispiel die Werte in usageMetadata. Prüfen Sie dann, ob Abrechnung, Monitoring und Warnungen korrekt reagieren.

Schritt 5: usageMetadata prüfen und Kostenobergrenze setzen

Jede generateContent-Antwort enthält usageMetadata. Fügen Sie in Apidog einen Post-Processor hinzu, der Antworten zu den Argon-Standardtarifen bewertet und Tests oberhalb Ihres Budgets fehlschlagen lässt.

// Apidog Post-Processor:
// Berechnet Kosten mit den Standardtarifen von Gemini 4 Argon.

const u = pm.response.json().usageMetadata;

const IN = 4 / 1e6;    // USD pro Input-Token nach der Einführungsphase
const OUT = 20 / 1e6;  // USD pro Output-Token

// Bei aktuellen Gemini-Modellen werden Denk-Tokens als Output abgerechnet.
const out =
  (u.candidatesTokenCount || 0) +
  (u.thoughtsTokenCount || 0);

const cost = u.promptTokenCount * IN + out * OUT;

pm.test("usageMetadata ist vorhanden", () => {
  pm.expect(u).to.be.an("object");
});

pm.test("Kosten liegen unter 0,10 $ zu Argon-Tarifen", () => {
  pm.expect(cost).to.be.below(0.10);
});
Enter fullscreen mode Exit fullscreen mode

Wählen Sie die Obergrenze pro Anfrage. Für einen kurzen Prompt wie im Beispiel können 0,10 $ passend sein. Google hat noch nicht angegeben, wie Argon Denk-Tokens abrechnet; das Skript verwendet deshalb die aktuelle Gemini-Regel als Annahme.

Führen Sie dieselbe gespeicherte Anfrage zunächst gegen Gemini 3.8 Flash und später gegen Argon aus. Unterschiede bei Token-Anzahlen und berechneten Kosten liefern Ihnen einen direkten Regressionsvergleich.

Häufig gestellte Fragen

Ist die Gemini-4-Argon-API verfügbar?

Nicht öffentlich. Argon wird derzeit nur an Fairwind-Programmpartner über Gemini Enterprise ausgerollt. Zahlende API-Kunden und Google-AI-Ultra-Abonnenten sollen folgen, ein Datum wurde nicht genannt.

Was ist die Gemini-4-Argon-Modell-ID?

Google hat keine Modell-ID veröffentlicht. Werte von Drittanbieter-Websites sind Platzhalter. Halten Sie das Modell in einer Umgebungsvariable und überwachen Sie models.list.

Wie viel wird die Gemini-4-Argon-API kosten?

Während einer nicht näher bestimmten Einführungsphase kostet Input 2 $ und Output 10 $ pro 1 Million Tokens. Danach gelten 4 $ für Input und 20 $ für Output. Gecachter Input ist 95 % günstiger. Weitere Beispiele finden Sie unter Gemini 4 Argon Preise.

Wird Argon mit generateContent funktionieren?

Google hat das nicht bestätigt. Die Dokumentation sagt, dass neue Modelle auf der Interactions API starten. Bauen Sie daher auf Interactions auf und behandeln Sie generateContent als Fallback.

Gibt Google AI Ultra API-Zugang?

Nein. AI Ultra ist ein Verbraucherabonnement und kein API-Schlüssel. Google sagt, dass API-Zugang mit zahlenden API-Kunden beginnt.

Nächster Schritt

Setzen Sie GEMINI_MODEL in jeder Umgebung, automatisieren Sie den models.list-Check und speichern Sie Interactions- sowie generateContent-Anfragen inklusive Kostenprüfung.

Laden Sie Apidog herunter, um Anfragen, Mocks und Tests in einem Arbeitsbereich zu verwalten. Sobald Google die offizielle Argon-ID veröffentlicht, ändern Sie eine Variable statt Ihrer Integration.

Top comments (0)