Es gibt noch keine öffentliche Gemini-4-Argon-API, und Google hat keine Modell-ID veröffentlicht. Google kündigte Argon am 30. September 2026 an; aktuell ist es nur für Verteidiger des Fairwind Programms verfügbar. Diese Fairwind-Partner verwenden Argon als verwaltetes Modell in Gemini Enterprise. Artificial Analysis führt Google AI Studio als einzigen API-Anbieter für Argon auf, jedoch ohne Geschwindigkeits- oder Latenzdaten. Das spricht eher für einen vorab genehmigten Pre-Release-Zugang als für einen öffentlich zugänglichen Endpunkt. Google sagt, dass der breitere Rollout mit zahlenden API-Kunden und Google-AI-Ultra-Abonnenten beginnt.
Apidog noch heute ausprobieren
Diese Zeit zwischen Ankündigung und öffentlichem Zugang können Sie nutzen: Bereiten Sie Ihre Integration mit Gemini 3.8 Flash vor, halten Sie die Modell-ID konfigurierbar und bauen Sie Tests, Mocks sowie Kostenlimits vorab. Wenn Argon verfügbar ist, soll der Wechsel nur eine Änderung von GEMINI_MODEL sein.
Für Hintergrund zum Modell siehe Was ist Gemini 4 Argon? und für die Rollout-Phasen den Artikel zum Gemini-4-Argon-Veröffentlichungsdatum.
Was über die Gemini-4-Argon-API bestätigt ist – und was nicht
Googles Einführungsbeitrag nennt Preise und ein Ausgabelimit. Viele Integrationsdetails sind noch nicht veröffentlicht.
| Posten | Status | Details |
|---|---|---|
| Eingabepreis | Bestätigt | 2 $ pro 1 Million Tokens während der Einführung, danach 4 $ |
| Ausgabepreis | Bestätigt | 10 $ pro 1 Million Tokens während der Einführung, danach 20 $ |
| Gecachter Input | Bestätigt | 95 % Rabatt auf Input: 0,10 $ während der Einführung, danach 0,20 $ |
| Ausgabelimit | Bestätigt | Bis zu 1 Million Tokens, erhöht von 64K |
| API-Oberfläche | Signalisiert | Neue Modelle starten laut Google auf der Interactions API |
| Modell-ID | Nicht veröffentlicht | Fehlt auf Modell-, Preis- und Changelog-Seiten |
| Eingabe-Kontextfenster | Nicht veröffentlicht | Evaluierungen nutzten Prompts bis 1 Million Tokens, das ist keine Spezifikation |
| Denk-Level | Nicht veröffentlicht | Evaluierungen liefen mit den „höchsten Denkeinstellungen“; Namen und Standard unbekannt |
| Ratenbegrenzungen | Nicht veröffentlicht | Keine Stufen angekündigt |
| Batch-Unterstützung | Nicht veröffentlicht | Keine Batch- oder Flex-Preise genannt |
| Lang-Prompt-Stufe | Nicht veröffentlicht | Für Argon ist keine Preisregel für lange Prompts veröffentlicht |
| Dauer der Einführungsphase | Nicht veröffentlicht | Kein Enddatum für die Preise von 2 $/10 $ |
Die Erwartung für die API-Oberfläche basiert auf den Interactions-API-Dokumenten: Neue Modelle werden dort eingeführt. Google hat jedoch nicht bestätigt, ob Argon zusätzlich über generateContent verfügbar sein wird.
Auch beim Ausgabelimit sollten Sie konservativ planen: Google nennt 1 Million Tokens für das Modell, während Vals AI für eine getestete Konfiguration maximal 262K Ausgabe-Tokens aufführt. Prüfen Sie daher beim Go-Live den tatsächlichen outputTokenLimit des verfügbaren Endpunkts. Der Leitfaden zu 1 Million Ausgabe-Tokens behandelt Auswirkungen auf Streaming, Timeouts und Speicherung.
Eine Anfrage mit 20.000 Input-Tokens und 5.000 Ausgabe-Tokens kostet zu Einführungspreisen:
20.000 × 2 $ / 1M = 0,04 $
5.000 × 10 $ / 1M = 0,05 $
----------------------------
Gesamt = 0,09 $
Zu Standardpreisen von 4 $/20 $ wären es 0,18 $. Die vollständigen Szenarien, einschließlich gecachter Eingaben und sehr großer Antworten, finden Sie in der Preisübersicht für Gemini 4 Argon.
Keine Modell-ID aus Drittquellen fest codieren
Auf Benchmark-Seiten, Aggregatoren oder in Open-Source-Pull-Requests finden Sie möglicherweise vermeintliche Argon-Modell-IDs. Behandeln Sie diese Werte als Platzhalter.
Eine geratene ID kann beim Deployment zu einem 404 führen. Noch problematischer ist ein stiller Fallback, wenn ein Wrapper Fehler zu breit abfängt. Legen Sie den Modellnamen deshalb ausschließlich in der Konfiguration ab:
export GEMINI_MODEL="gemini-3.8-flash"
Wenn Google die offizielle Argon-ID veröffentlicht, ändern Sie nur diese Variable:
export GEMINI_MODEL="<offizielle-argon-modell-id>"
Integration heute mit Gemini 3.8 Flash vorbereiten
Gemini 3.8 Flash (gemini-3.8-flash) verwendet die Endpunkte, Header und Antwortstrukturen, die Argon voraussichtlich ebenfalls verwenden wird. Laut den genannten Angaben kostet es bis zum 31. Dezember 2026 0,75 $ Input und 3,75 $ Output pro 1 Million Tokens.
Speichern Sie den Schlüssel ausschließlich in einer Umgebungsvariable:
export GEMINI_API_KEY="..."
export GEMINI_MODEL="gemini-3.8-flash"
export GEMINI_THINKING="medium"
Die komplette Einrichtung beschreibt der Gemini-3.8-Flash-API-Leitfaden.
Schritt 1: Anfrage über die Interactions API senden
Die Interactions API ist Googles primäre API. Halten Sie Modell und Denk-Level konfigurierbar, weil Argons unterstützte Denk-Level noch nicht bekannt sind.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"
curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"${MODEL}\",
\"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
\"generation_config\": {
\"thinking_level\": \"${THINKING}\"
}
}"
Mit dem Python SDK benötigen Sie google-genai 2.3.0 oder neuer:
# pip install "google-genai>=2.3.0"
import os
from google import genai
MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")
client = genai.Client() # liest GEMINI_API_KEY aus der Umgebung
interaction = client.interactions.create(
model=MODEL,
input="List the retry rules a REST client should follow for HTTP 429.",
generation_config={"thinking_level": THINKING},
)
print(interaction.output_text)
Für Gemini 3.8 Flash sind low, medium und high gültig. medium ist der Standard; minimal führt zu HTTP 400. Details zu Qualität, Latenz und Kosten finden Sie im Leitfaden zu Denk-Leveln.
Für mehrstufige Abläufe übergeben Sie die ID der vorherigen Antwort als previous_interaction_id. Wenn Sie die serverseitige Speicherung deaktivieren möchten, senden Sie store: false.
Schritt 2: Den generateContent-Pfad als Fallback beibehalten
Bestehende Anwendungen verwenden häufig noch generateContent. Laut Google wird dieser Endpunkt weiterhin unterstützt. Halten Sie den Pfad funktionsfähig, aber bevorzugen Sie für neue Modelle die Interactions API.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"
curl -s \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"contents\": [{
\"parts\": [{
\"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
}]
}],
\"generationConfig\": {
\"thinkingConfig\": {
\"thinkingLevel\": \"${THINKING}\"
}
}
}"
Achten Sie auf die unterschiedlichen JSON-Pfade:
| API | Denk-Level |
|---|---|
| Interactions API | generation_config.thinking_level |
generateContent |
generationConfig.thinkingConfig.thinkingLevel |
Wenn Ihr Client beide APIs kapselt, routen Sie neue Modelle standardmäßig über Interactions. Für Tool-Aufrufe gelten ebenfalls API-spezifische Payloads; siehe Gemini 3.8 Flash Funktionsaufrufe.
Schritt 3: Go-Live-Check mit models.list automatisieren
Aktualisieren Sie Ihre Konfiguration nicht anhand von Spekulationen oder Changelogs allein. Fragen Sie die Models-API regelmäßig ab. Sie liefert verfügbare Modelle, Token-Limits und unterstützte Methoden.
import os
import sys
import requests
resp = requests.get(
"https://generativelanguage.googleapis.com/v1beta/models",
params={"pageSize": 1000},
headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
timeout=30,
)
resp.raise_for_status()
hits = [
model
for model in resp.json().get("models", [])
if "argon" in model["name"].lower()
]
for model in hits:
print(
model["name"],
"in:", model.get("inputTokenLimit"),
"out:", model.get("outputTokenLimit"),
"methods:", model.get("supportedGenerationMethods"),
)
sys.exit(1 if hits else 0) # Fehlerstatus kann einen Alert auslösen
Führen Sie den Check stündlich per Cron oder CI-Zeitplan aus – mit einem Schlüssel aus demselben Projekt wie Ihre Produktionsanwendung.
Sobald ein Treffer erscheint, erhalten Sie direkt:
- die offizielle Modell-ID,
- das tatsächliche
outputTokenLimit, - die unterstützten Generierungsmethoden.
Schritt 4: Antwort mocken, bevor Argon verfügbar ist
Sie brauchen Argon nicht, um Ihren Client fertigzustellen. Speichern Sie die Anfrage aus Schritt 2 in Apidog und verwenden Sie GEMINI_API_KEY sowie GEMINI_MODEL als Umgebungsvariablen.
Praktischer Ablauf:
- Senden Sie die Anfrage einmal an Gemini 3.8 Flash.
- Speichern Sie die echte Antwort als Response Example.
- Setzen Sie in den Projekt-Einstellungen unter Mock-Einstellungen die Methode auf Response example first.
- Verwenden Sie die Mock-URL für Frontend, Queue-Worker und Parser.
Der Mock repräsentiert das aktuelle Gemini-Antwortschema, nicht ein bestätigtes Argon-spezifisches Schema. Da Argon auf derselben API erwartet wird, ist das eine sinnvolle Arbeitsannahme.
Um große Antworten zu testen, erhöhen Sie in Ihrem gespeicherten Beispiel die Werte in usageMetadata. Prüfen Sie dann, ob Abrechnung, Monitoring und Warnungen korrekt reagieren.
Schritt 5: usageMetadata prüfen und Kostenobergrenze setzen
Jede generateContent-Antwort enthält usageMetadata. Fügen Sie in Apidog einen Post-Processor hinzu, der Antworten zu den Argon-Standardtarifen bewertet und Tests oberhalb Ihres Budgets fehlschlagen lässt.
// Apidog Post-Processor:
// Berechnet Kosten mit den Standardtarifen von Gemini 4 Argon.
const u = pm.response.json().usageMetadata;
const IN = 4 / 1e6; // USD pro Input-Token nach der Einführungsphase
const OUT = 20 / 1e6; // USD pro Output-Token
// Bei aktuellen Gemini-Modellen werden Denk-Tokens als Output abgerechnet.
const out =
(u.candidatesTokenCount || 0) +
(u.thoughtsTokenCount || 0);
const cost = u.promptTokenCount * IN + out * OUT;
pm.test("usageMetadata ist vorhanden", () => {
pm.expect(u).to.be.an("object");
});
pm.test("Kosten liegen unter 0,10 $ zu Argon-Tarifen", () => {
pm.expect(cost).to.be.below(0.10);
});
Wählen Sie die Obergrenze pro Anfrage. Für einen kurzen Prompt wie im Beispiel können 0,10 $ passend sein. Google hat noch nicht angegeben, wie Argon Denk-Tokens abrechnet; das Skript verwendet deshalb die aktuelle Gemini-Regel als Annahme.
Führen Sie dieselbe gespeicherte Anfrage zunächst gegen Gemini 3.8 Flash und später gegen Argon aus. Unterschiede bei Token-Anzahlen und berechneten Kosten liefern Ihnen einen direkten Regressionsvergleich.
Häufig gestellte Fragen
Ist die Gemini-4-Argon-API verfügbar?
Nicht öffentlich. Argon wird derzeit nur an Fairwind-Programmpartner über Gemini Enterprise ausgerollt. Zahlende API-Kunden und Google-AI-Ultra-Abonnenten sollen folgen, ein Datum wurde nicht genannt.
Was ist die Gemini-4-Argon-Modell-ID?
Google hat keine Modell-ID veröffentlicht. Werte von Drittanbieter-Websites sind Platzhalter. Halten Sie das Modell in einer Umgebungsvariable und überwachen Sie models.list.
Wie viel wird die Gemini-4-Argon-API kosten?
Während einer nicht näher bestimmten Einführungsphase kostet Input 2 $ und Output 10 $ pro 1 Million Tokens. Danach gelten 4 $ für Input und 20 $ für Output. Gecachter Input ist 95 % günstiger. Weitere Beispiele finden Sie unter Gemini 4 Argon Preise.
Wird Argon mit generateContent funktionieren?
Google hat das nicht bestätigt. Die Dokumentation sagt, dass neue Modelle auf der Interactions API starten. Bauen Sie daher auf Interactions auf und behandeln Sie generateContent als Fallback.
Gibt Google AI Ultra API-Zugang?
Nein. AI Ultra ist ein Verbraucherabonnement und kein API-Schlüssel. Google sagt, dass API-Zugang mit zahlenden API-Kunden beginnt.
Nächster Schritt
Setzen Sie GEMINI_MODEL in jeder Umgebung, automatisieren Sie den models.list-Check und speichern Sie Interactions- sowie generateContent-Anfragen inklusive Kostenprüfung.
Laden Sie Apidog herunter, um Anfragen, Mocks und Tests in einem Arbeitsbereich zu verwalten. Sobald Google die offizielle Argon-ID veröffentlicht, ändern Sie eine Variable statt Ihrer Integration.

Top comments (0)