Gemini 4 Argon führt Googles Benchmark-Tabelle in 13 von 19 Zeilen gegen GPT-6 Astra, Claude Opus 5.5 und Claude Fable 5.1 an. Für die Implementierung zählt jedoch vor allem die Verfügbarkeit: Astra und Opus 5.5 können Sie heute kaufen, Argon nicht. Googles neues Vorreiter-Modell ist derzeit nur für geprüfte Verteidiger im Fairwind-Programm verfügbar. Der Einführungspreis beträgt $2/$10 pro Million Token, anschließend $4/$20 – identisch mit Opus 5.5.
Dieser Vergleich ordnet die vier Modelle nach Preis, Limits und Benchmark-Ergebnissen ein. Außerdem erhalten Sie einen praktischen Routing-Leitfaden und eine Anleitung, mit der Sie Astra, Opus 5.5 und ein Gemini-Modell mit denselben Prompts in Apidog testen. Neu bei Argon? Beginnen Sie mit Was ist Gemini 4 Argon. Den Zeitplan behandelt der Leitfaden zum Argon-Veröffentlichungsdatum.
Preis und Limits im Vergleich
Googles Tabelle enthält auch Claude Fable 5.1. Die folgenden Preise gelten jeweils pro 1 Million Token und stammen aus Googles Launch-Beitrag, der Modellseite für GPT-6 Astra von OpenAI sowie Anthropics Preisseite.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Können Sie es heute aufrufen? | Nein, nur Fairwind | Ja | Ja | Ja |
| API-Modell-ID | Nicht veröffentlicht | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Eingabe | $2 Einführung, dann $4 | $10 | $4 | $10 |
| Gecachte Eingabe | $0.10 Einführung, dann $0.20 | $1 | $0.20 | $0.25 |
| Ausgabe | $10 Einführung, dann $20 | $50 | $20 | $50 |
| Max. Ausgabe | 1 Mio. (Googles angegebene Grenze) | 128K | 128K (300K im Batch, Beta) | 128K |
| Kontextfenster | Nicht veröffentlicht | 1.050.000 (922K max. Eingabe) | 1 Mio. | 1 Mio. |
| Aufschlag für lange Prompts | Nicht angegeben | Über 272K Eingabe: 2x Eingabe und Cache, 1,5x Ausgabe, auf die gesamte Anfrage | Keine | Keine |
Drei Punkte sind für die Modellwahl relevant:
- Argon kostet nach der Einführung genauso viel wie Opus 5.5. Der Preisvorteil gegenüber Anthropic gilt nur während der nicht datierten Einführungsphase.
- Astra und Fable 5.1 sind deutlich teurer. Ihre Standardpreise liegen bei Eingabe und Ausgabe beim 2,5-Fachen von Argons Standardtarif und beim 5-Fachen des Einführungstarifs.
- Das angegebene Ausgabelimit von Argon sollten Sie validieren. Google nennt 1 Mio. Token, während Vals AI für die getestete Argon-Konfiguration maximal 262K auflistet.
Eine Kostenberechnung pro Anfrage finden Sie im Beitrag Gemini 4 Argon Preisgestaltung.
Wo jedes Modell in Googles Tabelle führt
Wichtig: Dies ist Googles Tabelle. Argons Werte wurden von Google gemeldet, teils selbst berechnet und teils aus Bestenlisten übernommen. Die Werte der Konkurrenz stammen überwiegend von den Anbietern selbst oder aus öffentlichen Bestenlisten, häufig mit maximalen Begründungseinstellungen. Behandeln Sie kleine Unterschiede deshalb als Rauschen, nicht als eindeutigen Sieger.
| Wer führt | Benchmark | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: Wissensarbeit | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| Argon: Wissensarbeit | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| Argon: Wissensarbeit | Harvey’s Legal Agent Benchmark | 19.6% | 5.4% | 6.7% | 3.8% |
| Argon: Codierung | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| Argon: Langer Kontext | GraphWalks 256K bis 1 Mio. (F1) | 84.2% | 71.8% | 65.0% | 66.8% |
| Argon: Multimodal | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| Argon: Multimodal | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| Astra | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| Astra | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| Astra | OSWorld-2.0 (offline, teilweise) | 69.2% | 72.6% | nicht gemeldet | nicht gemeldet |
| Opus 5.5 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| Opus 5.5 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| Gleichstand | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
Weitere klare Argon-Siege nennt Google bei Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks bis 128K und Agent’s Last Exam. Fable 5.1 führt keine Zeile an.
Bei CWE-bench v1 zeigt DeepMinds Cyber-Bestenliste einen dreifachen Gleichstand bei 68% zwischen Argon, Astra und Grok 4.7. Opus 5.5 liegt dort bei 67%.
Im direkten Vergleich mit Fable 5.1 erzielt Argon in 15 von 17 Zeilen mit gemeldeten Werten bessere Ergebnisse. Fable liegt nur bei FrontierSWE v2 (56.3% vs. 55.0%) und Terminal-bench 4.0 (57.9% vs. 57.4%) vorn. Anthropics Werte finden Sie in Claude Fable 5.1 Benchmarks, die vollständige Tabelle in Gemini 4 Argon Benchmarks.
Drei Vorbehalte, bevor Sie den Unterschieden vertrauen
Konkurrentenzahlen sind keine Google-Messungen. Googles Methodik erklärt, dass Ergebnisse für Nicht-Gemini-Modelle „aus den selbst gemeldeten Zahlen der Anbieter stammen, sofern nicht anders angegeben“. Mehrere Zeilen stammen zudem aus öffentlichen Bestenlisten von Vals AI, Proximal und Surge.
Testumgebungen unterscheiden sich. Bei DeepSWE v1.1 berechnete Google Argons 77.9% mit einer Mini-SWE-Agent-Testumgebung. Astras Wert stammt dagegen von einer öffentlichen Bestenliste, die Anthropic-Werte aus Systemkarten. Bei LVBench erhielt Gemini Videos mit 1 Frame pro Sekunde, Astra 800 Frames, Opus 5.5 600 und Fable 5.1 300 – laut Google aufgrund von API-Einschränkungen.
Dasselbe Modell kann je nach Setup andere Werte erreichen. Die Terminal-Bench-4.0-Zahl von Opus 5.5 hängt von Testumgebung und Aufwandseinstellung ab. Anthropic berichtet 66.4% bei xhigh effort. Mischen Sie deshalb keine Werte aus unterschiedlichen Quellen in einer eigenen Vergleichstabelle.
Was Drittanbieter-Evaluatoren sagen
Unabhängige Bestenlisten verringern den Abstand zwischen den Modellen.
Artificial Analysis listet Argon auf Platz 8 von 223. Da dort jede Begründungseinstellung separat gezählt wird, ist der Vergleich nach Einzelmodellen aussagekräftiger:
- Argon: 53
- GPT-6 Astra: 53
- Claude Fable 5.1: 53
- Claude Sonnet 5.5: 56
- Claude Opus 5.5: 58 bei maximaler Einstellung
Artificial Analysis listet außerdem eine Halluzinationsrate von 15% für Argon auf AA-Omniscience, gegenüber 51% für Astra bei maximaler Einstellung.
Auf Arena liegt Argon im Text-Ranking mit 1525 Punkten auf Platz 1. Die Bewertung ist mit 4.942 Stimmen als vorläufig markiert; Opus 5.5 liegt auf Platz 4. Vals AI führt Argon als erstes von 41 Modellen im Vals Index und als erstes Gemini-Modell an der Spitze dieser Liste.
Auch innerhalb von Google gibt es Skepsis. Bloomberg berichtete, dass einige Mitarbeitende mit Zugang Argon bei bestimmten Coding- und Frontend-Designaufgaben schwächer als erwartet bewerten. Google bezeichnete diese Charakterisierung als unzutreffend.
Welches Modell Sie verwenden sollten
Es gibt 2026 kein einzelnes bestes Vorreiter-Modell. Routen Sie Anfragen nach Arbeitslast und halten Sie Ihr Gemini-Modell konfigurierbar, bis Argon allgemein verfügbar ist.
| Aufgabe | Heute verwenden | Wenn Argon verfügbar ist |
|---|---|---|
| Agenten für Recht, Finanzen und Büroautomation | Opus 5.5 (67.0% Vals Index) | Argon testen: Es führt alle vier Wissensarbeits-Zeilen an |
| Terminal-intensive Codierungsagenten | Opus 5.5 (66.4% Terminal-bench 4.0) | Opus 5.5 führt weiterhin |
| Agentische Softwareentwicklung | Astra (65.5% FrontierSWE v2) oder Opus 5.5 | Argon führt bei DeepSWE, liegt aber bei FrontierSWE zurück; beide testen |
| Computerbenutzungs- und GUI-Agenten | Astra (72.6% OSWorld-2.0) | Astra führt bei OSWorld; Argon führt bei Agent’s Last Exam |
| Schlussfolgerung über 256K+ Token-Prompts | Opus 5.5 (kein Aufschlag) oder Astra (Aufschlag über 272K) | Argon (84.2% GraphWalks 256K bis 1 Mio.) |
| Video- und Diagrammverständnis | Astra (87.5% LVBench) | Argon (91.7%), mit dem Vorbehalt der Bildanzahl |
| Wissenschaft und ML-Engineering | Astra (Terminal-Bench Science), Opus 5.5 (PostTrainBench) | Argon führt bei LABBench 2 und RiemannBench; testen Sie es |
| Einzelantworten über 128K Token | Opus 5.5 im Batch (300K, Beta) | Argon, bis zu Googles angegebenen 1 Mio. |
| Umfangreiche, kostensensible Arbeit | Opus 5.5 ($4/$20) | Argon für $2/$10, solange die Einführung läuft |
Wenn Kosten wichtiger als Spitzenwerte sind, vergleicht GPT-6 Sol vs Claude Opus 5.5 die günstigere Sol-Linie von OpenAI mit Opus.
Vergleichen Sie alle drei mit Ihren eigenen Prompts
Anbietertabellen sagen nicht voraus, wie ein Modell mit Ihren Daten, Ihren Tool-Aufrufen und Ihren Antwortformaten arbeitet. Erstellen Sie deshalb ein reproduzierbares Testszenario in Apidog.
1. Drei Requests mit einem gemeinsamen Prompt anlegen
Erstellen Sie je eine Anfrage für:
- GPT-6 Astra
- Claude Opus 5.5
- Gemini mit einer Modellvariable
Verwenden Sie für Gemini zunächst gemini-3.8-flash, bis Google die Argon-Modell-ID veröffentlicht:
{
"model": "{{GEMINI_MODEL}}",
"contents": [
{
"role": "user",
"parts": [
{
"text": "{{PROMPT}}"
}
]
}
]
}
Setzen Sie die Umgebungsvariable:
GEMINI_MODEL=gemini-3.8-flash
Die jeweiligen Request-Formate behandeln der API-Leitfaden für GPT-6 Astra und Was ist Claude Opus 5.5.
2. Schlüssel und Testdaten als Variablen speichern
Legen Sie API-Schlüssel nicht direkt im Request ab. Speichern Sie sie als Umgebungsvariablen:
OPENAI_API_KEY=...
ANTHROPIC_API_KEY=...
GEMINI_API_KEY=...
PROMPT=Analysiere dieses Repository und schlage eine konkrete Korrektur vor.
Verwenden Sie {{PROMPT}} in allen drei Requests. So erhält jedes Modell exakt dieselbe Eingabe.
3. Assertions für Antwort, Token und Budget hinzufügen
Prüfen Sie mindestens:
- HTTP-Status
200 - nicht leere Modellantwort
- Ausgabetoken unter Ihrem Limit
- berechnete Kosten unter Ihrem Budget
Beispiel für ein Budget-Limit als Testregel:
pm.test("Antwort ist erfolgreich", () => {
pm.response.to.have.status(200);
});
pm.test("Antwort ist nicht leer", () => {
const body = pm.response.json();
pm.expect(JSON.stringify(body)).to.not.be.empty;
});
Die konkrete JSON-Struktur für Tokens und Antworttext unterscheidet sich je Anbieter. Lesen Sie diese Felder daher pro Request aus, normalisieren Sie sie in Variablen und vergleichen Sie anschließend dieselben Kennzahlen:
input_tokens
output_tokens
estimated_cost
latency_ms
4. Kosten pro Anfrage berechnen
Für 20.000 Eingabe- und 4.000 Ausgabetoken ergibt sich:
Astra:
20.000 × $10 / 1.000.000 + 4.000 × $50 / 1.000.000
= $0.20 + $0.20
= $0.40
Opus 5.5:
20.000 × $4 / 1.000.000 + 4.000 × $20 / 1.000.000
= $0.08 + $0.08
= $0.16
Argon:
Einführungstarif: $0.08
Standardtarif: $0.16
Der Tokenpreis ist allerdings nicht identisch mit den Kosten pro Aufgabe. Artificial Analysis maß für Argon etwa 62K Ausgabetoken pro Aufgabe, gegenüber etwa 27K für Astra bei maximalem Aufwand. Messen Sie deshalb immer die tatsächlich erzeugten Ausgabetoken mit Ihren eigenen Prompts.
5. Testszenario ausführen und Ergebnisse vergleichen
Führen Sie alle drei Requests als ein Szenario aus. Vergleichen Sie anschließend im Testbericht:
- fachliche Korrektheit,
- Format- und Schema-Treue,
- Tool- oder Agentenerfolg,
- Latenz,
- Ein- und Ausgabetoken,
- geschätzte Kosten.
Sobald Argon verfügbar ist, ändern Sie nur die Variable:
GEMINI_MODEL=<veröffentlichte-argon-modell-id>
Führen Sie dasselbe Szenario erneut aus. Damit vergleichen Sie Argon direkt mit Astra und Opus 5.5 auf identischen Prompts und mit identischen Assertions.
FAQ
Ist Gemini 4 Argon besser als GPT-6 Astra?
Bei Artificial Analysis liegen beide mit 53 Punkten gleichauf. In Googles Tabelle erzielt Argon in den meisten Zeilen höhere Werte. Astra gewinnt jedoch FrontierSWE v2, Terminal-Bench Science 0.1 und OSWorld-2.0 – und ist heute verfügbar.
Gemini 4 Argon vs. Claude Opus 5.5: Welches ist besser?
Googles Tabelle bevorzugt Argon in den meisten Zeilen. Opus 5.5 gewinnt Terminal-bench 4.0 und PostTrainBench und führt bei Artificial Analysis mit 58 zu 53. Zu Argons Standardpreisen kosten beide Modelle gleich viel.
Ist Gemini 4 Argon günstiger als Claude Opus 5.5?
Während der Einführungsphase kostet Argon halb so viel: $2/$10 statt $4/$20. Danach sind die Listenpreise identisch. Google hat kein Enddatum für die Einführungsphase genannt.
Welches Modell hat das größte Ausgabelimit?
Argon mit angegebenen 1 Mio. Token, wobei Vals AI für die getestete Konfiguration 262K nennt. Die anderen Modelle begrenzen synchrone Ausgaben auf 128K. Der Leitfaden für 1 Mio. Ausgabetoken erklärt die Auswirkungen auf Ihren Client.
Kann ich Gemini 4 Argon heute verwenden?
Nur über Googles Fairwind-Programm für eine Gruppe geprüfter Cyber-Verteidigungspartner. Bezahlende API-Kunden und Google-AI-Ultra-Abonnenten sollen folgen, jedoch ohne veröffentlichtes Datum.
Nach Arbeitslast auswählen, dann testen
Argon ist laut Googles Daten besonders stark bei Wissensarbeit, langem Kontext und multimodalen Aufgaben. Astra führt bei FrontierSWE, Terminal-Bench Science und OSWorld. Opus 5.5 ist stark bei Terminalarbeit und ML-Engineering – zu dem Preis, den Argon nach der Einführung ebenfalls kosten soll.
Bauen Sie heute auf Astra und Opus 5.5 auf. Halten Sie das Gemini-Modell als Variable konfigurierbar und führen Sie Ihr Testszenario erneut aus, sobald Argon verfügbar ist. Um den Drei-Anfrage-Vergleich in einem Projekt einzurichten, laden Sie Apidog herunter.
Top comments (0)