DEV Community

Cover image for Gemini 4 Argon Benchmarks: Alle 19 Ergebnisse, wie Google testete und 5 Niederlagen
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Gemini 4 Argon Benchmarks: Alle 19 Ergebnisse, wie Google testete und 5 Niederlagen

Gemini 4 Argon führt 13 der 19 Zeilen in Googles Launch-Tabelle direkt an, liegt bei einer Zeile (CWE-bench v1, gemeinsam mit GPT-6 Astra) gleichauf und liegt bei fünf zurück: FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 und OSWorld-2.0. Der Haken ist der Zugang: Argon ist aktuell nur für Verteidiger des Fairwind-Programms verfügbar. Außerhalb von Googles Partnerliste und einigen Benchmark-Organisationen kann niemand diese Zahlen derzeit reproduzieren.

Teste Apidog noch heute

Hier finden Sie die vollständige Tabelle mit den Messverantwortlichen, den fünf Niederlagen, methodischen Einschränkungen, Cyber-Scores, Drittanbieter-Scoreboards und einer Anleitung für einen eigenen Eval in Apidog. Für den Modellüberblick starten Sie mit Was ist Gemini 4 Argon?. Für eine Kaufentscheidung siehe Argon vs. GPT-6 Astra vs. Claude Opus 5.5.

Die vollständige Tabelle mit den Messverantwortlichen jeder Zeile

Die folgenden Ergebnisse stammen aus Googles Launch-Post und dem Evals-Methodik-PDF, das mit „Ergebnisse Stand Oktober 2026“ überschrieben ist.

Google berechnete 10 der 19 Argon-Scores selbst. Die übrigen 9 stammen aus öffentlichen Ranglisten. Die Vergleichswerte kommen je nach Zeile aus Ranglisten, Googles eigenen Läufen sowie Systemkarten und Blogposts der Anbieter. Auch die verwendeten Harnesses unterscheiden sich. Fett markiert den Zeilenführer.

Benchmark Gemini 4 Argon GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5 Wer es gemessen hat
Vals Index 68,9 % 63,1 % 65,8 % 67,0 % Vals AI
AutomationBench 51,3 % 41,4 % 31,4 % 42,5 % Zapier-Rangliste, privater Satz
Vals Finance Agent v2 65,4 % 53,5 % 58,9 % 58,6 % Vals AI
Harvey Legal Agent 19,6 % 5,4 % 6,7 % 3,8 % Vals AI
DeepSWE v1.1 77,9 % 74,1 % 67,4 % 74,2 % Argon selbst berechnet; Astra-Rangliste; Anthropic-Systemkarten
FrontierSWE v2 55,0 % 65,5 % 56,3 % 62,3 % Proximal-Rangliste
Vibe Code Bench 91,9 % 89,6 % 90,3 % 90,3 % Vals AI
Terminal-bench 4.0 57,4 % 58,2 % 57,9 % 66,4 % Argon selbst berechnet; Konkurrenten-Rangliste
PostTrainBench 45,3 % 44,3 % 40,2 % 49,3 % Selbst berechnet für alle Modelle
Terminal-Bench Science 0.1 57,6 % 68,1 % 52,6 % 63,3 % Argon selbst berechnet; Konkurrenten-Rangliste
LABBench 2 88,8 % 85,4 % 68,6 % 73,1 % Selbst berechnet für alle Modelle
RiemannBench 76,0 % 72,0 % 65,6 % 69,6 % Surge-Rangliste
GraphWalks bis zu 128K 99,7 % 98,7 % 91,4 % 90,6 % Selbst berechnet für alle Modelle
GraphWalks 256K bis 1M 84,2 % 71,8 % 65,0 % 66,8 % Selbst berechnet für alle Modelle
Agent’s Last Exam 39,5 % 34,2 % n/a 38,2 % Argon selbst berechnet; Konkurrenten-Rangliste
OSWorld-2.0, offline 69,2 % 72,6 % n/a n/a Argon selbst berechnet; Astra aus OpenAIs Blogpost
Chartography 71,6 % 71,0 % 46,2 % 66,3 % Surge-Rangliste
LVBench 91,7 % 87,5 % 79,7 % 83,7 % Selbst berechnet für alle Modelle
CWE-bench v1 68,0 % 68,0 % 58,0 % 67,0 % Öffentliche Rangliste

n/a bedeutet: nicht gemeldet. Grok 4.7, das nicht in Googles Tabelle enthalten ist, erreicht auf der CWE-bench-Rangliste ebenfalls 68 %. Damit ist es ein dreifacher Gleichstand.

Nach Quelle aufgeschlüsselt:

  • 9 Zeilen stammen aus öffentlichen Ranglisten für alle Modelle: Vals AI, Zapier, Proximal, Surge und CWE-bench.
    • Argon führt 7 von 9 an.
    • Bei einer Zeile liegt es gleichauf.
  • 5 Zeilen berechnete Google selbst für alle vier Modelle.
    • Argon führt 4 von 5 an.
  • In den übrigen 5 gemischten Zeilen stammt Argons Score aus einem Google-Lauf, während die Konkurrenzwerte aus anderen Quellen kommen.
    • Hier liegen 3 der 5 Niederlagen von Argon.

Wenn Googles eigene Berechnungen Argon systematisch begünstigen würden, wäre eher das Gegenteil zu erwarten.

Wo Argon zurückliegt – und warum das für agentisches Codieren wichtig ist

Die fünf Niederlagen betreffen vor allem Benchmarks für Coding-Agenten, Terminal-Aufgaben und lange Arbeitsabläufe:

  • FrontierSWE v2: 55,0 % gegenüber Astras 65,5 %. Argon liegt als Letzter von vier Modellen hinter Fable 5.1 mit 56,3 % und Opus 5.5 mit 62,3 %.
  • Terminal-bench 4.0: 57,4 % gegenüber 66,4 % für Opus 5.5. Wieder letzter Platz; Astra und Fable 5.1 liegen innerhalb eines Punkts.
  • PostTrainBench: 45,3 % gegenüber 49,3 % für Opus 5.5. Zweiter Platz in einer Zeile, die Google für alle Modelle selbst ausgeführt hat.
  • Terminal-Bench Science 0.1: 57,6 % gegenüber 68,1 % für Astra. Dritter Platz vor Fable 5.1. Google führte Argons Versuch mit einem sechsfachen Verifizierer-Timeout aus.
  • OSWorld-2.0, Offline-Subset: 69,2 % gegenüber 72,6 % für Astra. Anthropic meldet nur eine kombinierte Online- und Offline-Punktzahl, daher erscheinen keine Claude-Modelle.

Bei agentischem Coding ist das Bild gemischt:

Benchmark Ergebnis für Argon
DeepSWE v1.1 Sieg
Vibe Code Bench Sieg
FrontierSWE v2 Letzter Platz
Terminal-bench 4.0 Letzter Platz

Der DeepSWE-Sieg verwendet unterschiedliche Harnesses: Argon lief auf einem Mini-SWE-Agent-Harness, Astras Wert stammt aus einer öffentlichen Rangliste und die Claude-Werte aus Systemkarten.

Vibe Code Bench ist vergleichbarer, weil Vals AI alle vier Modelle gemessen hat. Der Abstand beträgt dort jedoch nur 1,6 Punkte.

Wenn Ihre Workloads terminal-lastige Agenten oder lange Repository-Aufgaben enthalten, sollten Sie FrontierSWE v2 und Terminal-bench 4.0 stärker gewichten als die aggregierte Überschrift „13 von 19 Siegen“. Astra führt bei FrontierSWE; das GPT-6-Astra-Hands-on zeigt, wie sich das Modell heute nutzen lässt. Die Claude-Fable-5.1-Benchmarks-Aufschlüsselung behandelt Fables eigene Startzahlen.

Bloomberg berichtet, dass anonyme Google-Mitarbeiter mit Zugang Argon bei einigen Coding- und Front-End-Designaufgaben im Vergleich zu seinen Benchmark-Scores als enttäuschend beschreiben. Google bezeichnete diese Charakterisierung als ungenau.

Methodische Vorbehalte, die die Tabelle verändern

Behandeln Sie die Werte nicht als direkte Prognose für Kosten, Latenz oder Standardqualität in Ihrer Anwendung.

  • Maximale Denk-Einstellungen auf beiden Seiten: Argon lief laut Google „mit der Gemini API mit den höchsten Denk-Einstellungen“. Für Astra, Fable 5.1 und Opus 5.5 wurden standardmäßig die maximal verfügbaren Denk- oder Begründungseinstellungen verwendet. Verglichen werden damit Obergrenzen, nicht Standardverhalten oder Kosten.
  • LVBench-Frames: Google führte LVBench für alle vier Modelle ohne Tools aus. Gemini sampelte Videos mit 1 FPS. Astra erhielt 800 Frames, Fable 5.1 300 und Opus 5.5 600 – laut Google aufgrund von API-Beschränkungen. Die Modelle sahen also keine identischen Eingaben.
  • OSWorld „best of three“: Argons Wert ist über drei Läufe maximiert, jeweils mit einem einzelnen Versuch. Das ist ein bester Lauf, kein Durchschnitt.
  • Agent’s Last Exam: Argon lief im ALE-Claw-Harness mit einem Zeitfenster von fünf Stunden.
  • Aktivierte Sicherheitsfilter: Agent’s Last Exam und OSWorld liefen mit Sicherheitsfiltern. Als problematisch markierte Antworten wurden als leere Strings zurückgegeben. Falls dies einen Effekt hat, wirkt er sich laut Beschreibung eher negativ auf Argon aus.

Die Cyber-Zeilen von DeepMinds Cyber-Seite

Die DeepMind-Cyber-Seite ergänzt vier Werte über die Launch-Tabelle hinaus:

Cyber-Bewertung Gemini 4 Argon Vergleich
Entdeckung realer Schwachstellen 85,8 % Gemini 3.8 Flash Cyber: 71,0 %
Wiz Penetration Test Benchmark 70,9 % Gemini 3.8 Flash Cyber: 58,2 %
Gray Swan IPI Angriffs-Erfolg, k=15, niedriger ist besser 0,7 % Niedrigster Wert in der Tabelle; Kimi K3 am höchsten mit 52,7 %
CWE-bench v1 68 % Dreifacher Gleichstand mit Grok 4.7 und GPT-6 Astra; Opus 5.5 bei 67 %

Die Schwachstellenbewertung nutzte ein internes Antigravity-Harness, das laut Google nicht auf Cyber spezialisiert ist, aber Quellzugang hatte.

Der Wiz-Test gibt dem Modell dagegen nur Zugriff auf die laufende Website und ihr öffentlich beobachtbares Verhalten – nicht auf den Quellcode der Anwendung.

Beide Schlagzeilen-Vergleiche beziehen sich auf Googles früheres Cyber-Modell, nicht auf konkurrierende Modelle. Der Argon-Cyber-Verteidigungs-Erklärer behandelt, was diese Werte für APIs bedeuten können, die Sie betreiben.

Scoreboards von Drittanbietern

Diese Organisationen veröffentlichten Scores innerhalb weniger Minuten nach dem Start. Das deutet darauf hin, dass sie Vorabzugriff hatten.

  • Artificial Analysis: Listet Gemini 4 Argon High mit einem Intelligence Index von 53 auf Platz 8 von 223. Der Rang zählt jede Denk-Einstellung separat. Nach unterschiedlichen Modellen liegt Argon gleichauf mit Fable 5.1 und GPT-6 Astra, hinter Opus 5.5 mit maximal 58 und Sonnet 5.5 mit maximal 56. Artificial Analysis meldet eine Halluzinationsrate von 15 % auf AA-Omniscience; Astra max liegt bei 51 %. Die Genauigkeit liegt bei 50 % gegenüber 63 %. Die Ausführung des Index kostete 1,99 $ pro Aufgabe, mit etwa 62K Ausgabe-Tokens pro Aufgabe gegenüber rund 27K bei Astra max. Artificial Analysis zeigt keine Geschwindigkeits- oder Latenzdaten.
  • Vals AI: Platziert Argon mit 68,90 % auf dem Vals Index auf Platz 1 von 41. Es ist das erste Gemini-Modell an der Spitze, zu einem Preis von 15,68 $ pro Test. Vals AI listet für die getestete Konfiguration eine maximale Ausgabe von 262K – unter Googles angegebenem Limit von 1M.
  • Arena: Platziert Argon auf Platz 1 bei Text mit 1525 Punkten, vorläufig markiert bei 4.942 Stimmen, sowie auf Platz 8 bei WebDev.

Warum Medien 12, 13 und 14 Siege nennen

Die verschiedenen Zahlen entstehen durch unterschiedliche Vergleichslogik. Eine Neuberechnung aus Googles 19 Zeilen ergibt:

Verglichen mit Argon gewinnt Gleichstände Argon verliert Nicht gemeldet
Bestes aus allen drei Rivalen 13 1 5 0
Nur GPT-6 Astra 14 1 4 0
Nur Claude Opus 5.5 14 0 4 1
Nur Claude Fable 5.1 15 0 2 2

Eine 13 stimmt beim Vergleich gegen das gesamte Feld. Eine 14 stimmt im direkten Vergleich mit Astra oder Opus 5.5.

Eine 12 passt zu keiner dieser Einordnungen über alle 19 Zeilen. Prüfen Sie daher, welche Benchmarks die jeweilige Quelle gezählt hat.

Auch die Margen unterscheiden sich stark:

  • Harvey Legal Agent: 19,6 % gegenüber 6,7 %
  • Chartography: 71,6 % gegenüber 71,0 %, also nur 0,6 Punkte

So führen Sie am Tag der Freischaltung Ihren eigenen Eval durch

Benchmarks beschreiben Googles Harness. Ihre Prompts beschreiben dagegen Ihr Produkt.

Erstellen Sie den Eval jetzt mit einem verfügbaren Modell. Sobald Argons Modell-ID veröffentlicht wird, tauschen Sie nur eine Umgebungsvariable aus.

  1. Wählen Sie reale Aufgaben aus Ihrem Produkt.

    Nehmen Sie Prompts, die zu Ihren Workloads passen:

    • eine Repository-Korrektur,
    • eine Terminal-Aufgabe,
    • eine Frage über lange Dokumente,
    • einen API-Workflow mit strukturiertem Output.
  2. Erstellen Sie in Apidog eine Umgebung.

    Definieren Sie mindestens diese Variablen:

   GEMINI_API_KEY=<Ihr API-Schlüssel>
   GEMINI_MODEL=gemini-3.8-flash
Enter fullscreen mode Exit fullscreen mode

Google hat Argons Modell-ID noch nicht veröffentlicht. GEMINI_MODEL sollte deshalb der einzige Wert sein, den Sie später ändern müssen.

  1. Speichern Sie jeden Prompt als versionierte Anfrage. Lesen Sie das Modell aus der Variable:
   {
     "model": "{{GEMINI_MODEL}}",
     "contents": [
       {
         "role": "user",
         "parts": [
           {
             "text": "Behebe den Fehler im folgenden Repository und liefere einen Patch."
           }
         ]
       }
     ]
   }
Enter fullscreen mode Exit fullscreen mode
  1. Gruppieren Sie die Anfragen in einem Testszenario.

    Trennen Sie beispielsweise:

    • coding-agent
    • terminal-workflows
    • long-context
    • api-structured-output
  2. Fügen Sie Assertions für Qualität und Kosten hinzu.

    Prüfen Sie nicht nur den Statuscode, sondern auch:

    • erforderliche Felder,
    • erwartete Inhalte,
    • JSON-Validität,
    • fehlende Fehlermeldungen,
    • usageMetadata,
    • eine Obergrenze für thoughtsTokenCount.

Beispiel für die zu prüfenden Felder:

   {
     "usageMetadata": {
       "promptTokenCount": 0,
       "candidatesTokenCount": 0,
       "thoughtsTokenCount": 0,
       "totalTokenCount": 0
     }
   }
Enter fullscreen mode Exit fullscreen mode

Setzen Sie das Limit für thoughtsTokenCount anhand Ihres Kostenbudgets, nicht anhand eines Benchmark-Maximums.

  1. Führen Sie die Suite jetzt auf Gemini 3.8 Flash aus. Speichern Sie den Bericht als Basislinie. Dokumentieren Sie außerdem:
    • Modell-ID,
    • Denk-Einstellung,
    • Prompt-Version,
    • Laufzeit,
    • Token-Nutzung,
    • Fehlerrate,
    • manuelle Qualitätsbewertung.

Wenn Argons Modell-ID verfügbar ist, ändern Sie nur:

GEMINI_MODEL=<Argon-Modell-ID>
Enter fullscreen mode Exit fullscreen mode

Führen Sie anschließend dieselbe Suite erneut aus.

Google sagt, dass „alle neuen Modelle“ über die Interactions API gestartet werden. Speichern Sie daher zusätzlich eine Interactions-Version jeder Anfrage. Der Vergleich zwischen Argon und Gemini 3.8 Flash behandelt, was bei Preis und Limits zu erwarten ist.

FAQ

Sind die Benchmarks von Gemini 4 Argon unabhängig verifiziert?

Teilweise. Neun der 19 Zeilen stammen von öffentlichen Ranglisten für jedes Modell. Artificial Analysis, Vals AI und Arena veröffentlichten außerdem eigene Ergebnisse. Den Rest führte Google für Argon aus oder kombinierte Google-Läufe mit Vergleichswerten aus anderen Quellen.

Wie lautet der DeepSWE-Score von Gemini 4 Argon?

77,9 % auf DeepSWE v1.1 – vor Opus 5.5 mit 74,2 % und Astra mit 74,1 %. Argons Durchlauf verwendete einen Mini-SWE-Agent-Harness, während die Werte der Rivalen aus einer Rangliste und Systemkarten stammen.

Schlägt Argon GPT-6 Astra bei Benchmarks?

Im direkten Vergleich in Googles Tabelle gewinnt Argon 14 Zeilen, liegt bei einer gleichauf und verliert vier. Bei Artificial Analysis liegen beide mit einem Intelligence Index von 53 gleichauf.

Kann ich diese Benchmarks selbst erneut ausführen?

Noch nicht. Argon ist auf Fairwind-Partner beschränkt, und Google hat noch kein öffentliches Veröffentlichungsdatum genannt. Der Argon-Veröffentlichungsdatum-Tracker verfolgt den Rollout.

Nächster Schritt

Erstellen Sie die Testsuite jetzt, führen Sie sie auf Gemini 3.8 Flash aus und speichern Sie den Bericht. Wenn Argon freigegeben wird, erhalten Sie innerhalb weniger Minuten eigene, für Ihr Produkt relevante Vergleichswerte.

Laden Sie Apidog herunter, um das Setup zu erstellen.

Top comments (0)