Gemini 4 Argon domine 13 des 19 lignes du tableau de lancement de Google, fait match nul sur CWE-bench v1 avec GPT-6 Astra, et est en retrait sur 5 benchmarks : FrontierSWE v2, Terminal-bench 4.0, PostTrainBench, Terminal-Bench Science 0.1 et OSWorld-2.0. Le point bloquant est l’accès : Argon est aujourd’hui réservé aux défenseurs du programme Fairwind. En dehors des partenaires Google et de quelques organisations de benchmark, il est donc impossible de reproduire ces chiffres.
Essayez Apidog dès aujourd’hui
Ce guide détaille les sources de chaque score, les limites méthodologiques et une méthode concrète pour préparer votre propre évaluation dans Apidog avant l’ouverture de l’accès. Pour le contexte, consultez ce qu’est Gemini 4 Argon et, pour choisir un modèle, Argon vs GPT-6 Astra vs Claude Opus 5.5.
Le tableau complet et la source de chaque mesure
Les résultats ci-dessous sont rapportés par Google dans son article de lancement et dans son PDF de méthodologie d’évaluation, daté d’octobre 2026.
Google a calculé directement 10 des 19 scores d’Argon. Les 9 autres viennent de classements publics. Les chiffres des concurrents proviennent selon les lignes de classements, de tests Google, de cartes système ou de billets publiés par les fournisseurs. Les harnais ne sont donc pas toujours identiques.
Le gras indique le leader de la ligne.
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Qui l’a mesuré |
|---|---|---|---|---|---|
| Indice Vals | 68,9 % | 63,1 % | 65,8 % | 67,0 % | Vals AI |
| AutomationBench | 51,3 % | 41,4 % | 31,4 % | 42,5 % | Classement Zapier, ensemble privé |
| Vals Finance Agent v2 | 65,4 % | 53,5 % | 58,9 % | 58,6 % | Vals AI |
| Harvey Legal Agent | 19,6 % | 5,4 % | 6,7 % | 3,8 % | Vals AI |
| DeepSWE v1.1 | 77,9 % | 74,1 % | 67,4 % | 74,2 % | Argon auto-calculé ; classement Astra ; cartes système Anthropic |
| FrontierSWE v2 | 55,0 % | 65,5 % | 56,3 % | 62,3 % | Classement Proximal |
| Vibe Code Bench | 91,9 % | 89,6 % | 90,3 % | 90,3 % | Vals AI |
| Terminal-bench 4.0 | 57,4 % | 58,2 % | 57,9 % | 66,4 % | Argon auto-calculé ; classement des concurrents |
| PostTrainBench | 45,3 % | 44,3 % | 40,2 % | 49,3 % | Auto-calculé pour tous les modèles |
| Terminal-Bench Science 0.1 | 57,6 % | 68,1 % | 52,6 % | 63,3 % | Argon auto-calculé ; classement des concurrents |
| LABBench 2 | 88,8 % | 85,4 % | 68,6 % | 73,1 % | Auto-calculé pour tous les modèles |
| RiemannBench | 76,0 % | 72,0 % | 65,6 % | 69,6 % | Classement Surge |
| GraphWalks jusqu’à 128K | 99,7 % | 98,7 % | 91,4 % | 90,6 % | Auto-calculé pour tous les modèles |
| GraphWalks 256K à 1M | 84,2 % | 71,8 % | 65,0 % | 66,8 % | Auto-calculé pour tous les modèles |
| Agent’s Last Exam | 39,5 % | 34,2 % | n/r | 38,2 % | Argon auto-calculé ; classement des concurrents |
| OSWorld-2.0, hors ligne | 69,2 % | 72,6 % | n/r | n/r | Argon auto-calculé ; Astra depuis le billet OpenAI |
| Chartography | 71,6 % | 71,0 % | 46,2 % | 66,3 % | Classement Surge |
| LVBench | 91,7 % | 87,5 % | 79,7 % | 83,7 % | Auto-calculé pour tous les modèles |
| CWE-bench v1 | 68,0 % | 68,0 % | 58,0 % | 67,0 % | Classement public |
n/rsignifie non rapporté.
Grok 4.7, absent du tableau Google, atteint également 68 % dans le classement CWE-bench. La première place de cette ligne est donc une égalité à trois.
Comment lire les sources
Ne traitez pas ces 19 lignes comme un unique benchmark homogène :
- 9 lignes viennent de classements publics couvrant chaque modèle : Vals AI, Zapier, Proximal, Surge et CWE-bench.
- 5 lignes ont été exécutées par Google pour les quatre modèles.
- 5 lignes mixtes associent une exécution Google pour Argon à des résultats concurrents publiés ailleurs.
Argon domine 7 des 9 lignes publiques et fait une égalité. Sur les 5 lignes exécutées par Google pour les quatre modèles, Argon en gagne 4. Trois de ses cinq défaites apparaissent dans les lignes mixtes.
Pour un choix d’architecture, utilisez surtout les benchmarks qui ressemblent à votre flux de travail et dont le harnais est comparable.
Où Argon est en retrait pour le codage agentique
Les cinq défaites ne se valent pas : plusieurs concernent directement des workflows de développement autonomes ou dépendants du terminal.
- FrontierSWE v2 : 55,0 % pour Argon contre 65,5 % pour Astra. Argon est dernier des quatre modèles sur ce classement public.
- Terminal-bench 4.0 : 57,4 % pour Argon contre 66,4 % pour Opus 5.5. Argon est de nouveau dernier.
- PostTrainBench : 45,3 % contre 49,3 % pour Opus 5.5. Argon est deuxième sur une ligne exécutée par Google pour tous les modèles.
- Terminal-Bench Science 0.1 : 57,6 % contre 68,1 % pour Astra. Google a exécuté Argon avec un délai d’attente du vérificateur multiplié par 6.
- OSWorld-2.0, hors ligne : 69,2 % contre 72,6 % pour Astra. Anthropic ne publie qu’un score combiné en ligne et hors ligne, ce qui exclut les modèles Claude de cette ligne.
Pour le développement agentique, le résultat est partagé :
- Argon gagne DeepSWE v1.1 et Vibe Code Bench.
- Argon termine dernier sur FrontierSWE v2 et Terminal-bench 4.0.
La victoire sur DeepSWE doit être lue avec prudence : Argon a utilisé un harnais d’agent mini-swe, Astra vient d’un classement public et les chiffres Claude viennent de cartes système. Vibe Code Bench est plus directement comparable, puisque Vals AI a mesuré les quatre modèles, mais l’écart n’est que de 1,6 point.
Si vos agents modifient des dépôts volumineux, exécutent des commandes shell ou doivent boucler longtemps dans un terminal, donnez davantage de poids à FrontierSWE et Terminal-bench qu’au nombre total de premières places. Consultez aussi notre prise en main de GPT-6 Astra et la répartition des benchmarks de Claude Fable 5.1.
Bloomberg rapporte que des employés anonymes de Google disposant de l’accès estiment qu’Argon est décevant pour certains travaux de code et de conception front-end au regard de ses benchmarks. Google a contesté cette caractérisation.
Limites méthodologiques à vérifier avant de conclure
Avant de comparer les pourcentages, vérifiez les paramètres d’exécution.
Raisonnement maximal pour chaque modèle
Argon a été exécuté avec les réglages de réflexion Gemini les plus élevés. Google a utilisé, pour Astra, Fable 5.1 et Opus 5.5, les réglages de réflexion ou raisonnement maximum disponibles. Cela mesure les plafonds de capacité, pas la latence, le coût ni le comportement par défaut.-
Entrées visuelles différentes sur LVBench
Google a exécuté LVBench sans outils pour les quatre modèles, mais les entrées n’étaient pas identiques :- Gemini : vidéo échantillonnée à 1 FPS ;
- Astra : 800 images ;
- Fable 5.1 : 300 images ;
- Opus 5.5 : 600 images.
OSWorld utilise le meilleur résultat sur trois
Le score Argon correspond au maximum de 3 exécutions, avec une tentative par exécution. Ce n’est pas une moyenne.Fenêtre de cinq heures sur Agent’s Last Exam
Argon a été exécuté sur ALE-Claw avec une fenêtre de 5 heures.Filtres de sécurité activés
Agent’s Last Exam et OSWorld ont été exécutés avec les filtres de sécurité actifs. Les réponses signalées étaient renvoyées comme des chaînes vides.
En pratique, reproduisez au minimum les paramètres qui ont un effet direct sur votre produit : modèle, niveau de raisonnement, délai maximal, nombre de tentatives, outils autorisés, taille du contexte et règles de sécurité.
Scores cyber publiés par DeepMind
La page cyber de DeepMind ajoute quatre résultats au-delà du tableau de lancement.
| Évaluation cyber | Gemini 4 Argon | Comparaison |
|---|---|---|
| Découverte de vulnérabilités réelles | 85,8 % | Gemini 3.8 Flash Cyber : 71,0 % |
| Benchmark de test de pénétration Wiz | 70,9 % | Gemini 3.8 Flash Cyber : 58,2 % |
| Succès d’attaque Gray Swan IPI, k=15, plus bas est mieux | 0,7 % | Plus bas score du tableau ; Kimi K3 atteint 52,7 % |
| CWE-bench v1 | 68 % | Égalité avec Grok 4.7 et GPT-6 Astra ; Opus 5.5 atteint 67 % |
L’évaluation de découverte de vulnérabilités a utilisé le harnais interne Antigravity, décrit comme non spécialisé en cybersécurité, avec accès au code source.
Le test Wiz n’accorde au modèle que l’accès à un site web en cours d’exécution et à son comportement public, sans accès au code source. Les comparaisons principales portent sur le précédent modèle cyber de Google, et non sur les concurrents.
Pour relier ces évaluations à vos APIs, lisez notre explicatif sur la cyberdéfense d’Argon.
Classements tiers : ce qu’ils ajoutent
Les organisations suivantes ont publié des scores très peu de temps après le lancement, ce qui indique un accès pré-lancement.
- Artificial Analysis classe Gemini 4 Argon, réglage Élevé, à un indice d’intelligence de 53, soit la 8e place sur 223. Chaque paramètre de raisonnement est compté séparément. Par modèle distinct, Argon est à égalité avec Fable 5.1 et GPT-6 Astra, derrière Opus 5.5, 58 au maximum, et Sonnet 5.5, 56 au maximum. Artificial Analysis indique 15 % d’hallucination sur AA-Omniscience, contre 51 % pour Astra au maximum, et une précision de 50 % contre 63 %. L’indice a coûté 1,99 $ par tâche, avec environ 62K jetons de sortie par tâche pour Argon, contre environ 27K pour Astra au maximum. Artificial Analysis ne publie aucune donnée de vitesse ou de latence.
- Vals AI place Argon à 68,90 % sur l’indice Vals, à la première place sur 41 modèles. Il s’agit du premier modèle Gemini à dépasser ce classement. Le coût rapporté est de 15,68 $ par test. Vals AI indique une sortie maximale de 262K pour la configuration testée, sous les 1M annoncés par Google.
- Arena classe Argon premier sur le classement Texte, avec 1525 points. Le score est marqué préliminaire et repose sur 4 942 votes. Argon est huitième sur WebDev.
Pourquoi certaines sources annoncent 12, 13 ou 14 victoires
Le total dépend du rival choisi.
| Compté contre | Victoires d’Argon | Égalités | Défaites d’Argon | Non rapporté |
|---|---|---|---|---|
| Meilleur des trois rivaux | 13 | 1 | 5 | 0 |
| GPT-6 Astra uniquement | 14 | 1 | 4 | 0 |
| Claude Opus 5.5 uniquement | 14 | 0 | 4 | 1 |
| Claude Fable 5.1 uniquement | 15 | 0 | 2 | 2 |
Un total de 13 victoires est correct contre le meilleur des trois rivaux. Un total de 14 victoires est correct en face-à-face contre Astra ou Opus 5.5.
Un total de 12 ne correspond à aucune de ces configurations complètes : vérifiez donc les lignes exclues par la source. Vérifiez également les écarts absolus : Harvey Legal Agent présente une large avance, 19,6 % contre 6,7 %, tandis que Chartography ne sépare Argon et Astra que de 0,6 point.
Préparer votre propre évaluation avant l’accès à Argon
Les benchmarks Google décrivent leur harnais. Vos prompts doivent décrire votre produit.
Préparez maintenant un scénario sur un modèle accessible, puis remplacez uniquement la variable de modèle lorsque l’identifiant d’Argon sera publié.
1. Sélectionnez des cas réels
Choisissez des prompts représentatifs de votre application :
- correction d’un bug dans un dépôt ;
- création ou modification d’un fichier via terminal ;
- analyse d’une spécification API longue ;
- génération d’un correctif avec tests ;
- extraction de données depuis une réponse API complexe.
Évitez les prompts artificiels ou trop courts. Un bon jeu initial contient des cas qui ont déjà échoué en production.
2. Créez un environnement Apidog
Dans Apidog, créez un environnement avec les variables suivantes :
GEMINI_API_KEY=votre_clé_API
GEMINI_MODEL=gemini-3.8-flash
Google n’a pas encore publié l’identifiant du modèle Argon. Centraliser ce nom dans GEMINI_MODEL permet de basculer de modèle sans modifier vos requêtes.
3. Utilisez la variable dans chaque requête
Enregistrez vos prompts sous forme de requêtes utilisant {{GEMINI_MODEL}}.
Exemple de payload à adapter à l’API Gemini disponible dans votre environnement :
{
"model": "{{GEMINI_MODEL}}",
"contents": [
{
"role": "user",
"parts": [
{
"text": "Analyse ce dépôt, identifie la cause du test en échec et propose un correctif minimal avec les tests associés."
}
]
}
]
}
Organisez les requêtes par scénarios :
01-correction-depot02-tache-terminal03-analyse-document-long04-generation-client-api05-reponse-incident
4. Ajoutez des assertions fonctionnelles et de coût
Ne vérifiez pas uniquement le code HTTP. Testez les éléments qui déterminent si la réponse est utilisable.
Exemples d’assertions :
Statut HTTP = 200
La réponse contient un correctif ou une action proposée
La réponse contient les fichiers concernés
La réponse ne contient pas "je ne peux pas"
usageMetadata existe
thoughtsTokenCount reste sous votre plafond
Si la réponse expose usageMetadata, conservez aussi les valeurs de consommation. Par exemple :
{
"usageMetadata": {
"promptTokenCount": 1200,
"candidatesTokenCount": 850,
"thoughtsTokenCount": 4200
}
}
Dimensionnez un plafond de thoughtsTokenCount à partir de votre budget réel. Un modèle qui réussit davantage mais dépasse votre coût cible sur chaque requête peut ne pas être le bon choix pour le chemin critique.
5. Exécutez une baseline dès maintenant
Exécutez le scénario avec Gemini 3.8 Flash et archivez le rapport :
- taux de réussite ;
- réponses en échec ;
- durée ;
- jetons consommés ;
- coût estimé ;
- taux de réponses nécessitant une intervention humaine.
Lorsque l’ID Argon sera disponible, remplacez uniquement :
GEMINI_MODEL=gemini-4-argon
Réexécutez ensuite le même scénario avec les mêmes prompts, contraintes et assertions.
Google indique que tous les nouveaux modèles seront lancés sur l’API Interactions. Préparez donc aussi une version Interactions de chaque requête afin d’éviter de comparer deux intégrations différentes.
Pour le positionnement attendu face à votre baseline, consultez notre comparaison Argon vs Gemini 3.8 Flash.
FAQ
Les benchmarks de Gemini 4 Argon sont-ils vérifiés indépendamment ?
Partiellement. Neuf des 19 lignes viennent de classements publics couvrant tous les modèles. Artificial Analysis, Vals AI et Arena ont aussi publié leurs propres résultats. Les autres lignes sont exécutées par Google pour Argon.
Quel est le score DeepSWE de Gemini 4 Argon ?
Argon atteint 77,9 % sur DeepSWE v1.1, devant Opus 5.5 à 74,2 % et Astra à 74,1 %. L’exécution Argon a utilisé un harnais mini-swe, tandis que les chiffres concurrents viennent d’un classement et de cartes système.
Argon bat-il GPT-6 Astra sur les benchmarks ?
Dans le tableau Google, Argon gagne 14 lignes contre Astra, fait une égalité et perd 4 lignes. Sur Artificial Analysis, les deux modèles sont à égalité à 53.
Puis-je réexécuter ces benchmarks moi-même ?
Pas encore. Argon reste limité aux partenaires Fairwind et Google n’a pas communiqué de date de sortie publique. Consultez notre suivi de la date de sortie d’Argon pour suivre le déploiement.
Étape suivante
Créez votre scénario maintenant, exécutez-le sur Gemini 3.8 Flash et conservez le rapport de référence. Dès qu’Argon sera disponible, vous pourrez produire une comparaison basée sur vos prompts, vos limites de coût et vos critères de réussite en remplaçant une seule variable.
Téléchargez Apidog pour configurer votre première évaluation.
Top comments (0)