Gemini 3.8 Flash est disponible aujourd'hui : un modèle stable avec un niveau gratuit, tarifé à 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31/12/2026, puis 1,50 $ et 7,50 $. Sa limite de sortie est de 65 536 jetons. Gemini 4 Argon ne l'est pas. Le billet de lancement de Google le tarife à 2 $ et 10 $ pendant une période d'introduction de durée indéterminée, puis 4 $ et 20 $. Google indique une limite de sortie d'un million de jetons, mais Argon n'est aujourd'hui disponible qu'aux défenseurs du programme Fairwind. Si vous devez livrer ce trimestre, partez sur Flash et préparez Argon derrière une variable de configuration.
Essayez Apidog dès aujourd’hui
Cet article compare les deux modèles sur leurs spécifications, les benchmarks partagés dans les annonces de lancement, les scores cyber et le coût d'un appel identique. Vous repartirez aussi avec une règle de décision et une configuration permettant de changer de modèle sans modifier votre requête. Pour le contexte, consultez ce qu'est Gemini 4 Argon et ce qu'est Gemini 3.8 Flash.
Comparaison : ce que vous pouvez appeler aujourd'hui
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Disponibilité | Stable sur l'API Gemini, AI Studio, Antigravity et Gemini Enterprise | Sous-ensemble de partenaires du programme Fairwind, en tant que modèle géré sur Gemini Enterprise |
| ID du modèle | gemini-3.8-flash |
Non publié |
| Prix par million de jetons (entrée / sortie) | 0,75 $ / 3,75 $ jusqu'au 31/12/2026, puis 1,50 $ / 7,50 $ | 2 $ / 10 $ en introduction, puis 4 $ / 20 $ |
| Entrée mise en cache par million | 0,075 $, puis 0,15 $ | 0,10 $ en introduction, puis 0,20 $ (95 % de réduction sur l'entrée) |
| Limite de sortie | 65 536 jetons | 1 million de jetons, selon Google |
| Fenêtre d'entrée | 1 048 576 jetons | Non publiée |
| Niveaux de réflexion |
low, medium par défaut, high ; minimal renvoie HTTP 400 |
Non documentés |
| Niveau API gratuit | Oui, avec limite de débit | Aucun annoncé |
| Accès consommateur | Application Gemini sur AI Pro et Ultra, mode AI dans la recherche | Pas encore ; les abonnés AI Ultra font partie de la première vague, sans date annoncée |
Quelques points nécessitent une vérification avant de concevoir votre intégration :
- Google n'a pas publié la fenêtre d'entrée d'Argon, bien que ses évaluations de contexte long utilisent des invites allant jusqu'à 1 million de jetons.
- Google annonce une sortie maximale d'un million de jetons pour Argon. Un évaluateur tiers, Vals AI, liste toutefois une sortie maximale de 262K pour la configuration testée.
- Les évaluations d'Argon ont été exécutées avec « les paramètres de réflexion les plus élevés ». Un niveau élevé existe probablement, mais Google n'a pas documenté les niveaux disponibles ni leur valeur par défaut.
- Les niveaux de Flash sont documentés dans la documentation Google sur la réflexion et dans notre guide des niveaux de réflexion de Flash 3.8.
Le niveau gratuit de Flash est soumis à des limites de débit, et Google indique que les données de ce niveau sont « utilisées pour améliorer nos produits ». Google n'a annoncé aucun accès gratuit à Argon. Notre explication sur l'accès gratuit à Argon présente les alternatives disponibles.
Les benchmarks partagés dans les deux annonces de lancement
Les tableaux de lancement Google des deux modèles partagent deux lignes en texte. Ce sont des résultats rapportés par Google ; la méthodologie d'Argon attribue ces deux lignes à Vals AI.
| Référence | Gemini 3.8 Flash (tableau du 2 sept.) | Gemini 4 Argon (tableau du 30 sept.) |
|---|---|---|
| Agent financier Vals v2 | 61,4 % | 65,4 % |
| Référence agent juridique Harvey | 10,0 % | 19,6 % |
Ces tableaux ont été publiés à un mois d'intervalle et comparés à des ensembles de concurrents différents. Interprétez donc ces écarts comme une indication, pas comme un test contrôlé.
Le résultat juridique ressort particulièrement : Argon atteint 19,6 %, presque le double des 10,0 % de Flash. L'écart sur la référence financière est de 4 points.
Les autres résultats Argon n'ont pas d'équivalent textuel dans l'annonce de Flash 3.8. Le tableau Flash rapportait HLE-Verified, absent du tableau Argon, tandis que le score DeepSWE de Flash n'apparaissait que dans les images des cartes de modèle.
Sur Text Arena, un classement tiers, Argon (High) se classe n°1 sur les votes préliminaires, alors que Gemini 3.8 Flash (High) est n°11. Retrouvez le détail des 19 lignes du tableau Argon et les organismes ayant mesuré chaque référence dans notre analyse des benchmarks d'Argon.
Cyber : Argon vs Flash Cyber 3.8
La page cyber de DeepMind compare Argon à Gemini 3.8 Flash Cyber, une variante cyber de Flash réservée à Fairwind.
| Évaluation cyber | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Découverte de vulnérabilités réelles | 85,8 % | 71,0 % |
| Référence de test d'intrusion Wiz | 70,9 % | 58,2 % |
Les deux modèles restent restreints :
- Gemini 3.8 Flash Cyber est disponible en disponibilité générale via liste d'autorisation sur la plateforme d'agents Gemini Enterprise.
- Argon est réservé à Fairwind.
Si vous n'êtes pas partenaire Fairwind, ces scores ne changent pas le modèle que vous pouvez appeler aujourd'hui : le modèle général Flash 3.8 est celui sur lequel bâtir.
Coût du même appel sur les deux modèles
Prenons un appel avec :
- 100 000 jetons en entrée
- 8 000 jetons en sortie
Les modèles Gemini actuels, dont Flash 3.8, facturent les jetons de réflexion comme des jetons de sortie. Les 8 000 jetons les incluent donc. Google n'a pas détaillé la facturation des jetons de réflexion d'Argon ; les calculs ci-dessous supposent qu'il suit le comportement des modèles Gemini actuels.
| Modèle et période | Coût d'entrée | Coût de sortie | Total par appel |
|---|---|---|---|
| 3.8 Flash, introduction | 0,1M × 0,75 $ = 0,075 $ | 0,008M × 3,75 $ = 0,030 $ | 0,105 $ |
| 3.8 Flash, à partir du 01/01/2027 | 0,1M × 1,50 $ = 0,150 $ | 0,008M × 7,50 $ = 0,060 $ | 0,210 $ |
| Argon, introduction | 0,1M × 2 $ = 0,200 $ | 0,008M × 10 $ = 0,080 $ | 0,280 $ |
| Argon, standard | 0,1M × 4 $ = 0,400 $ | 0,008M × 20 $ = 0,160 $ | 0,560 $ |
À tarifs comparables, Argon coûte 8/3, soit environ 2,67 fois plus cher, par jeton que Flash.
À 1 000 appels identiques par jour :
- Flash au tarif d'introduction : 105 $/jour
- Argon au tarif d'introduction : 280 $/jour
Ce qui peut modifier ce ratio
Les volumes de jetons varieront selon le modèle.
Une même invite peut générer un nombre différent de jetons de sortie et de réflexion. Les évaluations publiées pour Argon utilisent les paramètres de réflexion les plus élevés. Pour Flash 3.8, Google avertit également que des niveaux d'effort plus élevés peuvent utiliser davantage de jetons.-
Les sorties longues changent le calcul.
Une réponse de 200 000 jetons dépasse la limite de 65 536 jetons de Flash : vous devrez découper le travail en plusieurs appels. Sous la limite déclarée d'Argon, une seule réponse coûte :- 0,2M × 10 $ = 2,00 $ au tarif d'introduction ;
- 0,2M × 20 $ = 4,00 $ au tarif standard.
Une sortie complète d'un million de jetons coûterait 10 $ en introduction ou 20 $ au tarif standard.
- Une seule date de fin de promotion est connue. Le prix d'introduction de Flash se termine le 31/12/2026. Google n'a pas précisé la date de fin du prix d'introduction d'Argon.
Flash propose aussi le traitement par lots avec une réduction de 50 % — 0,375 $ en entrée et 1,875 $ en sortie jusqu'au 31 décembre — selon la page de tarification de l'API Gemini. Google n'a pas publié de tarif Batch pour Argon.
Pour approfondir les calculs, consultez notre guide de tarification Argon et notre guide de tarification Flash 3.8.
Faut-il attendre Argon ou lancer sur Flash ?
Lancez sur Flash 3.8 maintenant si
- Vous êtes limité par les coûts. Flash coûte 3/8 du prix d'Argon par jeton, et le mode Batch divise encore ce coût par deux.
- Vous traitez un volume élevé. Classification, extraction, routage et chat à grande échelle deviennent rapidement coûteux à 10 $ par million de jetons de sortie.
- Vous devez livrer aujourd'hui. Flash possède un ID de modèle stable, un niveau gratuit pour prototyper et un calendrier tarifaire publié.
- Vos réponses tiennent sous 65 536 jetons. C'est le cas de la plupart des charges de travail d'API.
Préparez Argon si
- Votre tâche demande un raisonnement long. Google présente Argon comme un modèle « conçu pour soutenir un raisonnement approfondi sur des flux de travail complexes et à long terme ».
- Vous devez produire plus de 64K jetons. Réécriture de modules complets, rapports longs ou migrations importantes justifient une limite de sortie d'un million de jetons.
- Vous développez des agents juridiques ou financiers. Ce sont les deux références communes publiées par Google, et Argon est devant sur les deux.
- Vous êtes éligible au programme Fairwind. Argon est le modèle utilisé par ce programme.
La stratégie pratique n'est pas de choisir définitivement un modèle : routez la majorité du trafic vers Flash, puis envoyez les requêtes les plus complexes vers Argon lorsqu'il sera disponible, avec la même interface de configuration.
Une requête enregistrée, deux modèles
Conservez le modèle dans une variable d'environnement. Utilisez Flash 3.8 aujourd'hui, puis remplacez la variable lorsque Google publiera l'ID d'Argon. Ne devinez pas cet ID.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "Summarize this contract clause in 3 bullets."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
},
"maxOutputTokens": 8192
}
}'
Configuration recommandée
- Stockez
GEMINI_API_KEYetGEMINI_MODELdans un environnement Apidog. - Enregistrez la requête
generateContent. - Ajoutez des assertions sur :
- le statut HTTP
200; - les champs réellement lus par votre application ;
- un plafond sur
usageMetadata.thoughtsTokenCount, ajusté à votre budget.
- le statut HTTP
- Gardez
maxOutputTokensdéfini pour empêcher une réponse longue de dépasser votre limite de coût. - Ajoutez la requête à un scénario de test.
- Exécutez le scénario sur Flash et conservez le rapport comme référence.
Chaque réponse generateContent se termine par usageMetadata. Utilisez ces données pour comparer le coût réel, plutôt que de vous appuyer uniquement sur les tarifs par million de jetons.
Préparez aussi l'API Interactions
Deux précautions sont nécessaires pour le lancement d'Argon :
- Google indique que « tous les nouveaux modèles » seront lancés sur l'API Interactions, sans préciser si Argon prend en charge
generateContent. - Les niveaux de réflexion d'Argon ne sont pas documentés. La valeur
mediumpourrait ne pas être compatible.
Enregistrez donc une seconde requête avec l'API Interactions :
POST https://generativelanguage.googleapis.com/v1beta/interactions
Utilisez generation_config.thinking_level dans cette version. Lorsque Argon sera disponible :
- remplacez
GEMINI_MODEL; - réexécutez les deux scénarios ;
- comparez les sorties ;
- comparez
usageMetadata; - validez que le gain obtenu justifie le coût sur vos propres invites.
FAQ
Gemini 4 Argon est-il meilleur que Gemini 3.8 Flash ?
Sur les deux lignes partagées textuellement par les tableaux de lancement, oui : 65,4 % contre 61,4 % sur Vals Finance Agent v2, et 19,6 % contre 10,0 % sur Harvey’s Legal Agent Benchmark. Il coûte toutefois environ 2,67 fois plus cher par jeton et vous ne pouvez pas encore l'appeler publiquement.
Faut-il attendre Gemini 4 Argon ?
Non, si vous devez livrer. Google n'a donné aucune date de disponibilité générale, seulement « dès que possible », en commençant par les clients payants de l'API et les abonnés AI Ultra.
Gemini 3.8 Flash ou Argon pour un nouveau projet ?
Commencez avec Flash 3.8, en plaçant le nom du modèle dans une variable d'environnement. Déplacez les requêtes exigeant des sorties longues ou une profondeur juridique et financière vers Argon après l'avoir testé sur vos propres prompts.
Existe-t-il un moyen gratuit d'utiliser Argon ?
Non. Google n'a annoncé aucun niveau gratuit. Consultez notre explication sur l'accès gratuit à Argon pour les modèles Gemini gratuits disponibles aujourd'hui.
Argon remplace-t-il Gemini 3.8 Flash ?
Google ne l'a pas affirmé. Google présente Argon comme son nouveau modèle de pointe, et Reuters rapporte qu'il est plus grand que la précédente ligne Pro. Il s'agit donc d'un niveau différent de Flash.
Étape suivante
Configurez la requête dès aujourd'hui, exécutez-la sur Flash 3.8 et conservez le rapport. Quand Argon sera disponible, vous pourrez déterminer en quelques minutes s'il justifie son coût sur votre trafic.
Téléchargez Apidog pour construire et automatiser cette comparaison.
Top comments (0)