DEV Community

Cover image for Tarifs Gemini 4 Argon : 2$/10$ en introduction, 4$/20$ ensuite, et le coût d'une réponse de 1M de jetons
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

Tarifs Gemini 4 Argon : 2$/10$ en introduction, 4$/20$ ensuite, et le coût d'une réponse de 1M de jetons

Gemini 4 Argon coûte 2 $ par million de jetons d’entrée et 10 $ par million de jetons de sortie pendant sa période de lancement, puis 4 $ et 20 $. L’entrée en cache bénéficie d’une réduction de 95 % : 0,10 $ par million de jetons au lancement et 0,20 $ ensuite. Google n’a pas indiqué la durée de cette période. Argon est annoncé, mais n’est pas encore disponible à l’achat : son déploiement est actuellement limité aux cyberdéfenseurs du programme Fairwind.

Essayez Apidog dès aujourd’hui

Cet article convertit cette grille tarifaire en budget exploitable : comparaison avec sept modèles actuels, quatre scénarios, coût par tâche et contrôles à automatiser. Pour le modèle, commencez par ce qu’est Gemini 4 Argon ; pour son accès, consultez Gemini 4 Argon est-il gratuit. Vous pouvez déjà créer des assertions de coût dans Apidog pour un modèle disponible aujourd’hui, puis remplacer uniquement le nom du modèle lors de la sortie d’Argon.

fe

La grille tarifaire

Google a publié les prix dans l’annonce de lancement de Gemini 4 Argon. La note de bas de page 1 précise qu’après la période de lancement, le prix passe à 4 $ par million de jetons d’entrée et 20 $ par million de jetons de sortie.

Gemini 4 Argon, par million de jetons Lancement Standard (après lancement)
Entrée 2,00 $ 4,00 $
Entrée en cache (réduction de 95 %) 0,10 $ 0,20 $
Sortie 10,00 $ 20,00 $
Sortie maximale par réponse (Google) 1M de jetons 1M de jetons
Coût d’une sortie complète de 1M de jetons 10,00 $ 20,00 $

Les tarifs de cache sont calculés à partir de la réduction de 95 % annoncée par Google :

tarif_cache_lancement = 2,00 $ × 0,05 = 0,10 $
tarif_cache_standard  = 4,00 $ × 0,05 = 0,20 $
Enter fullscreen mode Exit fullscreen mode

Google n’a pas publié de fenêtre de contexte d’entrée ni d’identifiant de modèle. Il annonce une limite de sortie de 1M de jetons, « contre 64K jetons précédemment ». Vals AI liste toutefois une sortie maximale de 262K pour la configuration qu’il a testée.

Argon face aux modèles actuels

Tous les prix ci-dessous sont exprimés par million de jetons.

Modèle Entrée Entrée en cache Sortie Sortie maximale
Gemini 4 Argon (lancement) 2 $ 0,10 $ 10 $ 1M
Gemini 4 Argon (standard) 4 $ 0,20 $ 20 $ 1M
GPT-6 Astra 10 $ 1 $ 50 $ 128 000
Claude Opus 5.5 4 $ 0,20 $ 20 $ 128K (300K sur Batch, bêta)
Claude Sonnet 5.5 2 $ 0,20 $ 10 $ 128K (300K sur Batch, bêta)
GPT-6.1 Sol 2 $ 0,10 $ 10 $ 128 000
Claude Fable 5.1 10 $ 0,25 $ 50 $ 128K
gemini-3.1-pro-preview (invite <=200K / >200K) 2 $ / 4 $ 0,20 $ / 0,40 $ 12 $ / 18 $ 65 536
gemini-3.8-flash (lancement / à partir du 01-01-2027) 0,75 $ / 1,50 $ 0,075 $ / 0,15 $ 3,75 $ / 7,50 $ 65 536

Les prix des concurrents proviennent de leurs sources officielles : GPT-6 Astra, tarification Anthropic et tarification de l’API Gemini.

Points à retenir :

  • Argon Standard équivaut à Claude Opus 5.5 sur le prix par jeton : 4 $ en entrée, 20 $ en sortie et 0,20 $ pour l’entrée en cache.
  • Argon au lancement rejoint Claude Sonnet 5.5 et GPT-6.1 Sol avec 2 $ en entrée et 10 $ en sortie. Son cache à 0,10 $ correspond à GPT-6.1 Sol.
  • GPT-6 Astra et Claude Fable 5.1 coûtent cinq fois plus qu’Argon au lancement, et 2,5 fois plus qu’Argon au tarif standard. Voir la tarification de Claude Fable 5.1.
  • La sortie d’Argon au lancement coûte moins cher que celle de gemini-3.1-pro-preview : 10 $ contre 12 $.
  • Les longues invites peuvent changer la facture. OpenAI applique une majoration au-delà de 272K jetons d’entrée. Gemini 3.1 Pro applique une tarification plus élevée au-delà de 200K. Anthropic ne le fait pas. Google n’a pas précisé si Argon comportera un palier similaire.

Pour comparer les capacités et les prix, consultez Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5.

Les jetons de réflexion sont facturés comme des jetons de sortie

Sur les modèles Gemini actuels, les jetons de réflexion sont facturés comme des jetons de sortie. La documentation Google sur la réflexion indique que la tarification d’une réponse est la somme des jetons de sortie et des jetons de réflexion.

Google n’a pas encore documenté explicitement cette règle pour Argon, mais il faut budgétiser en conséquence. Les évaluations d’Argon ont été réalisées avec les paramètres de réflexion les plus élevés : les 10 $ par million de jetons de sortie doivent donc être lus comme la réponse générée plus le raisonnement.

Quatre scénarios de coût

Utilisez cette formule pour chaque appel :

coût = (jetons_entrée / 1 000 000 × tarif_entrée)
     + (jetons_sortie / 1 000 000 × tarif_sortie)
Enter fullscreen mode Exit fullscreen mode

Les trois premiers scénarios ne supposent pas de mise en cache.

1. Appel API courant : 20K en entrée, 5K en sortie

Au lancement :

Entrée : 20 000 / 1M × 2 $ = 0,04 $
Sortie : 5 000 / 1M × 10 $ = 0,05 $
Total  : 0,09 $
Enter fullscreen mode Exit fullscreen mode

Au tarif standard :

Entrée : 20 000 / 1M × 4 $ = 0,08 $
Sortie : 5 000 / 1M × 20 $ = 0,10 $
Total  : 0,18 $
Enter fullscreen mode Exit fullscreen mode

À 1 000 appels par jour, ce scénario représente 90 $ au lancement ou 180 $ au tarif standard.

À titre de comparaison, le même appel coûte :

  • 0,18 $ sur Claude Opus 5.5 ;
  • 0,45 $ sur GPT-6 Astra ;
  • 0,10 $ sur gemini-3.1-pro-preview ;
  • environ 0,034 $ sur gemini-3.8-flash à son tarif de lancement.

2. Interaction d’agent longue : 200K en entrée, 50K en sortie

Au lancement :

Entrée : 200 000 / 1M × 2 $ = 0,40 $
Sortie : 50 000 / 1M × 10 $ = 0,50 $
Total  : 0,90 $
Enter fullscreen mode Exit fullscreen mode

Au tarif standard :

Entrée : 200 000 / 1M × 4 $ = 0,80 $
Sortie : 50 000 / 1M × 20 $ = 1,00 $
Total  : 1,80 $
Enter fullscreen mode Exit fullscreen mode

GPT-6 Astra facturerait 4,50 $ pour le même volume. gemini-3.1-pro-preview facture 1,00 $, mais 200K correspond à sa limite de palier : au-delà, ses tarifs passent à 4 $ en entrée et 18 $ en sortie. Si Argon adopte un mécanisme similaire, les longues interactions coûteront davantage.

3. Réponse maximale : 1M de jetons de sortie

La sortie seule coûte :

1 000 000 / 1M × 10 $ = 10,00 $ au lancement
1 000 000 / 1M × 20 $ = 20,00 $ au tarif standard
Enter fullscreen mode Exit fullscreen mode

Avec une invite de 100K jetons :

Configuration Lancement Standard
Entrée de 100K jetons 0,20 $ 0,40 $
Sortie de 1M de jetons 10,00 $ 20,00 $
Total 10,20 $ 20,40 $

Aucun autre modèle du tableau ne produit une sortie aussi longue en une réponse synchrone. Si la limite effective est celle de 262K signalée par Vals AI, une sortie complète coûterait environ 2,62 $ au lancement ou 5,24 $ au tarif standard.

Pour les contraintes de streaming, délais d’attente et passerelles, consultez les 1M de jetons de sortie de Gemini 4 Argon.

4. Invite de 500K jetons mise en cache et réutilisée 10 fois

Supposons que vous envoyiez dix fois le même corpus de code ou de contrats de 500K jetons, avec 5K jetons de sortie par appel. Le premier appel paie l’entrée complète pour construire le cache ; les neuf suivants lisent le cache.

10 appels, invite de 500K, 5K de sortie chacun Lancement Standard
Entrée sans cache (10 × 500K) 10,00 $ 20,00 $
Entrée avec cache (1 complet + 9 en cache) 1,00 $ + 9 × 0,05 $ = 1,45 $ 2,00 $ + 9 × 0,10 $ = 2,90 $
Sortie (10 × 5K) 0,50 $ 1,00 $
Total avec cache 1,95 $ 3,90 $
Total sans cache 10,50 $ 21,00 $

La mise en cache réduit ici la facture d’entrée de 85,5 %.

Deux limites restent inconnues :

  1. Google n’a pas précisé si Argon facturera le stockage du cache. À titre de référence, gemini-3.1-pro-preview facture 4,50 $ par million de jetons par heure, ce qui ajouterait 2,25 $ pour conserver 500K jetons pendant une heure.
  2. Une invite de 500K dépasse le seuil de 200K de Gemini 3.1 Pro.

Le tarif de cache standard d’Argon, 0,20 $, est identique à celui d’Opus 5.5. La logique décrite dans Claude Opus 5.5 prompt caching cost math s’applique donc également.

Le prix par jeton n’est pas le coût par tâche

Artificial Analysis indique un coût de 1,99 $ par tâche pour son Intelligence Index exécuté sur Gemini 4 Argon High aux tarifs de lancement. The Decoder estime ce même coût à 3,98 $ aux tarifs standards.

Artificial Analysis attribue à Argon un score de 53, identique à GPT-6 Astra, qu’il liste à 3,26 $ par tâche. Pourtant, Argon consommerait environ 62K jetons de sortie par tâche contre environ 27K pour Astra au réglage maximal, soit environ 2,3 fois plus.

Au tarif de lancement :

Argon : 62 000 / 1M × 10 $ = 0,62 $ de sortie
Astra : 27 000 / 1M × 50 $ = 1,35 $ de sortie
Enter fullscreen mode Exit fullscreen mode

Le tarif par jeton ne suffit donc pas à prédire votre facture. Au tarif standard, l’estimation de 3,98 $ par tâche pour Argon dépasse les 3,26 $ mesurés par Artificial Analysis pour Astra, même si Argon reste 60 % moins cher par jeton.

Vals AI illustre le même phénomène : 15,68 $ par test pour Argon sur le Vals Index, contre 32,14 $ pour Claude Opus 5.5, 21,34 $ pour Claude Sonnet 5.5 et 3,24 $ pour GPT-6.1 Sol. Sonnet 5.5 et GPT-6.1 Sol partagent pourtant le tarif de lancement d’Argon sur le papier.

Budgétisez avec vos propres métriques de jetons et de réussite, pas uniquement avec la grille tarifaire.

Contrôles de coût à mettre en place avant la sortie d’Argon

1. Plafonnez la sortie

Sur generateContent, utilisez generationConfig.maxOutputTokens.

{
  "generationConfig": {
    "maxOutputTokens": 8192
  }
}
Enter fullscreen mode Exit fullscreen mode

Google indique que les nouveaux modèles sont lancés sur l’API Interactions : définissez le paramètre équivalent dès qu’il sera documenté pour Argon.

Ne laissez pas la limite à 1M par défaut : au tarif standard, cela représente jusqu’à 20 $ de sortie par appel, avant même l’entrée.

2. Mettez en cache le contenu stable

Ciblez les données répétées entre les appels :

  • instructions système ;
  • schémas JSON ou OpenAPI ;
  • documentation produit ;
  • corpus de code ;
  • contrats et spécifications.

La réduction de 95 % ne devient intéressante que si le contenu est réellement réutilisé.

3. Testez le niveau de réflexion

Google n’a pas encore publié les niveaux de réflexion d’Argon. Sur les modèles actuels, gemini-3.1-pro-preview utilise high par défaut et gemini-3.8-flash utilise medium.

Quand Argon documentera ses réglages, comparez au minimum :

qualité de la réponse
taux de réussite de la tâche
jetons de réflexion
coût total par requête
Enter fullscreen mode Exit fullscreen mode

Si un niveau inférieur conserve la qualité requise, il réduit potentiellement votre coût de sortie.

4. Vérifiez l’utilisation et bloquez les dépassements

Chaque réponse generateContent se termine par usageMetadata. Dans Apidog, procédez ainsi :

  1. Stockez le nom du modèle dans une variable d’environnement GEMINI_MODEL.
  2. Enregistrez votre requête contre gemini-3.8-flash.
  3. Ajoutez une assertion post-réponse qui lit usageMetadata.
  4. Calculez le coût estimé.
  5. Faites échouer le test si l’appel dépasse votre budget.

L’arithmétique à utiliser est la suivante :

cost = uncached_input / 1,000,000 × input_rate
     + cached_input   / 1,000,000 × cached_rate
     + (output + thinking) / 1,000,000 × output_rate
Enter fullscreen mode Exit fullscreen mode

Vous pouvez exécuter cette suite dès maintenant avec gemini-3.8-flash. Lorsque Google publiera l’identifiant d’Argon, remplacez la valeur de GEMINI_MODEL et relancez les mêmes tests.

Ce que Google n’a pas encore tarifé

Plusieurs éléments restent inconnus :

  • la durée de la période de lancement et la date de passage à 4 $/20 $ ;
  • une éventuelle majoration pour les invites supérieures à 200K jetons ;
  • les tarifs Batch ou Flex ;
  • les frais de stockage en cache ;
  • les limites de débit ;
  • l’existence d’un niveau gratuit.

FAQ

Combien coûte Gemini 4 Argon par million de jetons ?

2 $ en entrée et 10 $ en sortie pendant la période de lancement, puis 4 $ et 20 $. L’entrée en cache bénéficie d’une réduction de 95 % : 0,10 $, puis 0,20 $.

Combien de temps dure le prix de lancement ?

Google ne l’a pas indiqué. L’annonce ne fournit ni date de fin ni durée.

Les jetons de réflexion sont-ils facturés comme des jetons de sortie ?

Oui pour les modèles Gemini actuels. Google n’a pas encore documenté explicitement la règle pour Argon.

Combien coûte une sortie de 1M de jetons ?

10 $ au tarif de lancement et 20 $ au tarif standard, hors coût d’entrée.

Argon est-il moins cher que Claude Opus 5.5 ou GPT-6 Astra ?

Par jeton, Argon Standard égale Opus 5.5 et coûte 60 % de moins qu’Astra. Par tâche, le coût dépend du volume de jetons produit. Artificial Analysis a mesuré environ 2,3 fois plus de jetons de sortie pour Argon que pour Astra. Pour une option Gemini moins chère disponible aujourd’hui, consultez la tarification de Gemini 3.8 Flash.

Puis-je payer pour Argon aujourd’hui ?

Non. Il est actuellement déployé uniquement auprès des partenaires du programme Fairwind. Les clients API payants et les abonnés Google AI Ultra viendront ensuite, sans date annoncée.

Budgétisez maintenant, mesurez plus tard

Prenez les volumes de jetons de votre trafic actuel et calculez deux projections :

projection_lancement = entrées × 2 $/M + sorties × 10 $/M
projection_standard  = entrées × 4 $/M + sorties × 20 $/M
Enter fullscreen mode Exit fullscreen mode

Ensuite, automatisez la mesure. Téléchargez Apidog, enregistrez une requête vers gemini-3.8-flash, utilisez GEMINI_MODEL comme variable et ajoutez une assertion fondée sur usageMetadata.

Lorsque Google publiera l’ID de Gemini 4 Argon, vous n’aurez qu’une valeur à modifier pour obtenir le coût réel par appel dès le premier jour.

Top comments (0)