DEV Community

Cover image for Gemini 3.6 Flash : prix et coût réel en 2026
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Gemini 3.6 Flash : prix et coût réel en 2026

Gemini 3.6 Flash coûte 1,50 $ par million de jetons d’entrée et 7,50 $ par million de jetons de sortie. C’est moins cher que le modèle qu’il remplace. Google a lancé cette mise à jour le 21 juillet 2026 : si vous surveillez votre facture d’API, retenez ceci : le niveau Flash, le modèle le plus utilisé, est devenu à la fois plus rapide et moins cher.

Essayez Apidog dès aujourd’hui

Ce guide vous donne les chiffres nécessaires pour établir un budget : tarifs par jeton, coût réel de la mise en cache de contexte, périmètre du niveau gratuit et exemple de calcul mensuel. Les données proviennent de la documentation tarifaire de l’API Gemini et de l’annonce de lancement de Google. Pour un aperçu du modèle, lisez qu’est-ce que Gemini 3.6 Flash.

Note sur les versions : le modèle Flash principal passe en version 3.6, tandis que Flash-Lite reste en version 3.5. Les deux font partie du même lancement, mais leurs numéros de version diffèrent.

Tarification de Gemini 3.6 Flash en un coup d’œil

Élément Coût
Entrée 1,50 $ par million de jetons
Sortie, y compris les jetons de réflexion 7,50 $ par million de jetons
Lecture d’entrée depuis le cache de contexte 0,15 $ par million de jetons
Stockage du cache de contexte 1,00 $ par million de jetons par heure
Niveau gratuit Oui, via Google AI Studio, avec limites de débit

Deux points sont importants pour votre budget :

  1. Les jetons de réflexion sont facturés comme des jetons de sortie. Le raisonnement interne du modèle n’apparaît pas comme une ligne séparée : il est inclus dans les 7,50 $ par million de jetons de sortie.
  2. Le cache de contexte combine lecture et stockage. Vous payez peu pour relire un préfixe mis en cache, mais vous payez également son stockage à l’heure. Le cache devient intéressant lorsque le même contexte est réutilisé fréquemment.

Comparaison avec Gemini 3.5 Flash

Le tarif de sortie passe de 9,00 $ par million de jetons avec Gemini 3.5 Flash à 7,50 $ avec Gemini 3.6 Flash, soit environ 17 % de moins par jeton de sortie.

Selon la page du modèle Flash de DeepMind, Gemini 3.6 Flash produit également environ 17 % de jetons de sortie en moins pour une même tâche. Le modèle raisonne en moins d’étapes et effectue moins d’appels d’outils dans les workflows multi-étapes.

Vous bénéficiez donc de deux effets cumulés :

  • un prix inférieur par jeton de sortie ;
  • moins de jetons de sortie générés.

Si vous utilisez encore l’ancien modèle comme référence, consultez la répartition des prix de Gemini 3.5 Flash. Pour comparer les fonctionnalités et les performances, lisez également Gemini 3.6 Flash vs 3.5 Flash.

Ce que le niveau gratuit vous offre

Un niveau gratuit est disponible via Google AI Studio. Vous pouvez appeler Gemini 3.6 Flash sans carte bancaire pour prototyper et tester vos prompts.

Avant de l’utiliser, tenez compte de ces limites :

  • le débit est limité : il convient au prototypage et aux tests légers, pas au trafic de production ;
  • Google peut utiliser les données du niveau gratuit pour améliorer ses produits ;
  • les données sensibles, propriétaires ou client ne doivent donc pas être envoyées via ce niveau.

Pour passer en production, utilisez une clé payante adaptée aux conditions de traitement de vos données. Pour les étapes de configuration, consultez comment utiliser Gemini 3.6 Flash gratuitement.

Calculer un coût mensuel : exemple détaillé

Prenons un agent qui lit beaucoup et écrit peu :

  • 2 millions de jetons d’entrée par jour ;
  • 500 000 jetons de sortie par jour.

C’est un profil courant pour un assistant RAG qui traite des documents et renvoie des réponses relativement courtes.

Coût quotidien avec Gemini 3.6 Flash

Entrée : 2 000 000 / 1 000 000 × 1,50 $ = 3,00 $

Sortie : 500 000 / 1 000 000 × 7,50 $ = 3,75 $

Total quotidien = 6,75 $
Total mensuel sur 30 jours = 202,50 $
Enter fullscreen mode Exit fullscreen mode

Comparaison de la sortie avec Gemini 3.5 Flash

Supposons que cette même tâche générait auparavant 600 000 jetons de sortie avec Gemini 3.5 Flash. Une baisse d’environ 17 % ramène ce volume à environ 500 000 jetons avec Gemini 3.6 Flash.

Sortie Gemini 3.5 Flash :
600 000 / 1 000 000 × 9,00 $ = 5,40 $ par jour

Sortie Gemini 3.6 Flash :
500 000 / 1 000 000 × 7,50 $ = 3,75 $ par jour
Enter fullscreen mode Exit fullscreen mode

L’économie est de :

5,40 $ - 3,75 $ = 1,65 $ par jour
1,65 $ × 30 jours = 49,50 $ par mois
Enter fullscreen mode Exit fullscreen mode

La facture de sortie baisse donc d’environ 31 % dans cet exemple. La baisse du prix et la baisse du volume de jetons se multiplient.

Flash-Lite est encore moins cher

Pour les tâches simples et volumineuses, Gemini 3.5 Flash-Lite est moins cher :

Élément Coût
Entrée 0,30 $ par million de jetons
Sortie 2,50 $ par million de jetons
Lecture depuis le cache 0,03 $ par million de jetons
Stockage du cache 1,00 $ par million de jetons par heure

Flash-Lite produit environ 350 jetons de sortie par seconde. Avec la même charge de travail que l’exemple précédent — 2 millions de jetons d’entrée et 500 000 jetons de sortie par jour — le coût est :

Entrée : 2 × 0,30 $ = 0,60 $
Sortie : 0,5 × 2,50 $ = 1,25 $

Total quotidien = 1,85 $
Total mensuel sur 30 jours = 55,50 $
Enter fullscreen mode Exit fullscreen mode

C’est environ 70 % moins cher que Gemini 3.6 Flash à volume de jetons identique.

Utilisez Flash-Lite pour :

  • la classification ;
  • l’extraction de champs ;
  • le routage de requêtes ;
  • les réponses courtes et structurées ;
  • les traitements à grand volume et faible complexité.

Réservez Gemini 3.6 Flash aux tâches qui demandent davantage de raisonnement multi-étapes. Pour aller plus loin, consultez qu’est-ce que Gemini 3.5 Flash-Lite, puis Gemini 3.5 Flash-Lite vs 3.6 Flash.

Comment contrôler et mesurer vos coûts

Voici quatre leviers concrets pour réduire votre facture.

1. Mettez en cache le contexte répété

Si chaque requête contient une longue instruction système ou les mêmes documents de référence, utilisez le cache de contexte.

  • Entrée standard : 1,50 $ par million de jetons.
  • Lecture depuis le cache : 0,15 $ par million de jetons.
  • Stockage : 1,00 $ par million de jetons par heure.

Le cache est rentable lorsque vous réutilisez souvent le même préfixe dans une période courte. Ne le conservez pas pour une seule requête isolée.

2. Réduisez vos prompts et bornez la sortie

La sortie coûte cinq fois plus cher que l’entrée. Appliquez donc ces règles :

  • supprimez les instructions répétées ou obsolètes ;
  • envoyez uniquement les extraits de documents nécessaires ;
  • limitez le nombre maximal de jetons de sortie ;
  • demandez un format structuré lorsque c’est possible.

Par exemple, préférez une réponse JSON concise à une explication longue si votre application consomme des données structurées.

3. Routez les tâches simples vers Flash-Lite

Ne choisissez pas un seul modèle pour toutes vos requêtes. Créez un routeur simple :

Classification, extraction, formatage → Flash-Lite
Raisonnement multi-étapes, tâches complexes → Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Ce routage mixte est souvent plus rentable qu’un usage uniforme de Gemini 3.6 Flash.

4. Mesurez les jetons réellement consommés

Les estimations ne suffisent pas. Chaque réponse Gemini contient le champ usageMetadata, qui indique l’usage réel des jetons d’entrée, de sortie et de réflexion.

Contrôlez ce champ dans vos tests :

{
  "usageMetadata": {
    "promptTokenCount": 0,
    "candidatesTokenCount": 0,
    "totalTokenCount": 0
  }
}
Enter fullscreen mode Exit fullscreen mode

Utilisez ces valeurs pour calculer vos coûts réels et détecter les régressions. Une modification de prompt qui double les jetons de sortie doit être traitée comme une régression de coût.

Dans Apidog, vous pouvez créer une requête POST vers l’API Gemini, stocker la clé API dans une variable d’environnement et inspecter usageMetadata directement dans la réponse. Ajoutez des assertions sur le volume de jetons afin qu’un changement de prompt coûteux échoue dans vos tests au lieu d’augmenter silencieusement votre facture.

Vous pouvez aussi planifier ces tests d’API pour détecter les régressions de coûts régulièrement. Pour démarrer, téléchargez Apidog et testez une requête Gemini avec vos prompts réels avant l’intégration en production.

FAQ

Combien coûte Gemini 3.6 Flash par million de jetons ?

L’entrée coûte 1,50 $ et la sortie coûte 7,50 $ par million de jetons. Les lectures depuis le cache coûtent 0,15 $ par million de jetons, auxquels s’ajoutent 1,00 $ par million de jetons par heure de stockage.

Le prix de sortie inclut-il les jetons de réflexion ?

Oui. Le raisonnement du modèle est facturé au tarif de sortie de 7,50 $ par million de jetons. Il n’existe pas de ligne tarifaire distincte pour les jetons de réflexion, mais ils augmentent votre volume total de sortie.

Existe-t-il un niveau gratuit ?

Oui, via Google AI Studio, avec des limites de débit. Il est adapté au prototypage et aux tests, mais pas à la production. Google pouvant utiliser les données du niveau gratuit pour améliorer ses produits, évitez d’y envoyer des données sensibles.

Gemini 3.6 Flash est-il moins cher que Gemini 3.5 Flash ?

Oui. Le prix de sortie passe de 9,00 $ à 7,50 $ par million de jetons. Gemini 3.6 Flash génère également environ 17 % de jetons de sortie en moins pour une même tâche, ce qui peut réduire la facture de sortie d’environ 31 % dans les cas comparables.

Quand utiliser Flash-Lite ?

Utilisez Flash-Lite lorsque la tâche est simple et le volume élevé : classification, extraction, routage et réponses structurées courtes. À 0,30 $ en entrée et 2,50 $ en sortie, il est environ 70 % moins cher que Gemini 3.6 Flash pour le même nombre de jetons.

Gemini 3.6 Flash combine baisse de prix et réduction du volume de sortie. Pour établir votre budget, partez de 1,50 $ par million de jetons d’entrée et 7,50 $ par million de jetons de sortie, puis mesurez vos appels réels via usageMetadata. Utilisez le cache pour les contextes répétés et routez les tâches simples vers Flash-Lite.

Pour un point de comparaison historique, consultez la ventilation des coûts de l’API Gemini 3.0. Enfin, mesurez vos requêtes dans Apidog afin que votre prévision de jetons corresponde à votre facture réelle.

Top comments (0)