Google a lancé Gemini 3.7 Flash le 13 août 2026, trois semaines après 3.6 Flash, et le qualifie de « notre modèle de charge de travail le plus intelligent ». Pour piloter une facture d’API, regardez d’abord le tableau des prix : le tarif de lancement de 0,75 $ par million de tokens d’entrée et 3,75 $ par million de tokens de sortie expire le 31 décembre 2026. À partir du 1er janvier 2027, ces tarifs doublent.
Essayez Apidog dès aujourd’hui
Sans modification de code, de trafic ou de prompts, une charge de travail à 790 $ par mois passe à 1 575 $ en janvier. Budgétez donc systématiquement les deux niveaux de prix, et non uniquement le prix de lancement.
Ce guide fournit les calculs pour trois charges de travail, les leviers de réduction de coûts et une méthode pour mesurer les tokens par endpoint. Si vous n’avez pas encore effectué votre premier appel, consultez le guide de démarrage rapide de l’API Gemini 3.7 Flash. Une fois les requêtes en place, Apidog permet d’inspecter usageMetadata dans chaque réponse pour comparer les estimations avec le trafic réel.
TL;DR
- Tarif de lancement : 0,75 $ par million de tokens d’entrée et 3,75 $ par million de tokens de sortie, jusqu’au 31 décembre 2026.
- Tarif standard : à partir du 1er janvier 2027, 1,50 $ pour l’entrée et 7,50 $ pour la sortie. C’est exactement le double.
- Le prix de lancement est la moitié de celui de Gemini 3.6 Flash à son lancement.
- Le modèle accepte le texte, les images, les vidéos, l’audio et les PDF, avec une fenêtre de contexte de 1 million de tokens et une sortie maximale de 64 000 tokens.
- Un chatbot à 10 000 requêtes par jour coûte environ 26 $ par jour au lancement, puis 52,50 $ par jour au tarif standard.
- Les principaux leviers d’optimisation sont : plafonner les sorties, mettre en cache le contexte, traiter les tâches différées par lots et router les requêtes simples vers un modèle plus léger.
Les deux niveaux de prix
Gemini 3.7 Flash a été lancé avec une réduction temporaire, et non avec un prix permanent.
| Niveau | Période | Entrée (par million de tokens) | Sortie (par million de tokens) |
|---|---|---|---|
| Lancement | Du 13 août 2026 au 31 décembre 2026 | 0,75 $ | 3,75 $ |
| Standard | À partir du 1er janvier 2027 | 1,50 $ | 7,50 $ |
Deux conséquences pratiques :
- Le tarif de lancement est la moitié de celui de Gemini 3.6 Flash à son lancement. Si vous migrez depuis 3.6, utilisez le guide de migration de 3.6 vers 3.7 Flash pour préparer vos tests de régression.
- Les tokens de sortie coûtent 5× plus cher que les tokens d’entrée. Réduire une réponse trop longue est donc généralement plus rentable que raccourcir légèrement un prompt système.
Ces tarifs concernent l’API Gemini facturée via une clé AI Studio. Vertex AI utilise la facturation Google Cloud, avec ses propres SKU. Vérifiez toujours les montants actuels sur la page officielle des tarifs Gemini avant de valider un budget.
Calculez le coût de votre charge de travail
Utilisez cette formule pour chaque endpoint :
coût = (tokens_entrée / 1 000 000 × prix_entrée)
+ (tokens_sortie / 1 000 000 × prix_sortie)
Calculez ensuite le coût quotidien, puis multipliez-le par le nombre de jours d’activité.
Charge de travail 1 : chatbot de support
Hypothèses :
- 10 000 requêtes par jour
- 2 000 tokens d’entrée par requête
- 300 tokens de sortie par requête
| Poste | Tokens quotidiens | Coût/jour (lancement) | Coût/jour (standard) |
|---|---|---|---|
| Entrée | 20M | 15,00 $ | 30,00 $ |
| Sortie | 3M | 11,25 $ | 22,50 $ |
| Total | 23M | 26,25 $ | 52,50 $ |
Sur 30 jours, cela représente environ :
- 788 $ par mois au tarif de lancement ;
- 1 575 $ par mois au tarif standard.
Ici, le premier levier est maxOutputTokens : une réponse de support n’a généralement pas besoin de centaines ou milliers de tokens.
Charge de travail 2 : pipeline de documents PDF
Gemini 3.7 Flash lit les PDF nativement. Son score GDP.pdf passe de 22,0 % à 34,0 % par rapport à 3.6 Flash.
Hypothèses :
- 500 documents par jour ;
- 40 000 tokens d’entrée par document ;
- 1 000 tokens de sortie pour un résumé structuré.
| Poste | Tokens quotidiens | Coût/jour (lancement) | Coût/jour (standard) |
|---|---|---|---|
| Entrée | 20M | 15,00 $ | 30,00 $ |
| Sortie | 0,5M | 1,88 $ | 3,75 $ |
| Total | 20,5M | 16,88 $ | 33,75 $ |
Cela donne environ :
- 506 $ par mois au lancement ;
- 1 013 $ par mois à partir de janvier.
Pour cette charge, l’entrée domine. Priorisez la mise en cache des instructions et le traitement par lots des documents non urgents.
Charge de travail 3 : boucle d’agents
Les agents multiplient les appels et font croître le contexte à chaque étape.
Hypothèses :
- 200 tâches par jour ;
- 12 appels de modèle par tâche ;
- 8 000 tokens d’entrée par appel ;
- 400 tokens de sortie par appel.
| Poste | Tokens quotidiens | Coût/jour (lancement) | Coût/jour (standard) |
|---|---|---|---|
| Entrée | 19,2M | 14,40 $ | 28,80 $ |
| Sortie | 0,96M | 3,60 $ | 7,20 $ |
| Total | 20,16M | 18,00 $ | 36,00 $ |
Soit :
- 540 $ par mois au lancement ;
- 1 080 $ par mois au tarif standard.
Une tâche qui passe de 12 à 20 appels coûte environ 67 % plus cher. Instrumentez donc le nombre d’itérations, la taille du contexte et les réessais par tâche.
La limite de sortie de 64 000 tokens borne également le coût maximal d’une sortie : environ 0,24 $ au tarif de lancement et 0,48 $ au tarif standard par appel. Une boucle de réessai qui atteint ce plafond reste coûteuse, même si son coût n’est pas infini.
Positionnement tarifaire de Gemini 3.7 Flash
Les comparaisons entre fournisseurs évoluent vite : utilisez-les comme un repère, pas comme une grille tarifaire durable.
Gemini 3.7 Flash se place dans la catégorie des modèles de production généralistes : moins cher que les modèles de pointe, tout en affichant des résultats tels que 65,3 % sur DeepSWE v1.1 et un Elo de 1588 sur WebDev Arena.
Le contexte du marché compte aussi. Des fournisseurs à bas coût peuvent relever leurs prix : DeepSeek l’a fait, un cas analysé dans le guide d’augmentation des prix et d’optimisation des coûts de DeepSeek. Pour Gemini, la hausse est déjà connue : elle est planifiée et datée.
Un prototype à 3 $ devient un prototype à 6 $. En revanche, un pipeline à 10 000 $ mensuels devient un poste à 20 000 $ : prévoyez ce scénario avant janvier.
Cinq façons de réduire les dépenses de tokens
1. Plafonnez la sortie par endpoint
Définissez maxOutputTokens dans generationConfig à la plus petite valeur adaptée à chaque cas d’usage.
{
"generationConfig": {
"maxOutputTokens": 500
}
}
Exemples de plafonds à adapter :
- support client : 300 à 500 tokens ;
- classification : quelques dizaines de tokens ;
- résumé structuré : une limite correspondant au schéma attendu ;
- agent : limite stricte par étape, pas uniquement par tâche.
C’est souvent le levier le plus rentable, car la sortie coûte 5× plus cher que l’entrée.
2. Mettez en cache le contexte statique
Si chaque requête contient les mêmes instructions système, politiques internes ou exemples, vous repayez ces tokens à chaque appel.
La mise en cache du contexte réduit le coût des tokens répétés. Consultez la documentation de l’API Gemini pour la configuration et les tarifs actuels.
Dans le chatbot présenté plus haut, mettre en cache un préfixe statique de 1 500 tokens réduit presque de moitié la facture d’entrée.
3. Traitez les tâches non interactives par lots
Les résumés de documents ou extractions nocturnes n’exigent pas une réponse en moins d’une seconde. Le traitement par lots permet d’échanger de la latence contre un coût réduit.
Réservez ce mode aux charges de travail différées :
- traitement de PDF ;
- enrichissement de catalogues ;
- génération de résumés ;
- extraction de données ;
- évaluations hors ligne.
4. Routez les requêtes simples vers un modèle plus léger
Toutes les requêtes ne nécessitent pas Gemini 3.7 Flash.
Gardez 3.7 Flash pour les cas où ses capacités sont réellement utiles :
- planification multi-étapes ;
- débogage ;
- appels d’outils ;
- raisonnement sur un contexte long.
Routez les tâches plus simples vers un modèle Flash-Lite ou équivalent :
- classification ;
- routage ;
- détection d’intention ;
- extraction courte ;
- validation de format.
5. Prototyppez avec le niveau gratuit
Le quota gratuit AI Studio permet de stabiliser les prompts et les schémas de sortie avant de consommer des tokens facturés. Consultez le guide d’accès gratuit à l’API Gemini pour connaître son périmètre et ses limites.
Suivez les dépenses par endpoint avec Apidog
Un budget est une estimation ; les décomptes usageMetadata sont une mesure.
Chaque réponse Gemini inclut les compteurs de tokens d’entrée et de sortie. Utilisez-les comme des métriques de régression, au même titre que la latence ou les erreurs HTTP.
Dans Apidog, mettez en place ce flux :
- Enregistrez une requête par endpoint de production : chat, résumé de document, étape d’agent, etc.
- Stockez la clé dans une variable d’environnement, par exemple
GEMINI_API_KEY. - Exécutez chaque requête avec des charges utiles réalistes.
- Extrayez les champs suivants de la réponse :
usageMetadata.promptTokenCountusageMetadata.candidatesTokenCount
- Ajoutez des assertions sur les seuils de tokens.
- Réexécutez ces scénarios à chaque modification de prompt, de contexte ou de schéma.
Par exemple, si un endpoint de chat doit rester sous 2 500 tokens d’entrée, faites échouer le scénario au-delà de cette limite. Vous détecterez une régression de coût avant son déploiement.
Multipliez ensuite les décomptes observés par les tarifs de lancement et standard pour obtenir un coût réel par endpoint. Pour structurer cette approche à l’échelle d’un service, consultez le guide de test d’API pour les ingénieurs QA.
FAQ
Quand les tarifs de Gemini 3.7 Flash doublent-ils ?
Le 1er janvier 2027. Le prix passe de 0,75 $ à 1,50 $ par million de tokens d’entrée, et de 3,75 $ à 7,50 $ par million de tokens de sortie.
Gemini 3.7 Flash est-il moins cher que Gemini 3.6 Flash ?
Au lancement, oui. Le tarif de lancement de 3.7 Flash est la moitié de celui de 3.6 Flash à son lancement, tandis que DeepSWE v1.1 passe de 49,0 % à 65,3 %. Consultez la référence rapide de Gemini 3.7 Flash pour la comparaison complète.
Le prix de lancement s’applique-t-il sur Vertex AI ?
Les tarifs de cet article concernent l’API Gemini facturée avec une clé AI Studio. Vertex AI utilise les SKU et les conditions de facturation Google Cloud. Vérifiez les montants dans votre console GCP et sur la page officielle des tarifs.
Qu’est-ce qui est compté dans les tokens d’entrée ?
Tout ce que vous envoyez au modèle : texte, images, vidéo, audio et pages PDF. Les documents longs et les requêtes multimodales peuvent donc rapidement faire croître la facture d’entrée.
Après un appel, consultez usageMetadata pour connaître le décompte réel.
Comment estimer les tokens avant une requête ?
Utilisez l’endpoint countTokens pour mesurer une charge utile sans générer de réponse. Vous pouvez aussi envoyer un échantillon représentatif de requêtes et analyser usageMetadata.
Mesurez toujours avec des données proches de la production : les estimations issues d’autres tokenizers ou d’autres familles de modèles se transfèrent mal.
Où Gemini 3.7 Flash s’intègre dans votre pile
La stratégie pratique est simple :
- Déplacez les charges de travail adaptées vers Gemini 3.7 Flash pendant la période de lancement.
- Mesurez les tokens réels par endpoint.
- Modélisez le coût au tarif standard avant le 1er janvier 2027.
- Gardez 3.7 Flash pour les requêtes complexes.
- Routez les requêtes simples vers des modèles moins coûteux.
- Ajoutez des plafonds de sortie et des alertes de régression de tokens.
Téléchargez Apidog pour centraliser vos requêtes Gemini, environnements, assertions de tokens et vérifications de coûts dans un seul espace de travail.
Top comments (0)