DEV Community

Cover image for Qu'est-ce que Gemini 3.8 Flash ?
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

Qu'est-ce que Gemini 3.8 Flash ?

Gemini 3.8 Flash : prix, performances et intégration API

Gemini 3.8 Flash est le nouveau modèle Flash de Google, lancé le 2 septembre 2026 avec son jumeau de sécurité contrôlé, Gemini 3.8 Flash Cyber. Il s’agit de la troisième version Flash en six semaines, après Gemini 3.6 Flash le 21 juillet et Gemini 3.7 Flash le 13 août. Son prix de lancement est identique à celui de 3.7 Flash : 0,75 $ par million de jetons d’entrée et 3,75 $ par million de jetons de sortie jusqu’au 31 décembre 2026.

Essayez Apidog dès aujourd’hui

Gemini 3.8 Flash

Google présente Gemini 3.8 Flash comme « son modèle Flash le plus intelligent », conçu pour l’ingénierie logicielle à long terme, les agents autonomes et les flux de travail d’entreprise complexes.

Le changement principal concerne le comportement du modèle. Gemini 3.8 Flash effectue de petites étapes de raisonnement, vérifie son travail et appelle les outils de manière itérative. Il peut donc utiliser davantage de jetons par tâche, en particulier avec un niveau de réflexion élevé.

Artificial Analysis a mesuré environ 30 % de jetons de sortie supplémentaires par rapport à Gemini 3.7 Flash. Le prix par jeton reste stable, mais le coût par tâche augmente.

Gemini 3.8 Flash en un coup d’œil

Spécification Valeur
ID du modèle API gemini-3.8-flash — stable, sans suffixe de prévisualisation
Date de sortie 2 septembre 2026
Modèle de base Gemini 3.7 Flash, selon la fiche modèle DeepMind
Fenêtre de contexte 1 048 576 jetons d’entrée
Sortie maximale 65 536 jetons
Modalités d’entrée Texte, image, vidéo, audio, PDF
Modalités de sortie Texte uniquement
Niveaux de réflexion low, medium par défaut, high ; minimal renvoie une erreur
Prix de lancement 0,75 $ entrée / 3,75 $ sortie par million de jetons jusqu’au 31 décembre 2026
Prix standard 1,50 $ entrée / 7,50 $ sortie par million de jetons à partir du 1er janvier 2027
Mise en cache du contexte 0,075 $ par million de jetons mis en cache au lancement, puis 0,15 $
API par lots Réduction de 50 % : 0,375 $ entrée / 1,875 $ sortie au lancement
Date limite de connaissance Mars 2026
Disponibilité développeur API Gemini, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Disponibilité grand public Application Gemini pour les abonnés AI Pro et Ultra, Mode AI dans la Recherche, Gemini dans Google Sheets
Statut de Gemini 3.7 Flash Entièrement pris en charge, sans date de fin de support

Trois détails sont importants :

  • medium est le niveau de réflexion par défaut, contrairement à Gemini 3 Pro qui utilise high.
  • minimal renvoie une erreur de validation au lieu d’être converti automatiquement en low. Consultez le guide des niveaux de réflexion.
  • La date limite de connaissance est mars 2026, mais la fiche modèle précise que certaines catégories peuvent être limitées à janvier 2025.

Un raffinement de Gemini 3.7 Flash

Flash est la famille de modèles Google destinée à la majorité du trafic de production, tandis que Pro cible les problèmes les plus difficiles. La fiche DeepMind décrit Gemini 3.8 Flash comme basé sur 3.7 Flash, et non comme un nouveau modèle de base.

Il s’agit donc d’un successeur optimisé pour l’ingénierie logicielle et les agents autonomes.

Le calendrier de sortie est inhabituel :

  • Gemini 3.6 Flash : 21 juillet, à 1,50 $ / 7,50 $ ;
  • Gemini 3.7 Flash : 13 août, au prix de lancement de 0,75 $ / 3,75 $ ;
  • Gemini 3.8 Flash : 2 septembre, au même prix de lancement.

Google parle de sa « troisième version Flash en six semaines ». Artificial Analysis compte toutefois quatre modèles Flash en moins de quatre mois en incluant 3.5 Flash-Lite.

Aucun Gemini 3.8 Pro, Gemini 4 ou nouveau Flash-Lite n’a été lancé avec cette version. Google n’a pas non plus annoncé de date pour une mise à jour de Pro. Le billet consacré aux nouveautés de Gemini 3.7 Flash décrit déjà la génération précédente.

« Travailler plus dur » : le compromis coût-performance

Sur les tâches complexes, Google indique que Gemini 3.8 Flash :

  • exécute des étapes de raisonnement supplémentaires ;
  • divise le travail en étapes plus petites ;
  • vérifie ses résultats en cours de route ;
  • appelle les outils de manière itérative.

Le modèle peut donc consommer davantage de jetons « par conception », surtout avec un niveau d’effort élevé.

Dans son rapport indépendant, Artificial Analysis a mesuré les résultats suivants avec son Index d’Intelligence :

Niveau de réflexion Coût moyen par tâche Temps moyen par tâche
high 0,58 $ 2,5 minutes
medium 0,41 $
low 0,24 $ 0,8 minute

Avec high, Gemini 3.8 Flash génère en moyenne 48 000 jetons de sortie par tâche, soit 30 % de plus que Gemini 3.7 Flash. Le coût moyen passe ainsi d’environ 0,40 $ à 0,58 $ par tâche.

Le niveau medium ramène le coût à 0,41 $, proche du coût de Gemini 3.7 Flash en high. En low, le coût tombe à 0,24 $.

Le niveau de réflexion doit donc être traité comme un paramètre de routage :

  • low pour les points de terminaison sensibles à la latence ;
  • medium pour les agents qui doivent terminer des tâches complexes ;
  • high pour les flux où la qualité justifie davantage de jetons.

La répartition détaillée des prix montre l’impact sur 1 000 tâches d’agent par jour.

La vitesse globale reste comparable à celle de 3.7 Flash. Logan Kilpatrick, de Google, décrit 3.8 Flash comme ayant « le même prix et à peu près la même vitesse ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde avec high.

Le délai de 13,30 secondes avant le premier jeton correspond au raisonnement initial du modèle, et non à un ralentissement du réseau.

Benchmarks

Google a publié trois tableaux de benchmarks sur sa page DeepMind Flash :

Benchmark Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Agent financier Vals v2 61,4 % 59,0 % 58,6 % 53,8 % 54,4 % 53,9 %
Benchmark d’agent légal Harvey 10,0 % 8,8 % 6,7 % 2,5 % 0,8 % 5,0 %
HLE vérifié 54,9 % 53,6 % 54,4 % 54,5 % 51,1 % 31,0 %

Les gains par rapport à 3.7 Flash sont de 2,4, 1,2 et 1,3 points. Les résultats finance et juridique placent un modèle au prix Flash devant Opus 5 et GPT-5.6 Sol, plus chers par jeton.

Claude Fable 5.1, lancé la veille, n’apparaît pas dans les tableaux de Google. La comparaison à trois voies utilise donc Opus 5 et Sonnet 5, les entrées Anthropic publiées les plus proches.

Google formule également trois affirmations sans publier les chiffres complets :

  • Sur DeepSWE v1.1, Gemini 3.8 Flash « surpasse la plupart des modèles frontières plus grands » pour « une fraction du coût ». Le pourcentage n’est disponible que dans les tableaux graphiques de la fiche modèle. Gemini 3.7 Flash y avait obtenu 65,3 %.
  • Sur les flux de travail longs et riches en documents, une évaluation interne indique que le modèle accomplit plus de trois fois plus de tâches que Gemini 3.7 Flash.
  • Sur l’injection de prompt Gray Swan, Google rapporte un « bond significatif » sans donner de chiffre.

Les résultats textuels de SWE-Bench Pro, Terminal-bench et OSWorld ne sont pas publiés pour Gemini 3.8 Flash.

Artificial Analysis donne à Gemini 3.8 Flash en high un score de 59, contre 56 pour Gemini 3.7 Flash et 52 pour Gemini 3.6 Flash. Le modèle est à égalité avec GPT-5.6 Sol en very high et Grok 4.6 en medium. Il dépasse GPT-5.6 Terra en max, Claude Fable 5.1 en medium et Muse Spark 1.2 en very high, tous à 57.

Sur le benchmark d’utilisation d’outils τ³-Banking, Gemini 3.8 Flash obtient 45 %, soit 12 points de plus que 3.7 Flash. La comparaison entre Gemini 3.8 et 3.7 Flash met ces gains en regard de la hausse du nombre de jetons par tâche.

Tarification : stable par jeton, plus élevée par tâche

La page officielle de tarification place Gemini 3.8 Flash sur les mêmes lignes que Gemini 3.6 et 3.7 Flash. Les tarifs doublent au 1er janvier 2027.

Élément Jusqu’au 31 déc. 2026 À partir du 1er janv. 2027
Entrée 0,75 $ / 1 M 1,50 $ / 1 M
Sortie, réflexion incluse 3,75 $ / 1 M 7,50 $ / 1 M
Entrée mise en cache 0,075 $ / 1 M 0,15 $ / 1 M
Stockage du cache 0,50 $ / 1 M jetons / heure 1,00 $ / 1 M jetons / heure
Entrée / sortie par lots 0,375 $ / 1,875 $ 0,75 $ / 3,75 $

Les jetons de réflexion sont facturés au tarif de sortie et apparaissent séparément dans usageMetadata.thoughtsTokenCount. Une réponse courte exécutée en high peut donc coûter plus cher qu’une réponse plus longue exécutée en low.

Le grounding Google Search possède son propre compteur :

  • 5 000 requêtes gratuites par mois, partagées entre les modèles Gemini 3.x ;
  • puis 14 $ pour 1 000 requêtes.

AI Studio et l’API proposent un niveau gratuit avec des limites de débit. Google indique que les données du niveau gratuit sont utilisées pour améliorer ses produits. Les limites par modèle sont affichées dans AI Studio.

Les niveaux de facturation sont débloqués ainsi :

  • niveau 1 : associer un compte de facturation ;
  • niveau 2 : 100 $ de dépenses et trois jours d’ancienneté ;
  • niveau 3 : 1 000 $ de dépenses et 30 jours d’ancienneté.

Le guide d’accès gratuit détaille les limites du parcours gratuit. Le guide de l’API par lots explique comment obtenir la réduction de 50 % pour les tâches non urgentes.

Appeler Gemini 3.8 Flash

Google considère désormais l’API Interactions comme la voie principale pour Gemini 3.x. generateContent est considéré comme obsolète, mais reste entièrement pris en charge sans date de fin annoncée.

Une requête Interactions minimale :

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Enter fullscreen mode Exit fullscreen mode

Pour les conversations à plusieurs tours, utilisez previous_interaction_id afin de laisser le serveur conserver l’état.

L’appel de fonction déclare les outils avec un schéma JSON, reçoit une étape function_call, puis attend un function_result contenant :

  • call_id ;
  • name.

Ces deux champs sont obligatoires avec Gemini 3.8 Flash. Dans l’ancien endpoint generateContent, le champ d’identification s’appelle id.

La présentation de l’API couvre REST et Python. Le guide d’appel de fonctions explique les boucles d’outils itératives et les moyens de les limiter.

Migration depuis Gemini 3.7 Flash

Les changements sont limités, mais certains paramètres peuvent provoquer des erreurs :

  • minimal est rejeté ;
  • thinking_budget est remplacé par thinking_level ;
  • candidate_count n’est pas pris en charge ;
  • Google recommande de conserver temperature à sa valeur par défaut de 1.0, car une valeur plus faible peut provoquer des boucles ou dégrader les performances.

Le guide de migration Gemini 3.7 vers 3.8 Flash fournit une checklist et des exemples JSON avant/après.

Limites de Gemini 3.8 Flash

La fiche du modèle précise que les fonctionnalités suivantes ne sont pas prises en charge :

  • génération audio ;
  • API Live ;
  • génération d’images ;
  • segmentation d’images, comme sur les autres modèles Gemini 3.

Les entrées acceptent le texte, les images, la vidéo, l’audio et les PDF, mais la sortie reste exclusivement textuelle.

Si votre produit exige une sortie vocale ou visuelle en temps réel, Gemini 3.8 Flash peut servir de couche de raisonnement et d’appel d’outils, mais pas de pile complète.

Pour du texte à haut débit sans raisonnement lourd, Gemini 3.5 Flash-Lite reste disponible à 0,30 $ / 2,50 $ par million de jetons.

Gemini 3.8 Flash prend en charge :

  • l’appel de fonctions ;
  • les sorties structurées ;
  • la mise en cache du contexte ;
  • l’exécution de code ;
  • le grounding Google Search et Maps ;
  • l’API Batch ;
  • l’utilisation de Computer en prévisualisation.

Gemini 3.8 Flash Cyber : le jumeau contrôlé

Gemini 3.8 Flash Cyber a été lancé le même jour, mais n’est pas ouvert aux inscriptions publiques. L’accès passe exclusivement par le programme Fairwind, destiné aux autorités gouvernementales de confiance, aux opérateurs d’infrastructures critiques et aux mainteneurs de logiciels.

Le programme exige notamment des vérifications d’antécédents et une authentification multifacteur résistante au phishing. Il n’existe :

  • ni API publique ;
  • ni tarification publique ;
  • ni option d’auto-hébergement.

Gemini 3.8 Flash Cyber remplace le pilote limité Gemini 3.5 Flash Cyber.

Google revendique un taux de réussite supérieur à 70 % pour la découverte de vulnérabilités réelles dans 20 langages de programmation. L’équipe de sécurité de Chrome rapporte également 2,6 fois plus de correctifs corrects pour les vulnérabilités de Chrome que les meilleurs modèles commerciaux beaucoup plus grands.

Ces résultats proviennent des rapports de Google. L’explication détaillée de Gemini 3.8 Flash Cyber précise les critères d’éligibilité, les obligations et les implications pour les équipes qui n’auront pas accès au programme.

Tester les requêtes dans Apidog

Le bon test ne consiste pas seulement à vérifier que l’appel renvoie HTTP 200. Comme le coût dépend fortement du nombre de jetons par tâche, mesurez aussi :

  • le nombre de jetons consommés ;
  • usageMetadata.thoughtsTokenCount ;
  • la latence ;
  • les champs JSON utilisés par votre application.

Dans Apidog :

  1. Stockez GEMINI_API_KEY comme variable d’environnement.
  2. Ajoutez les endpoints Interactions et generateContent.
  3. Ajoutez une assertion sur le statut HTTP 200.
  4. Vérifiez les champs JSON attendus.
  5. Ajoutez un plafond sur usageMetadata.thoughtsTokenCount.
  6. Exécutez la même invite avec low, medium et high.
  7. Planifiez le scénario quotidiennement.

Vous obtiendrez ainsi vos propres coûts par niveau, plutôt que de dépendre uniquement des moyennes d’Artificial Analysis.

Les réponses en streaming s’affichent en SSE. C’est utile pour déboguer les résumés de pensées avec includeThoughts: true. Le guide de test SSE explique comment inspecter ces événements.

Une régression du nombre de jetons peut alors faire échouer une assertion avant d’augmenter votre facture. Téléchargez Apidog pour commencer avec le plan gratuit.

FAQ

Gemini 3.8 Flash est-il un nouveau modèle ou une mise à jour de 3.7 Flash ?

La fiche modèle DeepMind indique qu’il est basé sur Gemini 3.7 Flash. Considérez-le comme un successeur optimisé : même prix de lancement, vitesse comparable et même fenêtre de contexte, avec davantage d’étapes de raisonnement et d’appels d’outils sur les tâches difficiles.

Gemini 3.7 Flash reste entièrement pris en charge, sans date de fin de support.

Pourquoi Gemini 3.8 Flash utilise-t-il plus de jetons que 3.7 Flash ?

C’est un choix de conception. Google indique que le modèle peut utiliser davantage de jetons sur les tâches longues et complexes. Artificial Analysis a mesuré 30 % de jetons de sortie supplémentaires dans son index.

Utilisez medium ou low sur les routes qui ne nécessitent pas de raisonnement approfondi. Le guide des niveaux de réflexion détaille les coûts.

Quelle est la fenêtre de contexte ?

Gemini 3.8 Flash accepte 1 048 576 jetons d’entrée et génère jusqu’à 65 536 jetons de sortie. La mise en cache du contexte coûte 0,075 $ par million de jetons jusqu’au 31 décembre 2026.

Puis-je utiliser Gemini 3.8 Flash dans l’application Gemini gratuite ?

La disponibilité de lancement mentionne l’application Gemini pour les abonnés Google AI Pro et Ultra, mais pas le niveau gratuit de l’application.

Les développeurs disposent toutefois d’un niveau gratuit avec des limites de débit dans AI Studio et l’API.

Comment se compare-t-il à Claude Fable 5.1 ?

Artificial Analysis attribue un score de 59 à Gemini 3.8 Flash et de 57 à Claude Fable 5.1. En prix, Claude Fable 5.1 coûte 10 $ / 50 $ par million de jetons, soit environ 13 fois le tarif de lancement de Gemini 3.8 Flash pour l’entrée et la sortie.

L’écart se réduit toutefois lorsque l’on tient compte du nombre réel de jetons consommés par tâche.

Conclusion

Gemini 3.8 Flash est un modèle de production qui consacre davantage de calcul aux tâches difficiles. Le compromis est clair :

  • quelques points supplémentaires sur les benchmarks d’agents ;
  • 12 points de plus sur l’utilisation d’outils ;
  • environ 30 % de jetons de sortie supplémentaires avec un raisonnement élevé.

Si Gemini 3.7 Flash atteint les limites de vos agents, la mise à niveau conserve le même prix par jeton pendant la période de lancement. Pour un chat sensible à la latence, utilisez low ou restez sur Gemini 3.7 Flash, qui est toujours pris en charge.

Commencez par la présentation de l’API, envoyez une première requête depuis Apidog et mesurez le nombre de jetons

Top comments (0)