Gemini 3.8 Flash vs 3.7 Flash : faut-il migrer ?
Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Le prix de lancement reste identique — 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31 décembre — tout comme le contexte d'un million de jetons et une vitesse annoncée comme similaire. La différence principale est le fonctionnement du modèle : raisonnement en étapes plus courtes, vérification de ses propres résultats et appels d'outils itératifs. Les scores progressent, mais chaque tâche peut consommer davantage de jetons.
Essayez Apidog dès aujourd’hui
La vraie question n'est donc pas de savoir si 3.8 Flash est meilleur — sur le papier, oui — mais si le gain de qualité justifie le coût supplémentaire pour votre charge de travail et si votre code supporte les changements d'API.
Google indique que Gemini 3.7 Flash « reste entièrement pris en charge » et n'a annoncé aucune date de dépréciation. La migration n'est pas urgente.
Comparaison rapide
| Critère | Gemini 3.8 Flash | Gemini 3.7 Flash |
|---|---|---|
| ID du modèle | gemini-3.8-flash |
gemini-3.7-flash |
| Date de sortie | 2 septembre 2026 | 13 août 2026 |
| Base | « Basé sur Gemini 3.7 Flash » | — |
| Contexte / sortie maximale | 1 048 576 / 65 536 jetons | Identique |
| Prix d'entrée jusqu'au 31 décembre 2026 | 0,75 $ / million | 0,75 $ / million |
| Prix de sortie jusqu'au 31 décembre 2026 | 3,75 $ / million, réflexion incluse | 3,75 $ / million, réflexion incluse |
| Prix standard à partir du 1er janvier 2027 | 1,50 $ / 7,50 $ | 1,50 $ / 7,50 $ |
| Lecture du cache de contexte | 0,075 $ / million au lancement | Identique |
| Traitement par lots | Réduction de 50 % | Identique |
| Niveaux de réflexion |
low, medium par défaut, high
|
low, medium, high
|
| Niveau minimal | Erreur de validation | Accepté, à mapper vers low
|
| Date limite de connaissance | Mars 2026 | Non précisée dans la documentation 3.8 |
| Vitesse de sortie | Environ 300 jetons/s | Environ la même vitesse |
| Indice d'intelligence Artificial Analysis | 59 | 56 |
| Support | Version actuelle | Entièrement prise en charge |
Ce qui ne change pas
Les deux modèles partagent :
- les mêmes tarifs d'entrée et de sortie ;
- les mêmes limites de contexte et de sortie ;
- la mise en cache du contexte ;
- la réduction de 50 % pour le traitement par lots ;
- les 5 000 requêtes d'ancrage Google Search gratuites par mois, partagées entre les modèles Gemini 3.x ;
- les mêmes modalités d'entrée : texte, image, vidéo, audio et PDF ;
- la sortie texte uniquement ;
- les mêmes API, notamment Interactions et
generateContent.
La vitesse est également proche. Google décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde au niveau high. Le temps avant le premier jeton était toutefois de 13,30 secondes, car le modèle raisonne avant de commencer à répondre.
Le code existant fonctionne généralement après avoir remplacé l'identifiant du modèle par gemini-3.8-flash, sous réserve des changements majeurs décrits plus loin.
Ce qui a été amélioré
Google présente 3.8 Flash comme « notre modèle Flash le plus intelligent », destiné notamment à l'ingénierie logicielle longue, aux agents autonomes et aux workflows d'entreprise complexes.
Sur les tâches difficiles, le modèle :
- effectue davantage d'étapes de raisonnement ;
- découpe ces étapes en unités plus petites ;
- appelle les outils de manière itérative ;
- vérifie son travail en cours d'exécution.
Benchmarks publiés par Google
| Benchmark | 3.8 Flash | 3.7 Flash | Écart |
|---|---|---|---|
| Agent financier Vals v2 | 61,4 % | 59,0 % | +2,4 |
| HLE-Verified | 54,9 % | 53,6 % | +1,3 |
| Benchmark de l'agent juridique Harvey | 10,0 % | 8,8 % | +1,2 |
Les gains sont modestes mais constants. Dans ces trois benchmarks, 3.8 Flash dépasse aussi les modèles plus coûteux présentés dans le tableau de Google, notamment Claude Opus 5 et GPT-5.6 Sol.
Artificial Analysis attribue un indice d'intelligence de 59 à 3.8 Flash au niveau high, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Sur τ³-Banking, son benchmark d'utilisation d'outils, 3.8 Flash atteint 45 %, soit 12 points de plus que 3.7 Flash.
Pour les agents qui utilisent réellement des outils, ce résultat est probablement plus utile que l'indice général.
Workflows documentaires longs
Google affirme que 3.8 Flash accomplit « plus de trois fois plus de tâches que Gemini 3.7 Flash » dans les workflows longs et riches en documents.
Il s'agit d'une évaluation interne, sans harnais public. Elle reste néanmoins cohérente avec la conception du modèle : davantage de vérifications peuvent réduire les erreurs dans une tâche composée de dizaines d'étapes.
Codage : données encore incomplètes
Sur DeepSWE v1.1, Gemini 3.7 Flash a obtenu 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash dépasse la plupart des grands modèles frontières pour une fraction du coût, mais le score exact n'est pas fourni dans le texte de la fiche modèle.
Les résultats textuels de 3.8 Flash pour SWE-Bench Pro, Terminal-Bench et OSWorld ne sont pas publiés. Si ces benchmarks sont déterminants pour votre projet, mesurez-les sur votre propre dépôt ou attendez des évaluations indépendantes.
Sécurité et résistance aux injections
Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan, sans publier de score global.
Les écarts détaillés par rapport à 3.7 Flash sont les suivants :
- sécurité multilingue : +5,4 points ;
- sécurité texte-à-texte : -0,4 point ;
- refus injustifiés : +1,1 point.
Ce dernier résultat indique une légère hausse des refus excessifs.
Le coût réel par tâche en moyenne 48 000 jetons de sortie par tâche, soit 30 % de plus que 3.7 Flash.
| Configuration | Coût par tâche | Temps par tâche |
|---|---|---|
Gemini 3.7 Flash, high
|
0,40 $ | 2,2 min |
Gemini 3.8 Flash, low
|
0,24 $ | 0,8 min |
Gemini 3.8 Flash, medium
|
0,41 $ | Non publié |
Gemini 3.8 Flash, high
|
0,58 $ | 2,5 min |
Trois conclusions pratiques :
-
3.8 Flash en
highcoûte environ 45 % de plus par tâche que 3.7 Flash enhigh, avec 14 % de temps réel supplémentaire. -
3.8 Flash en
mediumcoûte presque autant que 3.7 Flash enhigh. -
3.8 Flash en
lowest à la fois moins cher et plus rapide, ce qui en fait une option intéressante pour les appels sensibles à la latence.
Le niveau de réflexion est donc le principal réglage pour arbitrer qualité, coût et latence.
Deux changements qui cassent le code
1. thinking_level: "minimal" n'est plus accepté
Gemini 3.8 Flash accepte uniquement :
{
"thinkingLevel": "low"
}
Les valeurs disponibles sont :
-
low; -
medium; -
high.
Une configuration 3.7 utilisant minimal renvoie désormais une erreur de validation. Mappez cette valeur vers low avant la migration.
2. Les réponses de fonction doivent inclure call_id et name
Avec l'API Interactions, chaque function_result doit contenir les deux champs :
{
"type": "function_result",
"call_id": "call_123",
"name": "search_database",
"result": {
"items": []
}
}
Avec l'ancien endpoint generateContent, functionResponse doit également renvoyer l'identifiant correspondant et le nom de la fonction.
Un système qui renvoie uniquement les résultats indexés par le nom de la fonction peut échouer au deuxième tour d'une boucle d'outils.
Règles Gemini 3 à revérifier
Le guide de migration recommande également de vérifier les points suivants :
- conserver
temperatureà sa valeur par défaut,1.0; - utiliser
thinking_levelplutôt qu'un entierthinking_budget; - supprimer
candidate_count; - renvoyer les signatures de pensée exactement comme elles ont été reçues.
Ces règles ne sont pas toutes nouvelles avec 3.8, mais une base de code 3.7 qui les ignorait peut révéler ses problèmes lors du changement de modèle.
Matrice de décision
| Charge de travail | Recommandation | Raisons |
|---|---|---|
| Agents multi-étapes avec appels d'outils | Migrer vers medium ou high
|
+12 points sur τ³-Banking et boucles d'outils itératives |
| Extraction et révision de documents longs | Migrer | Le gain annoncé par Google cible précisément ce scénario |
| Codage agentique | Migrer, puis mesurer | Les données textuelles DeepSWE sont encore incomplètes |
| Agents financiers, juridiques et de recherche | Migrer | Les trois benchmarks publiés par Google sont favorables |
| Classification, extraction et chat à gros volume | Rester sur 3.7 ou utiliser 3.8 en low
|
Le coût par tâche est prioritaire |
| Endpoints utilisateur sensibles à la latence | Utiliser 3.8 en low
|
0,8 minute par tâche contre 2,2 minutes pour 3.7 en high
|
Configuration utilisant minimal
|
Migrer d'abord le paramètre | Erreur de validation sans conversion vers low
|
| Pipelines batch au centime près | Rester sur 3.7 jusqu'à une nouvelle évaluation | 30 % de jetons de sortie supplémentaires peuvent augmenter la facture |
En résumé : plus la tâche est longue, difficile et agentique, plus le raisonnement supplémentaire de 3.8 justifie son coût. Pour les tâches courtes et répétitives, le niveau de réflexion et le coût par tâche comptent davantage que le score maximal.
Comparer les deux modèles avec Apidog
Les chiffres d'Artificial Analysis ne reflètent pas nécessairement votre application. Avant de changer le modèle en production, exécutez les mêmes prompts sur Gemini 3.7 Flash et Gemini 3.8 Flash.
Dans Apidog :
- définissez
GEMINI_API_KEYcomme variable d'environnement ; - définissez
modelcomme variable de scénario ; - ajoutez une requête
POSTvers l'endpoint suivant :
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Configurez l'en-tête x-goog-api-key pour utiliser la variable d'environnement, puis utilisez le même corps pour les deux modèles :
{
"contents": [
{
"parts": [
{
"text": "{{golden_prompt}}"
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
}
}
}
Construisez ensuite un scénario en deux étapes :
-
model = gemini-3.7-flash; -
model = gemini-3.8-flash.
Ajoutez des assertions sur :
-
usageMetadata.candidatesTokenCount; -
usageMetadata.thoughtsTokenCount; - le chemin JSON du champ réellement utilisé par votre application.
Utilisez un plafond correspondant à votre budget et exécutez le scénario sur 10 à 20 prompts de référence. Le rapport regroupera les réponses, les nombres de jetons et les résultats des assertions pour les deux modèles.
Une fois les seuils validés, planifiez le scénario afin qu'une augmentation inattendue des jetons de réflexion fasse échouer un test au lieu d'augmenter silencieusement votre facture. Le plan gratuit d'Apidog couvre ce workflow.
FAQ
Gemini 3.8 Flash est-il plus rapide que 3.7 Flash ?
Pas nécessairement. Google parle d'une vitesse « environ identique » et Artificial Analysis mesure environ 300 jetons par seconde au niveau high.
Le temps total par tâche augmente toutefois avec le raisonnement supplémentaire : 2,5 minutes pour 3.8 Flash en high, contre 2,2 minutes pour 3.7 Flash en high. En low, 3.8 Flash descend à 0,8 minute.
Gemini 3.8 Flash coûte-t-il plus cher ?
Pas par jeton. Les deux modèles coûtent 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $.
Le coût par tâche est différent : Artificial Analysis mesure 0,58 $ pour 3.8 Flash en high, contre 0,40 $ pour 3.7 Flash en high, principalement parce que 3.8 Flash produit environ 30 % de jetons supplémentaires.
Google va-t-il arrêter Gemini 3.7 Flash ?
Non. Google indique que 3.7 Flash reste entièrement pris en charge et n'a communiqué aucune date de fin de vie.
Qu'est-ce qui risque de ne plus fonctionner ?
Deux éléments principaux :
-
thinking_level: "minimal"renvoie une erreur400 INVALID_ARGUMENT; - chaque réponse de fonction doit contenir l'identifiant d'appel et
name.
Le reste de l'API Gemini 3 reste inchangé.
Comment ce changement se compare-t-il à celui de 3.6 vers 3.7 ?
La progression 3.7 était plus marquée sur les données disponibles : DeepSWE est passé de 49,0 % à 65,3 %, tandis que l'indice Artificial Analysis est passé de 52 à 56.
Le passage à 3.8 apporte trois points supplémentaires sur cet indice et modifie surtout la manière dont le modèle consomme les jetons. Consultez aussi Gemini 3.6 Flash vs 3.5 Flash pour l'évolution précédente.
Conclusion
Migrez vers Gemini 3.8 Flash si vos workflows sont agentiques, utilisent de nombreux outils ou traitent de longs documents. C'est dans ces scénarios que les benchmarks publiés montrent les gains les plus intéressants.
Pour les appels courts et répétitifs, restez sur 3.7 Flash ou utilisez 3.8 Flash en low. Dans tous les cas :
- convertissez
minimalenlow; - vérifiez les réponses de fonction ;
- mesurez les jetons sur vos propres prompts ;
- comparez le coût par tâche avant de migrer toute la production.
Sources et références
- Billet de lancement de Google
- Nouveautés de Gemini 3.8 Flash
- Qu'est-ce que Gemini 3.8 Flash ?
- Tarification Gemini
- Référence des spécifications et tarifs de Gemini 3.7 Flash
- Page DeepMind Flash
- Comparaison Gemini 3.8 Flash, Claude Fable 5.1 et GPT-5.6 Sol
- Analyse indépendante d'Artificial Analysis
- Fiche modèle Gemini 3.8 Flash
- Tarification détaillée de Gemini 3.8 Flash
- Niveaux de réflexion
- Guide de migration de 3.7 vers 3.8 Flash
- Apidog
- Planifier des tests API avec Apidog
- Télécharger Apidog
- Nouveautés de Gemini 3.7 Flash
- Gemini 3.6 Flash vs Gemini 3.5 Flash
Top comments (0)