DEV Community

Cover image for Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

Gemini 3.8 Flash vs 3.7 Flash : Nouveautés et faut-il mettre à jour ?

Gemini 3.8 Flash vs 3.7 Flash : faut-il migrer ?

Google a lancé Gemini 3.8 Flash le 2 septembre 2026, trois semaines après Gemini 3.7 Flash et six semaines après 3.6 Flash. Le prix de lancement reste identique — 0,75 $ en entrée et 3,75 $ en sortie par million de jetons jusqu'au 31 décembre — tout comme le contexte d'un million de jetons et une vitesse annoncée comme similaire. La différence principale est le fonctionnement du modèle : raisonnement en étapes plus courtes, vérification de ses propres résultats et appels d'outils itératifs. Les scores progressent, mais chaque tâche peut consommer davantage de jetons.

Essayez Apidog dès aujourd’hui

La vraie question n'est donc pas de savoir si 3.8 Flash est meilleur — sur le papier, oui — mais si le gain de qualité justifie le coût supplémentaire pour votre charge de travail et si votre code supporte les changements d'API.

Google indique que Gemini 3.7 Flash « reste entièrement pris en charge » et n'a annoncé aucune date de dépréciation. La migration n'est pas urgente.

Comparaison rapide

Critère Gemini 3.8 Flash Gemini 3.7 Flash
ID du modèle gemini-3.8-flash gemini-3.7-flash
Date de sortie 2 septembre 2026 13 août 2026
Base « Basé sur Gemini 3.7 Flash »
Contexte / sortie maximale 1 048 576 / 65 536 jetons Identique
Prix d'entrée jusqu'au 31 décembre 2026 0,75 $ / million 0,75 $ / million
Prix de sortie jusqu'au 31 décembre 2026 3,75 $ / million, réflexion incluse 3,75 $ / million, réflexion incluse
Prix standard à partir du 1er janvier 2027 1,50 $ / 7,50 $ 1,50 $ / 7,50 $
Lecture du cache de contexte 0,075 $ / million au lancement Identique
Traitement par lots Réduction de 50 % Identique
Niveaux de réflexion low, medium par défaut, high low, medium, high
Niveau minimal Erreur de validation Accepté, à mapper vers low
Date limite de connaissance Mars 2026 Non précisée dans la documentation 3.8
Vitesse de sortie Environ 300 jetons/s Environ la même vitesse
Indice d'intelligence Artificial Analysis 59 56
Support Version actuelle Entièrement prise en charge

Ce qui ne change pas

Les deux modèles partagent :

  • les mêmes tarifs d'entrée et de sortie ;
  • les mêmes limites de contexte et de sortie ;
  • la mise en cache du contexte ;
  • la réduction de 50 % pour le traitement par lots ;
  • les 5 000 requêtes d'ancrage Google Search gratuites par mois, partagées entre les modèles Gemini 3.x ;
  • les mêmes modalités d'entrée : texte, image, vidéo, audio et PDF ;
  • la sortie texte uniquement ;
  • les mêmes API, notamment Interactions et generateContent.

La vitesse est également proche. Google décrit 3.8 Flash comme ayant « le même prix que 3.7, et une vitesse similaire ». Artificial Analysis a mesuré 302,1 jetons de sortie par seconde au niveau high. Le temps avant le premier jeton était toutefois de 13,30 secondes, car le modèle raisonne avant de commencer à répondre.

Le code existant fonctionne généralement après avoir remplacé l'identifiant du modèle par gemini-3.8-flash, sous réserve des changements majeurs décrits plus loin.

Ce qui a été amélioré

Google présente 3.8 Flash comme « notre modèle Flash le plus intelligent », destiné notamment à l'ingénierie logicielle longue, aux agents autonomes et aux workflows d'entreprise complexes.

Sur les tâches difficiles, le modèle :

  1. effectue davantage d'étapes de raisonnement ;
  2. découpe ces étapes en unités plus petites ;
  3. appelle les outils de manière itérative ;
  4. vérifie son travail en cours d'exécution.

Benchmarks publiés par Google

Benchmark 3.8 Flash 3.7 Flash Écart
Agent financier Vals v2 61,4 % 59,0 % +2,4
HLE-Verified 54,9 % 53,6 % +1,3
Benchmark de l'agent juridique Harvey 10,0 % 8,8 % +1,2

Les gains sont modestes mais constants. Dans ces trois benchmarks, 3.8 Flash dépasse aussi les modèles plus coûteux présentés dans le tableau de Google, notamment Claude Opus 5 et GPT-5.6 Sol.

Artificial Analysis attribue un indice d'intelligence de 59 à 3.8 Flash au niveau high, contre 56 pour 3.7 Flash et 52 pour 3.6 Flash. Sur τ³-Banking, son benchmark d'utilisation d'outils, 3.8 Flash atteint 45 %, soit 12 points de plus que 3.7 Flash.

Pour les agents qui utilisent réellement des outils, ce résultat est probablement plus utile que l'indice général.

Workflows documentaires longs

Google affirme que 3.8 Flash accomplit « plus de trois fois plus de tâches que Gemini 3.7 Flash » dans les workflows longs et riches en documents.

Il s'agit d'une évaluation interne, sans harnais public. Elle reste néanmoins cohérente avec la conception du modèle : davantage de vérifications peuvent réduire les erreurs dans une tâche composée de dizaines d'étapes.

Codage : données encore incomplètes

Sur DeepSWE v1.1, Gemini 3.7 Flash a obtenu 65,3 %, contre 49,0 % pour 3.6 Flash. Google affirme que 3.8 Flash dépasse la plupart des grands modèles frontières pour une fraction du coût, mais le score exact n'est pas fourni dans le texte de la fiche modèle.

Les résultats textuels de 3.8 Flash pour SWE-Bench Pro, Terminal-Bench et OSWorld ne sont pas publiés. Si ces benchmarks sont déterminants pour votre projet, mesurez-les sur votre propre dépôt ou attendez des évaluations indépendantes.

Sécurité et résistance aux injections

Google signale un « bond significatif » sur les tests d'injection de prompt Gray Swan, sans publier de score global.

Les écarts détaillés par rapport à 3.7 Flash sont les suivants :

  • sécurité multilingue : +5,4 points ;
  • sécurité texte-à-texte : -0,4 point ;
  • refus injustifiés : +1,1 point.

Ce dernier résultat indique une légère hausse des refus excessifs.

Le coût réel par tâche en moyenne 48 000 jetons de sortie par tâche, soit 30 % de plus que 3.7 Flash.

Configuration Coût par tâche Temps par tâche
Gemini 3.7 Flash, high 0,40 $ 2,2 min
Gemini 3.8 Flash, low 0,24 $ 0,8 min
Gemini 3.8 Flash, medium 0,41 $ Non publié
Gemini 3.8 Flash, high 0,58 $ 2,5 min

Trois conclusions pratiques :

  1. 3.8 Flash en high coûte environ 45 % de plus par tâche que 3.7 Flash en high, avec 14 % de temps réel supplémentaire.
  2. 3.8 Flash en medium coûte presque autant que 3.7 Flash en high.
  3. 3.8 Flash en low est à la fois moins cher et plus rapide, ce qui en fait une option intéressante pour les appels sensibles à la latence.

Le niveau de réflexion est donc le principal réglage pour arbitrer qualité, coût et latence.

Deux changements qui cassent le code

1. thinking_level: "minimal" n'est plus accepté

Gemini 3.8 Flash accepte uniquement :

{
  "thinkingLevel": "low"
}
Enter fullscreen mode Exit fullscreen mode

Les valeurs disponibles sont :

  • low ;
  • medium ;
  • high.

Une configuration 3.7 utilisant minimal renvoie désormais une erreur de validation. Mappez cette valeur vers low avant la migration.

2. Les réponses de fonction doivent inclure call_id et name

Avec l'API Interactions, chaque function_result doit contenir les deux champs :

{
  "type": "function_result",
  "call_id": "call_123",
  "name": "search_database",
  "result": {
    "items": []
  }
}
Enter fullscreen mode Exit fullscreen mode

Avec l'ancien endpoint generateContent, functionResponse doit également renvoyer l'identifiant correspondant et le nom de la fonction.

Un système qui renvoie uniquement les résultats indexés par le nom de la fonction peut échouer au deuxième tour d'une boucle d'outils.

Règles Gemini 3 à revérifier

Le guide de migration recommande également de vérifier les points suivants :

  • conserver temperature à sa valeur par défaut, 1.0 ;
  • utiliser thinking_level plutôt qu'un entier thinking_budget ;
  • supprimer candidate_count ;
  • renvoyer les signatures de pensée exactement comme elles ont été reçues.

Ces règles ne sont pas toutes nouvelles avec 3.8, mais une base de code 3.7 qui les ignorait peut révéler ses problèmes lors du changement de modèle.

Matrice de décision

Charge de travail Recommandation Raisons
Agents multi-étapes avec appels d'outils Migrer vers medium ou high +12 points sur τ³-Banking et boucles d'outils itératives
Extraction et révision de documents longs Migrer Le gain annoncé par Google cible précisément ce scénario
Codage agentique Migrer, puis mesurer Les données textuelles DeepSWE sont encore incomplètes
Agents financiers, juridiques et de recherche Migrer Les trois benchmarks publiés par Google sont favorables
Classification, extraction et chat à gros volume Rester sur 3.7 ou utiliser 3.8 en low Le coût par tâche est prioritaire
Endpoints utilisateur sensibles à la latence Utiliser 3.8 en low 0,8 minute par tâche contre 2,2 minutes pour 3.7 en high
Configuration utilisant minimal Migrer d'abord le paramètre Erreur de validation sans conversion vers low
Pipelines batch au centime près Rester sur 3.7 jusqu'à une nouvelle évaluation 30 % de jetons de sortie supplémentaires peuvent augmenter la facture

En résumé : plus la tâche est longue, difficile et agentique, plus le raisonnement supplémentaire de 3.8 justifie son coût. Pour les tâches courtes et répétitives, le niveau de réflexion et le coût par tâche comptent davantage que le score maximal.

Comparer les deux modèles avec Apidog

Les chiffres d'Artificial Analysis ne reflètent pas nécessairement votre application. Avant de changer le modèle en production, exécutez les mêmes prompts sur Gemini 3.7 Flash et Gemini 3.8 Flash.

Dans Apidog :

  1. définissez GEMINI_API_KEY comme variable d'environnement ;
  2. définissez model comme variable de scénario ;
  3. ajoutez une requête POST vers l'endpoint suivant :
https://generativelanguage.googleapis.com/v1beta/models/{{model}}:generateContent
Enter fullscreen mode Exit fullscreen mode

Configurez l'en-tête x-goog-api-key pour utiliser la variable d'environnement, puis utilisez le même corps pour les deux modèles :

{
  "contents": [
    {
      "parts": [
        {
          "text": "{{golden_prompt}}"
        }
      ]
    }
  ],
  "generationConfig": {
    "thinkingConfig": {
      "thinkingLevel": "medium"
    }
  }
}
Enter fullscreen mode Exit fullscreen mode

Construisez ensuite un scénario en deux étapes :

  1. model = gemini-3.7-flash ;
  2. model = gemini-3.8-flash.

Ajoutez des assertions sur :

  • usageMetadata.candidatesTokenCount ;
  • usageMetadata.thoughtsTokenCount ;
  • le chemin JSON du champ réellement utilisé par votre application.

Utilisez un plafond correspondant à votre budget et exécutez le scénario sur 10 à 20 prompts de référence. Le rapport regroupera les réponses, les nombres de jetons et les résultats des assertions pour les deux modèles.

Une fois les seuils validés, planifiez le scénario afin qu'une augmentation inattendue des jetons de réflexion fasse échouer un test au lieu d'augmenter silencieusement votre facture. Le plan gratuit d'Apidog couvre ce workflow.

FAQ

Gemini 3.8 Flash est-il plus rapide que 3.7 Flash ?

Pas nécessairement. Google parle d'une vitesse « environ identique » et Artificial Analysis mesure environ 300 jetons par seconde au niveau high.

Le temps total par tâche augmente toutefois avec le raisonnement supplémentaire : 2,5 minutes pour 3.8 Flash en high, contre 2,2 minutes pour 3.7 Flash en high. En low, 3.8 Flash descend à 0,8 minute.

Gemini 3.8 Flash coûte-t-il plus cher ?

Pas par jeton. Les deux modèles coûtent 0,75 $ en entrée et 3,75 $ en sortie jusqu'au 31 décembre 2026, puis 1,50 $ et 7,50 $.

Le coût par tâche est différent : Artificial Analysis mesure 0,58 $ pour 3.8 Flash en high, contre 0,40 $ pour 3.7 Flash en high, principalement parce que 3.8 Flash produit environ 30 % de jetons supplémentaires.

Google va-t-il arrêter Gemini 3.7 Flash ?

Non. Google indique que 3.7 Flash reste entièrement pris en charge et n'a communiqué aucune date de fin de vie.

Qu'est-ce qui risque de ne plus fonctionner ?

Deux éléments principaux :

  • thinking_level: "minimal" renvoie une erreur 400 INVALID_ARGUMENT ;
  • chaque réponse de fonction doit contenir l'identifiant d'appel et name.

Le reste de l'API Gemini 3 reste inchangé.

Comment ce changement se compare-t-il à celui de 3.6 vers 3.7 ?

La progression 3.7 était plus marquée sur les données disponibles : DeepSWE est passé de 49,0 % à 65,3 %, tandis que l'indice Artificial Analysis est passé de 52 à 56.

Le passage à 3.8 apporte trois points supplémentaires sur cet indice et modifie surtout la manière dont le modèle consomme les jetons. Consultez aussi Gemini 3.6 Flash vs 3.5 Flash pour l'évolution précédente.

Conclusion

Migrez vers Gemini 3.8 Flash si vos workflows sont agentiques, utilisent de nombreux outils ou traitent de longs documents. C'est dans ces scénarios que les benchmarks publiés montrent les gains les plus intéressants.

Pour les appels courts et répétitifs, restez sur 3.7 Flash ou utilisez 3.8 Flash en low. Dans tous les cas :

  1. convertissez minimal en low ;
  2. vérifiez les réponses de fonction ;
  3. mesurez les jetons sur vos propres prompts ;
  4. comparez le coût par tâche avant de migrer toute la production.

Sources et références

Top comments (0)