DEV Community

Cover image for Gemini 3.5 Flash-Lite vs 3.6 Flash : lequel choisir ?
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Gemini 3.5 Flash-Lite vs 3.6 Flash : lequel choisir ?

Voici la décision d'emblée : choisissez Gemini 3.5 Flash-Lite pour les tâches simples exécutées à très grand volume, où le coût et la vitesse priment : classification, extraction, réponses de chat courtes, RAG et auto-complétion. Choisissez Gemini 3.6 Flash lorsque la qualité du raisonnement est plus importante que le prix par appel : agents multi-étapes, utilisation d'outils, codage, contrôle d'ordinateur et workflows où une erreur coûte cher.

Essayez Apidog dès aujourd’hui

Les deux modèles ont été lancés dans la mise à jour de la série Flash de Google le 21 juillet 2026. Ils acceptent jusqu'à 1 million de jetons en entrée, mais visent des compromis différents entre coût, vitesse et qualité.

Point important sur la nomenclature : le modèle principal est passé en version 3.6, tandis que Lite est resté en version 3.5. Comparer gemini-3.5-flash-lite à gemini-3.6-flash est donc normal : ce n'est pas une faute de frappe.

La réponse courte

Utilisez Flash-Lite par défaut pour les requêtes simples et fréquentes. Passez à Gemini 3.6 Flash dès que votre tâche exige du raisonnement, des outils ou du code.

Dans une application de production, évitez de choisir un seul modèle pour tous les appels :

  1. envoyez d'abord les requêtes vers Flash-Lite ;
  2. mesurez les réponses insuffisantes ;
  3. redirigez uniquement ces cas vers 3.6 Flash.

Cette approche limite les coûts sans sacrifier la qualité sur les parcours critiques.

Prix et vitesse côte à côte

Attribut Gemini 3.5 Flash-Lite Gemini 3.6 Flash
ID du modèle gemini-3.5-flash-lite gemini-3.6-flash
Prix en entrée 0,30 $ / 1 million de jetons 1,50 $ / 1 million de jetons
Prix en sortie 2,50 $ / 1 million de jetons 7,50 $ / 1 million de jetons
Débit ~350 jetons de sortie/sec Non publié séparément
Fenêtre de contexte 1 million de jetons 1 million de jetons
Niveau gratuit Oui, limité en débit Oui, limité en débit

Flash-Lite est 5 fois moins cher en entrée et 3 fois moins cher en sortie. Google publie un débit d'environ 350 jetons de sortie par seconde pour Flash-Lite, ce qui convient aux interfaces de chat et à l'auto-complétion.

Google ne publie pas de débit distinct pour 3.6 Flash. Toutefois, 3.6 Flash produit environ 17 % moins de jetons de sortie que le 3.5 Flash qu'il remplace, ce qui peut accélérer les workflows multi-étapes malgré un coût unitaire supérieur.

Vérifiez les prix avant de déployer : consultez la page des tarifs de l'API Gemini et cette analyse des tarifs de Gemini 3.6 Flash.

Qualité et benchmarks

L'écart de prix se justifie surtout sur les tâches difficiles et ramifiées.

  • Terminal-Bench 2.1 : Flash-Lite obtient 54, contre 78,0 pour 3.6 Flash.
  • OSWorld-Verified : 3.6 Flash atteint 83,0 pour les tâches d'utilisation d'ordinateur.
  • SWE-Bench Pro : 3.6 Flash atteint 58,7 %.
  • DeepSWE v1.1 : 3.6 Flash atteint 49 %.

L'écart de 24 points sur Terminal-Bench 2.1 indique clairement le positionnement : pour les agents qui enchaînent des étapes, appellent des outils et doivent corriger leurs erreurs, 3.6 Flash est le choix adapté.

Pour les workflows navigateur ou bureau, utilisez 3.6 Flash. Flash-Lite ne cible pas l'utilisation d'ordinateur ni le codage agentique complexe.

Cela ne rend pas Flash-Lite faible : son score de 54 sur Terminal-Bench 2.1 est en nette hausse par rapport aux 31 de la génération Lite précédente. Il est simplement optimisé pour un autre objectif : un raisonnement rapide, économique et suffisamment fiable lorsque la tâche ne se ramifie pas.

La page du modèle Flash de Google et son annonce de lancement présentent la même séparation : un niveau pour le volume, un autre pour la profondeur.

Quel modèle utiliser selon la tâche

Utilisez cette matrice comme point de départ, puis validez-la avec vos propres jeux d'évaluation.

Tâche Meilleure option
Classification ou extraction à grand volume Flash-Lite
Assistant de chat et réponses courtes Flash-Lite
Réponses RAG sur contexte récupéré Flash-Lite
Auto-complétion avec contrainte forte de latence Flash-Lite
Pipelines de recherche exécutés pour chaque requête Flash-Lite
Agents multi-étapes 3.6 Flash
Utilisation d'outils et chaînes d'appels de fonctions 3.6 Flash
Codage et revue de code 3.6 Flash
Utilisation d'ordinateur : navigateur ou bureau 3.6 Flash
Réponses à fort enjeu où les erreurs sont coûteuses 3.6 Flash

La règle pratique est simple :

  • tâche précise + volume élevé = Flash-Lite ;
  • tâche ramifiée + coût d'erreur élevé = 3.6 Flash.

Par exemple :

  • catégoriser des millions de tickets de support : Flash-Lite ;
  • analyser une trace de pile, modifier plusieurs fichiers et ouvrir une pull request : 3.6 Flash.

Si vous migrez depuis l'ancien modèle 3.5 Flash plutôt que depuis Flash-Lite, consultez cette comparaison Gemini 3.6 Flash vs Gemini 3.5 Flash.

Comparer les coûts sur une même charge de travail

Prenons un pipeline quotidien qui envoie 10 millions de jetons en entrée et génère 2 millions de jetons en sortie. C'est un profil courant pour un traitement par lots de résumés ou d'extraction.

Modèle Entrée : 10M Sortie : 2M Total quotidien
Flash-Lite 3,00 $ 5,00 $ 8,00 $
3.6 Flash 15,00 $ 15,00 $ 30,00 $

Dans cet exemple, 3.6 Flash coûte 3,75 fois plus cher : 30,00 $ par jour contre 8,00 $, soit environ 900 $ par mois contre 240 $ au même volume.

Le multiplicateur dépend de votre trafic :

  • les charges intensives en entrée tendent vers un écart de 5x ;
  • les charges intensives en sortie tendent vers un écart de 3x.

Les longues requêtes RAG, les gros documents et les classifications de texte favorisent donc particulièrement Flash-Lite. À l'inverse, une réponse longue, un agent ou un workflow de code peuvent justifier le coût de 3.6 Flash si la qualité évite des erreurs opérationnelles.

Posez-vous cette question avant chaque migration :

L'amélioration de qualité vaut-elle 3 à 4 fois le coût par appel à mon volume réel ?

Pour un pipeline de recherche à grande échelle, la réponse est souvent non. Pour un agent qui modifie du code ou crée un ticket, la réponse est souvent oui.

Comment A/B tester les deux dans Apidog

Ne choisissez pas uniquement à partir des benchmarks. Envoyez vos requêtes de production aux deux modèles, puis comparez la qualité, la latence et le coût.

L'API Gemini est une API REST : vous pouvez donc conserver le même corps de requête et ne changer que l'ID du modèle. Apidog permet de préparer et de rejouer ce test rapidement.

Workflow recommandé

  1. Créez une requête POST vers le point de terminaison Gemini.
  2. Stockez la clé API dans une variable d'environnement Apidog. Ne placez pas la clé dans le corps de requête ni dans votre dépôt Git.
  3. Exécutez la requête avec le modèle suivant :
gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode
  1. Dupliquez la requête.
  2. Modifiez uniquement l'ID du modèle :
gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode
  1. Comparez les réponses, la latence et les erreurs éventuelles.
  2. Ajoutez des assertions : code HTTP, schéma JSON, champs attendus et contenu obligatoire.

Par exemple, pour une extraction structurée, vérifiez au minimum :

- code HTTP = 200
- réponse JSON valide
- champ "category" présent
- champ "confidence" numérique
- valeur de "category" dans la liste autorisée
Enter fullscreen mode Exit fullscreen mode

L'objectif est de remplacer l'impression subjective de « suffisamment bon » par des critères vérifiables.

Une fois les requêtes enregistrées, transformez-les en tests reproductibles. Vous pouvez planifier les tests API dans Apidog pour détecter les changements de latence ou de comportement après une mise à jour de modèle.

Apidog envoie les requêtes et vérifie vos assertions, mais ne décide pas quelle réponse est la plus intelligente. Définissez donc un jeu de cas réels, des critères d'acceptation et un taux d'échec maximal avant de choisir un routage par défaut.

Pour démarrer, téléchargez Apidog et créez deux requêtes Gemini identiques.

FAQ

Flash-Lite est-il simplement une version moins bonne de 3.6 Flash ?

Non. C'est un point différent sur la courbe coût, qualité et vitesse. Flash-Lite est plus rapide et moins cher, avec une limite plus basse sur le raisonnement complexe. Pour les tâches simples à grand volume, c'est souvent le meilleur choix précisément grâce à ce compromis.

Pourquoi l'un est-il en version 3.5 et l'autre en version 3.6 ?

Google a fait passer le modèle Flash principal en 3.6, tout en conservant le niveau Lite en 3.5. La même mise à jour incluait aussi un modèle de sécurité 3.5 Flash Cyber. Le numéro 3.5 de Flash-Lite ne signifie pas qu'il est abandonné.

Ont-ils la même fenêtre contextuelle ?

Oui. Les deux acceptent jusqu'à 1 million de jetons en entrée. Ne choisissez donc pas un modèle sur ce critère : choisissez selon le niveau de raisonnement requis, le coût et la vitesse.

Puis-je utiliser les deux dans une même application ?

Oui, et c'est l'approche recommandée. Routez les appels simples et fréquents vers Flash-Lite, puis transférez les requêtes difficiles vers 3.6 Flash. La forme de l'API étant identique, le changement se limite à l'ID du modèle.

Sont-ils gratuits à essayer ?

Les deux disposent d'un niveau gratuit dans Google AI Studio, avec des limites de débit. Google peut utiliser les données du niveau gratuit pour améliorer ses produits : lisez les conditions avant d'envoyer des données sensibles.

En résumé

Utilisez Flash-Lite comme modèle par défaut pour les tâches simples, rapides et économiques à grande échelle. Réservez 3.6 Flash aux appels complexes, ramifiés ou centrés sur le code, où son avance de 24 points sur Terminal-Bench justifie un coût environ 3 à 4 fois plus élevé.

Ne décidez pas dans l'abstrait : testez vos prompts, vos documents et vos critères de qualité sur les deux modèles. Mesurez ensuite la latence, le taux de réussite et le coût par workflow. Apidog permet de réaliser cette comparaison avec deux requêtes identiques.

Top comments (0)