DEV Community

Cover image for Qu'est-ce que Gemini 3.6 Flash ?
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

Qu'est-ce que Gemini 3.6 Flash ?

Gemini 3.6 Flash est le nouveau modèle de prédilection de Google, disponible en disponibilité générale depuis le 21 juillet 2026. Il remplace Gemini 3.5 Flash avec une meilleure efficacité en jetons et un coût inférieur, ce qui en fait un choix adapté aux applications qui envoient un trafic API important sans nécessiter un modèle phare.

Essayez Apidog dès aujourd’hui

Ce guide présente les différences avec Gemini 3.5 Flash, les spécifications, les performances, la tarification et une méthode concrète pour tester vos appels API avant une migration.

Qu'est-ce que Gemini 3.6 Flash ?

Gemini 3.6 Flash est le modèle Gemini de milieu de gamme à haut débit de Google. Il cible les charges de production courantes :

  • résumé ;
  • extraction de données ;
  • classification ;
  • chat ;
  • appels d'outils multi-étapes ;
  • workflows agentiques.

Le modèle accepte du texte, des images, de la vidéo, de l'audio et des PDF dans une même requête. Sa sortie reste limitée au texte.

Présentation de Gemini 3.6 Flash

Google l'a lancé le 21 juillet 2026 avec deux autres modèles :

  • Gemini 3.5 Flash-Lite : moins cher et plus rapide pour les tâches à très fort volume ;
  • Gemini 3.5 Flash Cyber : modèle de sécurité cloisonné, accessible uniquement aux gouvernements et partenaires de confiance.

Consultez également :

Gamme des modèles Gemini Flash

Attention au versioning : les nouveaux modèles Flash n'utilisent pas tous le même numéro de version.

gemini-3.6-flash
gemini-3.5-flash-lite
gemini-3.5-flash-cyber
Enter fullscreen mode Exit fullscreen mode

gemini-3.6-flash et gemini-3.5-flash-lite désignent donc bien deux niveaux distincts.

Pour les sources officielles, consultez l'annonce Google et la page Flash de DeepMind.

Ce qui change par rapport à Gemini 3.5 Flash

Gemini 3.6 Flash apporte principalement des gains d'efficacité :

  • environ 17 % de jetons de sortie en moins pour accomplir le même travail ;
  • un prix de sortie réduit de 9,00 $ à 7,50 $ par million de jetons ;
  • de meilleures performances en codage et en utilisation d'ordinateur ;
  • moins d'étapes de raisonnement et moins d'appels d'outils pour les workflows multi-étapes.

Pour un agent, moins d'appels d'outils signifie généralement moins de latence, moins de points de défaillance et un coût total inférieur.

Avant de migrer, comparez vos propres prompts et sorties avec ce guide : Gemini 3.6 Flash vs Gemini 3.5 Flash.

Spécifications de Gemini 3.6 Flash

Attribut Gemini 3.6 Flash
ID du modèle gemini-3.6-flash
Fenêtre de contexte d'entrée 1M jetons
Sortie maximale 64k jetons
Modalités d'entrée Texte, image, vidéo, audio, PDF
Sortie Texte uniquement
Prix d'entrée 1,50 $ par 1M jetons
Prix de sortie 7,50 $ par 1M jetons, jetons de réflexion inclus
Niveau gratuit Oui, via Google AI Studio, avec débit limité
Date de lancement 21 juillet 2026

Deux limites doivent guider votre implémentation :

  1. 1M de jetons en entrée permet d'envoyer de longues transcriptions, de gros documents ou des bases de code dans une requête.
  2. 64k jetons en sortie est le plafond d'une réponse. Pour produire un document très long, découpez votre génération en plusieurs appels.

Performances : comment interpréter les benchmarks

Les benchmarks indiquent des tendances, pas un SLA pour votre application. Voici les résultats publics rapportés par Google :

Benchmark Score
SWE-Bench Pro 58,7 %
DeepSWE v1.1 49 %
Terminal-bench 2.1 78,0 %
OSWorld-Verified 83,0 %
GDPVal-AA v2 Elo 1421

Le gain est particulièrement visible sur OSWorld-Verified, qui mesure l'utilisation d'un bureau et de ses applications :

Gemini 3.5 Flash : 78,4 %
Gemini 3.6 Flash : 83,0 %
Enter fullscreen mode Exit fullscreen mode

Pour les agents qui pilotent de véritables interfaces, ce résultat est plus utile qu'un benchmark de génération de texte généraliste.

Attention aux grands contextes

À 128k jetons, Gemini 3.6 Flash atteint une moyenne de 91,8 % en récupération d'information. À pleine fenêtre de 1M de jetons, la récupération ponctuelle descend à 54,0 %.

En pratique :

  • n'utilisez pas la fenêtre de 1M comme garantie de rappel parfait ;
  • testez les documents à la taille réellement utilisée en production ;
  • ajoutez des tests avec des informations placées au début, au milieu et à la fin du contexte.

Tarification

Gemini 3.6 Flash facture :

Entrée : 1,50 $ / 1M jetons
Sortie : 7,50 $ / 1M jetons
Enter fullscreen mode Exit fullscreen mode

Les jetons de réflexion sont inclus dans le prix de sortie, même s'ils ne figurent pas dans la réponse finale.

La mise en cache contextuelle coûte :

0,15 $ / 1M jetons mis en cache
+ 1,00 $ / 1M jetons / heure de stockage
Enter fullscreen mode Exit fullscreen mode

Elle est utile si vous réutilisez le même gros contexte dans plusieurs requêtes, par exemple un corpus documentaire, des instructions système ou une base de code.

Un niveau gratuit est disponible dans Google AI Studio, mais il est limité en débit et destiné au prototypage. Google peut utiliser les données de ce niveau pour améliorer ses produits.

Pour aller plus loin :

Accéder à Gemini 3.6 Flash

Vous pouvez accéder au modèle par plusieurs canaux :

  • API Gemini, via Google AI Studio ;
  • Google Antigravity, la surface de développement d'agents de Google ;
  • Plateforme d'agents d'entreprise Gemini ;
  • Application Gemini, pour interagir directement avec le modèle.

Pour une intégration applicative, l'API Gemini est le chemin principal.

Le workflow minimal est le suivant :

  1. Créez une clé API dans Google AI Studio.
  2. Configurez votre client HTTP ou SDK.
  3. Définissez le modèle sur gemini-3.6-flash.
  4. Envoyez une requête avec vos contenus d'entrée.
  5. Enregistrez la réponse et les métriques utiles : latence, taille de sortie, erreurs et coût estimé.

Consultez :

Choisir entre Flash-Lite et Flash

La gamme Flash forme une échelle coût-qualité.

Modèle Cas d'usage principal
Gemini 3.5 Flash-Lite Tâches à fort volume et sensibles à la latence
Gemini 3.6 Flash Tâches plus complexes, sorties plus fiables, agents
Modèle phare Raisonnement de pointe, lorsque disponible

Gemini 3.5 Flash-Lite coûte 0,30 $ en entrée et 2,50 $ en sortie par million de jetons. Il fournit environ 350 jetons de sortie par seconde.

Choisissez Flash-Lite pour les classifications, extractions ou transformations répétitives à grande échelle. Préférez Gemini 3.6 Flash lorsque la tâche nécessite une meilleure qualité, du codage ou une orchestration d'outils plus robuste.

Gemini 3.5 Pro n'est pas encore disponible publiquement : Google indique qu'il reste en test avec des partenaires. Google a aussi évoqué une pré-formation de Gemini 4, mais ce modèle n'est pas accessible aujourd'hui.

Pour le contexte historique, consultez Qu'est-ce que Gemini 3.5 ?.

Tester Gemini 3.6 Flash dans Apidog

Les benchmarks et fiches produit ne remplacent pas un test sur vos propres prompts. Testez notamment :

  • vos formats de documents ;
  • vos longueurs de contexte ;
  • vos appels d'outils ;
  • vos contraintes de latence ;
  • les champs JSON que votre application consomme.

Apidog traite l'endpoint Gemini comme n'importe quelle API REST. Voici une procédure de test reproductible.

1. Créer la requête

Créez une requête POST vers l'endpoint Gemini et utilisez le modèle suivant :

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

2. Utiliser une variable d'environnement pour la clé API

Ne collez pas la clé dans l'URL ou dans la collection de requêtes. Utilisez une variable d'environnement, par exemple :

GEMINI_API_KEY
Enter fullscreen mode Exit fullscreen mode

Vous pourrez alors basculer entre les environnements de test et de production sans modifier votre requête.

3. Ajouter des assertions de régression

Après un premier appel valide, enregistrez des contrôles sur les éléments importants :

  • code HTTP attendu ;
  • présence des champs JSON requis ;
  • format de la réponse ;
  • absence de message d'erreur ;
  • latence acceptable pour votre cas d'usage.

Exemples de critères à surveiller :

Status code = 200
La réponse contient le champ de contenu attendu
La réponse ne contient pas d'erreur API
Le format JSON reste compatible avec votre parseur
Enter fullscreen mode Exit fullscreen mode

4. Planifier les tests

Enregistrez cette requête comme test de régression et planifiez son exécution.

Cette approche permet de détecter rapidement :

  • une modification du schéma de réponse ;
  • une régression de latence ;
  • un changement de comportement sur vos prompts ;
  • une incompatibilité après une mise à jour du modèle.

Apidog n'exécute pas le modèle et ne remplace pas un framework d'IA. Il sert à construire, envoyer, vérifier et automatiser vos appels API. Lorsque Google publie une nouvelle mise à jour Flash, vos tests enregistrés indiquent si les comportements sur lesquels vous comptez ont changé.

Téléchargez Apidog pour créer votre première collection de tests API.

FAQ

Gemini 3.6 Flash est-il gratuit ?

Un niveau gratuit est disponible via Google AI Studio, avec un débit limité et pour le prototypage. Google peut utiliser les données de ce niveau pour améliorer ses produits. En production, la facturation est de 1,50 $ par million de jetons d'entrée et 7,50 $ par million de jetons de sortie.

Gemini 3.6 Flash est-il meilleur que Gemini 3.5 Flash ?

Pour la plupart des tâches, oui. Il utilise environ 17 % de jetons de sortie en moins, réduit le prix de sortie de 9,00 $ à 7,50 $ par million de jetons et améliore les résultats en codage et en utilisation d'ordinateur, notamment sur OSWorld-Verified.

Gemini 3.5 Pro est-il disponible ?

Non. Google indique que Gemini 3.5 Pro est encore testé avec des partenaires. Aucun modèle Pro public n'est disponible dans cette version.

Quel est l'ID du modèle ?

gemini-3.6-flash
Enter fullscreen mode Exit fullscreen mode

Ne le confondez pas avec gemini-3.5-flash-lite, qui correspond à un niveau moins cher et distinct.

Que ne peut pas faire Gemini 3.6 Flash ?

Il produit uniquement du texte : il peut lire des images, de l'audio, de la vidéo ou des PDF, mais ne génère pas ces formats. Son rappel diminue à l'approche de la limite de contexte de 1M de jetons. Enfin, il s'agit d'un modèle de milieu de gamme rapide, pas d'un modèle phare pour les tâches de raisonnement les plus exigeantes.

Gemini 3.6 Flash est conçu pour faire tourner une grande partie du trafic API Gemini à un coût inférieur, avec moins de jetons de sortie et de meilleures capacités agentiques que Gemini 3.5 Flash. Avant une migration à grande échelle, créez quelques tests API représentatifs, enregistrez-les et comparez les réponses, la latence et les coûts sur vos propres charges de travail.

Top comments (0)