Il n'existe pas encore d'API publique pour Gemini 4 Argon, et Google n'a publié aucun ID de modèle. Annoncé le 30 septembre 2026, Argon est aujourd'hui réservé aux défenseurs du programme Fairwind et utilisé par certains partenaires comme modèle géré dans Gemini Enterprise. Artificial Analysis répertorie Google AI Studio comme seul fournisseur d'API, sans données de vitesse ni de latence : cela correspond davantage à un accès sur liste blanche pré-commerciale qu'à une API accessible par inscription. Google indique que le déploiement plus large commencera avec les clients API payants et les abonnés Google AI Ultra.
Essayez Apidog dès aujourd'hui
Cette période d'attente est utile pour préparer votre intégration. Ce guide distingue les éléments confirmés de ceux qui restent inconnus, puis montre comment construire dès maintenant un client compatible avec Gemini 3.8 Flash. L'objectif : basculer vers Argon en changeant une variable d'environnement lorsque Google publiera son ID. Vous allez préparer les requêtes, surveiller la disponibilité du modèle, simuler des réponses dans Apidog et appliquer un plafond de coût. Pour le contexte produit, consultez ce qu'est Gemini 4 Argon et le guide de la date de sortie de Gemini 4 Argon.
Ce qui est confirmé à propos de l'API Gemini 4 Argon
Le billet de lancement de Google confirme les prix et une limite de sortie. Les autres paramètres nécessaires à une intégration ne sont pas encore publiés.
| Élément | Statut | Détail |
|---|---|---|
| Prix d'entrée | Confirmé | 2 $ par 1M de jetons pendant l'introduction, puis 4 $ |
| Prix de sortie | Confirmé | 10 $ par 1M de jetons pendant l'introduction, puis 20 $ |
| Entrée en cache | Confirmé | Réduction de 95 % : 0,10 $ en introduction, 0,20 $ au tarif standard |
| Limite de sortie | Confirmé | Jusqu'à 1M de jetons, contre 64K auparavant |
| Surface d'API | Signalé | Les nouveaux modèles devraient être lancés via l'API Interactions |
| ID de modèle | Non publié | Absent de la page des modèles, des prix et du journal des modifications |
| Fenêtre de contexte d'entrée | Non publié | Google a testé des invites jusqu'à 1M de jetons, sans en faire une spécification |
| Niveaux de réflexion | Non publié | Les évaluations utilisent les paramètres de réflexion les plus élevés, sans noms ni valeurs par défaut |
| Limites de débit | Non publié | Aucun palier annoncé |
| Lots | Non publié | Aucun prix pour Batch ou Flex |
| Palier d'invite longue | Non publié | La règle appliquée à Argon au-delà d'un seuil n'est pas précisée |
| Durée de l'introduction | Non publié | Pas de date de fin pour les tarifs 2 $ / 10 $ |
Deux points doivent guider l'implémentation :
- Les documents de l'API Interactions indiquent que les nouveaux modèles seront lancés sur cette API. Traitez donc Interactions comme le chemin principal.
- La limite annoncée est de 1M de jetons en sortie, mais Vals AI indique une sortie maximale de 262K pour la configuration testée. Vérifiez
outputTokenLimitavant de supposer que chaque endpoint expose le million complet.
Le guide sur les 1M de jetons de sortie couvre les conséquences pour le streaming, les délais d'attente et le stockage.
Calculer le coût d'une requête
Avec une invite de 20 000 jetons et une sortie de 5 000 jetons :
Entrée : 20 000 × 2 $ / 1M = 0,04 $
Sortie : 5 000 × 10 $ / 1M = 0,05 $
Total : 0,09 $ au tarif d'introduction
Au tarif standard de 4 $ / 20 $, cette même requête coûte 0,18 $. Le prix de sortie d'introduction d'Argon est inférieur à celui de Gemini 3.1 Pro Preview (12 $) et son prix standard correspond à Claude Opus 5.5. Consultez la ventilation des prix de Gemini 4 Argon pour les scénarios incluant le cache et les réponses longues.
Ne codez pas en dur un ID de modèle trouvé en ligne
Les chaînes trouvées sur des sites de benchmark, des agrégateurs ou des pull requests ne sont pas des IDs officiels. Certaines sont explicitement temporaires ; d'autres renvoient vers des pages inexistantes. Google n'a confirmé aucun ID Argon.
Évitez deux risques :
- une erreur
404au moment du déploiement ; - un repli silencieux vers un autre modèle si votre wrapper capture les erreurs trop largement.
Placez le modèle dans une variable d'environnement. Tous les exemples suivants utilisent GEMINI_MODEL, avec gemini-3.8-flash comme valeur par défaut :
export GEMINI_MODEL=gemini-3.8-flash
export GEMINI_API_KEY="votre-cle-api"
Lorsque Google publiera l'ID Argon, vous ne modifierez que GEMINI_MODEL.
Préparez votre code sur Gemini 3.8 Flash
Gemini 3.8 Flash (gemini-3.8-flash) utilise les mêmes endpoints, en-têtes et structures de réponse que ceux attendus pour Argon. Son prix est de 0,75 $ en entrée et 3,75 $ en sortie par 1M de jetons jusqu'au 31 décembre 2026.
Stockez votre clé dans GEMINI_API_KEY, jamais dans le code source. La configuration complète est détaillée dans le guide de l'API Gemini 3.8 Flash.
Étape 1 : envoyer une requête à l'API Interactions
Conservez le modèle et le niveau de réflexion dans des variables : les niveaux compatibles avec Argon ne sont pas publiés.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"
curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"model\": \"${MODEL}\",
\"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
\"generation_config\": {\"thinking_level\": \"${THINKING}\"}
}"
Version Python :
# pip install "google-genai>=2.3.0"
import os
from google import genai
MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")
client = genai.Client() # Lit GEMINI_API_KEY depuis l'environnement
interaction = client.interactions.create(
model=MODEL,
input="List the retry rules a REST client should follow for HTTP 429.",
generation_config={"thinking_level": THINKING},
)
print(interaction.output_text)
Sur Gemini 3.8 Flash, les niveaux acceptés sont low, medium et high. Le niveau minimal renvoie une erreur HTTP 400. Le guide sur les niveaux de réflexion décrit les compromis.
Pour conserver le contexte dans un échange multi-tour :
- transmettez l'ID précédent dans
previous_interaction_id; - envoyez
store: falsesi vous voulez désactiver le stockage côté serveur.
Étape 2 : conserver le chemin generateContent
Le endpoint historique generateContent reste pris en charge. Gardez-le opérationnel tant que Google n'a pas confirmé la compatibilité d'Argon.
curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d "{
\"contents\": [{
\"parts\": [{
\"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
}]
}],
\"generationConfig\": {
\"thinkingConfig\": {
\"thinkingLevel\": \"${THINKING}\"
}
}
}"
La position du niveau de réflexion diffère entre les deux APIs :
| API | Champ |
|---|---|
| Interactions | generation_config.thinking_level |
| generateContent | generationConfig.thinkingConfig.thinkingLevel |
Si votre client prend en charge les deux formats, routez les nouveaux modèles vers Interactions par défaut. Les outils demandent la même vigilance de mapping ; voir l'appel de fonctions Gemini 3.8 Flash.
Étape 3 : surveiller la disponibilité avec models.list
Ne surveillez pas uniquement les annonces. Interrogez l'API avec la même clé que votre application de production.
import os
import sys
import requests
resp = requests.get(
"https://generativelanguage.googleapis.com/v1beta/models",
params={"pageSize": 1000},
headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
timeout=30,
)
resp.raise_for_status()
hits = [
model
for model in resp.json().get("models", [])
if "argon" in model["name"].lower()
]
for model in hits:
print(
model["name"],
"in:", model.get("inputTokenLimit"),
"out:", model.get("outputTokenLimit"),
model.get("supportedGenerationMethods"),
)
sys.exit(1 if hits else 0) # Échec = déclenchement d'alerte
Exécutez ce script toutes les heures dans cron ou dans un pipeline CI planifié. Lorsqu'un résultat apparaît, vous obtenez immédiatement :
- le vrai nom du modèle ;
- sa limite de sortie effective ;
- les méthodes de génération disponibles.
Le 1er octobre 2026, cet appel avec une clé de projet payante renvoyait 61 modèles, sans nextPageToken et sans nom contenant argon.
Étape 4 : simuler la réponse avant d'obtenir l'accès
Vous pouvez construire le client Argon sans Argon. Dans Apidog :
- Enregistrez la requête
generateContentde l'étape 2. - Ajoutez
GEMINI_API_KEYetGEMINI_MODELcomme variables d'environnement. - Exécutez une requête contre Gemini 3.8 Flash.
- Enregistrez la réponse réelle comme exemple de réponse.
- Dans Paramètres du projet → Paramètres des fonctionnalités → Paramètres de moquerie, sélectionnez Response example first.
L'URL mock renverra alors la réponse enregistrée. Votre front-end, vos workers et vos parseurs peuvent être testés sans consommer de jetons.
Cette simulation représente le schéma de réponse Gemini actuel, pas un schéma spécifique à Argon : Google n'en a pas publié. Pour tester les cas coûteux, modifiez usageMetadata dans l'exemple de réponse avec de grands compteurs de jetons et vérifiez vos alertes.
Étape 5 : vérifier usageMetadata et imposer un plafond de coût
Les réponses generateContent contiennent usageMetadata. Ajoutez un post-processeur Apidog pour calculer le coût au tarif standard Argon et échouer avant une facture inattendue.
// Post-processeur Apidog : évalue cette réponse aux tarifs standard Gemini 4 Argon
const u = pm.response.json().usageMetadata;
const IN = 4 / 1e6; // USD par jeton d'entrée après l'introduction
const OUT = 20 / 1e6; // USD par jeton de sortie
// Sur les modèles Gemini actuels, la réflexion est facturée comme sortie.
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);
const cost = u.promptTokenCount * IN + out * OUT;
pm.test("usageMetadata est présent", () => {
pm.expect(u).to.be.an("object");
});
pm.test("coût inférieur à 0,10 $ aux tarifs Argon", () => {
pm.expect(cost).to.be.below(0.10);
});
Adaptez le plafond à votre cas d'usage. Ici, 0,10 $ convient à une invite courte. Google n'a pas détaillé la facturation des jetons de réflexion pour Argon ; ce script applique donc la règle actuelle de Gemini.
Conservez la même requête de test et exécutez-la successivement contre Gemini 3.8 Flash puis Argon. La différence de consommation et de coût devient votre référence de régression.
FAQ
L'API Gemini 4 Argon est-elle disponible ?
Pas publiquement. Argon est réservé à certains partenaires du programme Fairwind via Gemini Enterprise. Google indique que les clients API payants et les abonnés Google AI Ultra seront servis ensuite, sans date annoncée.
Quel est l'ID du modèle Gemini 4 Argon ?
Google ne l'a pas publié. Utilisez une variable d'environnement et surveillez models.list.
Combien coûtera l'API Gemini 4 Argon ?
2 $ en entrée et 10 $ en sortie par 1M de jetons pendant une période d'introduction non datée, puis 4 $ et 20 $. L'entrée en cache bénéficie d'une réduction de 95 %. Consultez les tarifs de Gemini 4 Argon.
Argon fonctionnera-t-il avec generateContent ?
Google ne l'a pas confirmé. Les nouveaux modèles devraient être lancés via l'API Interactions ; construisez sur Interactions et gardez generateContent comme solution de secours.
Google AI Ultra donne-t-il accès à l'API ?
Non. AI Ultra est un abonnement grand public, pas une clé API. Google indique que l'accès API commencera avec les clients API payants.
Votre prochaine étape
- Définissez
GEMINI_MODELdans tous vos environnements. - Planifiez la vérification
models.list. - Enregistrez les requêtes Interactions et
generateContent. - Ajoutez l'assertion de coût à vos tests.
- Basculez vers Argon en changeant une seule variable lorsque Google publiera l'ID.
Téléchargez Apidog pour centraliser les requêtes, simulations et tests dans un même espace de travail.

Top comments (0)