DEV Community

Cover image for API Gemini 4 Argon : Ce qui est confirmé, son prix et comment préparer votre code
Antoine Laurent
Antoine Laurent

Posted on Originally published at apidog.com

API Gemini 4 Argon : Ce qui est confirmé, son prix et comment préparer votre code

Il n'existe pas encore d'API publique pour Gemini 4 Argon, et Google n'a publié aucun ID de modèle. Annoncé le 30 septembre 2026, Argon est aujourd'hui réservé aux défenseurs du programme Fairwind et utilisé par certains partenaires comme modèle géré dans Gemini Enterprise. Artificial Analysis répertorie Google AI Studio comme seul fournisseur d'API, sans données de vitesse ni de latence : cela correspond davantage à un accès sur liste blanche pré-commerciale qu'à une API accessible par inscription. Google indique que le déploiement plus large commencera avec les clients API payants et les abonnés Google AI Ultra.

Essayez Apidog dès aujourd'hui

Cette période d'attente est utile pour préparer votre intégration. Ce guide distingue les éléments confirmés de ceux qui restent inconnus, puis montre comment construire dès maintenant un client compatible avec Gemini 3.8 Flash. L'objectif : basculer vers Argon en changeant une variable d'environnement lorsque Google publiera son ID. Vous allez préparer les requêtes, surveiller la disponibilité du modèle, simuler des réponses dans Apidog et appliquer un plafond de coût. Pour le contexte produit, consultez ce qu'est Gemini 4 Argon et le guide de la date de sortie de Gemini 4 Argon.

Ce qui est confirmé à propos de l'API Gemini 4 Argon

Le billet de lancement de Google confirme les prix et une limite de sortie. Les autres paramètres nécessaires à une intégration ne sont pas encore publiés.

Élément Statut Détail
Prix d'entrée Confirmé 2 $ par 1M de jetons pendant l'introduction, puis 4 $
Prix de sortie Confirmé 10 $ par 1M de jetons pendant l'introduction, puis 20 $
Entrée en cache Confirmé Réduction de 95 % : 0,10 $ en introduction, 0,20 $ au tarif standard
Limite de sortie Confirmé Jusqu'à 1M de jetons, contre 64K auparavant
Surface d'API Signalé Les nouveaux modèles devraient être lancés via l'API Interactions
ID de modèle Non publié Absent de la page des modèles, des prix et du journal des modifications
Fenêtre de contexte d'entrée Non publié Google a testé des invites jusqu'à 1M de jetons, sans en faire une spécification
Niveaux de réflexion Non publié Les évaluations utilisent les paramètres de réflexion les plus élevés, sans noms ni valeurs par défaut
Limites de débit Non publié Aucun palier annoncé
Lots Non publié Aucun prix pour Batch ou Flex
Palier d'invite longue Non publié La règle appliquée à Argon au-delà d'un seuil n'est pas précisée
Durée de l'introduction Non publié Pas de date de fin pour les tarifs 2 $ / 10 $

Deux points doivent guider l'implémentation :

  1. Les documents de l'API Interactions indiquent que les nouveaux modèles seront lancés sur cette API. Traitez donc Interactions comme le chemin principal.
  2. La limite annoncée est de 1M de jetons en sortie, mais Vals AI indique une sortie maximale de 262K pour la configuration testée. Vérifiez outputTokenLimit avant de supposer que chaque endpoint expose le million complet.

Le guide sur les 1M de jetons de sortie couvre les conséquences pour le streaming, les délais d'attente et le stockage.

Calculer le coût d'une requête

Avec une invite de 20 000 jetons et une sortie de 5 000 jetons :

Entrée : 20 000 × 2 $ / 1M = 0,04 $
Sortie : 5 000 × 10 $ / 1M = 0,05 $
Total : 0,09 $ au tarif d'introduction
Enter fullscreen mode Exit fullscreen mode

Au tarif standard de 4 $ / 20 $, cette même requête coûte 0,18 $. Le prix de sortie d'introduction d'Argon est inférieur à celui de Gemini 3.1 Pro Preview (12 $) et son prix standard correspond à Claude Opus 5.5. Consultez la ventilation des prix de Gemini 4 Argon pour les scénarios incluant le cache et les réponses longues.

Ne codez pas en dur un ID de modèle trouvé en ligne

Les chaînes trouvées sur des sites de benchmark, des agrégateurs ou des pull requests ne sont pas des IDs officiels. Certaines sont explicitement temporaires ; d'autres renvoient vers des pages inexistantes. Google n'a confirmé aucun ID Argon.

Évitez deux risques :

  • une erreur 404 au moment du déploiement ;
  • un repli silencieux vers un autre modèle si votre wrapper capture les erreurs trop largement.

Placez le modèle dans une variable d'environnement. Tous les exemples suivants utilisent GEMINI_MODEL, avec gemini-3.8-flash comme valeur par défaut :

export GEMINI_MODEL=gemini-3.8-flash
export GEMINI_API_KEY="votre-cle-api"
Enter fullscreen mode Exit fullscreen mode

Lorsque Google publiera l'ID Argon, vous ne modifierez que GEMINI_MODEL.

Préparez votre code sur Gemini 3.8 Flash

Gemini 3.8 Flash (gemini-3.8-flash) utilise les mêmes endpoints, en-têtes et structures de réponse que ceux attendus pour Argon. Son prix est de 0,75 $ en entrée et 3,75 $ en sortie par 1M de jetons jusqu'au 31 décembre 2026.

Stockez votre clé dans GEMINI_API_KEY, jamais dans le code source. La configuration complète est détaillée dans le guide de l'API Gemini 3.8 Flash.

Étape 1 : envoyer une requête à l'API Interactions

Conservez le modèle et le niveau de réflexion dans des variables : les niveaux compatibles avec Argon ne sont pas publiés.

MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
THINKING="${GEMINI_THINKING:-medium}"

curl -s -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"model\": \"${MODEL}\",
    \"input\": \"List the retry rules a REST client should follow for HTTP 429.\",
    \"generation_config\": {\"thinking_level\": \"${THINKING}\"}
  }"
Enter fullscreen mode Exit fullscreen mode

Version Python :

# pip install "google-genai>=2.3.0"
import os
from google import genai

MODEL = os.environ.get("GEMINI_MODEL", "gemini-3.8-flash")
THINKING = os.environ.get("GEMINI_THINKING", "medium")

client = genai.Client()  # Lit GEMINI_API_KEY depuis l'environnement

interaction = client.interactions.create(
    model=MODEL,
    input="List the retry rules a REST client should follow for HTTP 429.",
    generation_config={"thinking_level": THINKING},
)

print(interaction.output_text)
Enter fullscreen mode Exit fullscreen mode

Sur Gemini 3.8 Flash, les niveaux acceptés sont low, medium et high. Le niveau minimal renvoie une erreur HTTP 400. Le guide sur les niveaux de réflexion décrit les compromis.

Pour conserver le contexte dans un échange multi-tour :

  • transmettez l'ID précédent dans previous_interaction_id ;
  • envoyez store: false si vous voulez désactiver le stockage côté serveur.

Étape 2 : conserver le chemin generateContent

Le endpoint historique generateContent reste pris en charge. Gardez-le opérationnel tant que Google n'a pas confirmé la compatibilité d'Argon.

curl -s "https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d "{
    \"contents\": [{
      \"parts\": [{
        \"text\": \"List the retry rules a REST client should follow for HTTP 429.\"
      }]
    }],
    \"generationConfig\": {
      \"thinkingConfig\": {
        \"thinkingLevel\": \"${THINKING}\"
      }
    }
  }"
Enter fullscreen mode Exit fullscreen mode

La position du niveau de réflexion diffère entre les deux APIs :

API Champ
Interactions generation_config.thinking_level
generateContent generationConfig.thinkingConfig.thinkingLevel

Si votre client prend en charge les deux formats, routez les nouveaux modèles vers Interactions par défaut. Les outils demandent la même vigilance de mapping ; voir l'appel de fonctions Gemini 3.8 Flash.

Étape 3 : surveiller la disponibilité avec models.list

Ne surveillez pas uniquement les annonces. Interrogez l'API avec la même clé que votre application de production.

import os
import sys
import requests

resp = requests.get(
    "https://generativelanguage.googleapis.com/v1beta/models",
    params={"pageSize": 1000},
    headers={"x-goog-api-key": os.environ["GEMINI_API_KEY"]},
    timeout=30,
)

resp.raise_for_status()

hits = [
    model
    for model in resp.json().get("models", [])
    if "argon" in model["name"].lower()
]

for model in hits:
    print(
        model["name"],
        "in:", model.get("inputTokenLimit"),
        "out:", model.get("outputTokenLimit"),
        model.get("supportedGenerationMethods"),
    )

sys.exit(1 if hits else 0)  # Échec = déclenchement d'alerte
Enter fullscreen mode Exit fullscreen mode

Exécutez ce script toutes les heures dans cron ou dans un pipeline CI planifié. Lorsqu'un résultat apparaît, vous obtenez immédiatement :

  • le vrai nom du modèle ;
  • sa limite de sortie effective ;
  • les méthodes de génération disponibles.

Le 1er octobre 2026, cet appel avec une clé de projet payante renvoyait 61 modèles, sans nextPageToken et sans nom contenant argon.

Étape 4 : simuler la réponse avant d'obtenir l'accès

Vous pouvez construire le client Argon sans Argon. Dans Apidog :

  1. Enregistrez la requête generateContent de l'étape 2.
  2. Ajoutez GEMINI_API_KEY et GEMINI_MODEL comme variables d'environnement.
  3. Exécutez une requête contre Gemini 3.8 Flash.
  4. Enregistrez la réponse réelle comme exemple de réponse.
  5. Dans Paramètres du projet → Paramètres des fonctionnalités → Paramètres de moquerie, sélectionnez Response example first.

L'URL mock renverra alors la réponse enregistrée. Votre front-end, vos workers et vos parseurs peuvent être testés sans consommer de jetons.

Cette simulation représente le schéma de réponse Gemini actuel, pas un schéma spécifique à Argon : Google n'en a pas publié. Pour tester les cas coûteux, modifiez usageMetadata dans l'exemple de réponse avec de grands compteurs de jetons et vérifiez vos alertes.

Étape 5 : vérifier usageMetadata et imposer un plafond de coût

Les réponses generateContent contiennent usageMetadata. Ajoutez un post-processeur Apidog pour calculer le coût au tarif standard Argon et échouer avant une facture inattendue.

// Post-processeur Apidog : évalue cette réponse aux tarifs standard Gemini 4 Argon
const u = pm.response.json().usageMetadata;

const IN = 4 / 1e6;   // USD par jeton d'entrée après l'introduction
const OUT = 20 / 1e6; // USD par jeton de sortie

// Sur les modèles Gemini actuels, la réflexion est facturée comme sortie.
const out = (u.candidatesTokenCount || 0) + (u.thoughtsTokenCount || 0);

const cost = u.promptTokenCount * IN + out * OUT;

pm.test("usageMetadata est présent", () => {
  pm.expect(u).to.be.an("object");
});

pm.test("coût inférieur à 0,10 $ aux tarifs Argon", () => {
  pm.expect(cost).to.be.below(0.10);
});
Enter fullscreen mode Exit fullscreen mode

Adaptez le plafond à votre cas d'usage. Ici, 0,10 $ convient à une invite courte. Google n'a pas détaillé la facturation des jetons de réflexion pour Argon ; ce script applique donc la règle actuelle de Gemini.

Conservez la même requête de test et exécutez-la successivement contre Gemini 3.8 Flash puis Argon. La différence de consommation et de coût devient votre référence de régression.

FAQ

L'API Gemini 4 Argon est-elle disponible ?

Pas publiquement. Argon est réservé à certains partenaires du programme Fairwind via Gemini Enterprise. Google indique que les clients API payants et les abonnés Google AI Ultra seront servis ensuite, sans date annoncée.

Quel est l'ID du modèle Gemini 4 Argon ?

Google ne l'a pas publié. Utilisez une variable d'environnement et surveillez models.list.

Combien coûtera l'API Gemini 4 Argon ?

2 $ en entrée et 10 $ en sortie par 1M de jetons pendant une période d'introduction non datée, puis 4 $ et 20 $. L'entrée en cache bénéficie d'une réduction de 95 %. Consultez les tarifs de Gemini 4 Argon.

Argon fonctionnera-t-il avec generateContent ?

Google ne l'a pas confirmé. Les nouveaux modèles devraient être lancés via l'API Interactions ; construisez sur Interactions et gardez generateContent comme solution de secours.

Google AI Ultra donne-t-il accès à l'API ?

Non. AI Ultra est un abonnement grand public, pas une clé API. Google indique que l'accès API commencera avec les clients API payants.

Votre prochaine étape

  1. Définissez GEMINI_MODEL dans tous vos environnements.
  2. Planifiez la vérification models.list.
  3. Enregistrez les requêtes Interactions et generateContent.
  4. Ajoutez l'assertion de coût à vos tests.
  5. Basculez vers Argon en changeant une seule variable lorsque Google publiera l'ID.

Téléchargez Apidog pour centraliser les requêtes, simulations et tests dans un même espace de travail.

Top comments (0)