DEV Community

Cover image for DeepSeek-V4-Flash : Support de l'API des Réponses et Codex – Guide pour les développeurs
Antoine Laurent
Antoine Laurent

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash : Support de l'API des Réponses et Codex – Guide pour les développeurs

Cachée dans l'annonce de la sortie du V4-Flash de DeepSeek du 31 juillet se trouve la ligne la plus stratégiquement intéressante : le V4-Flash officiel « prend en charge nativement le format Responses API et est entièrement adapté à Codex. »

Essayez Apidog dès aujourd’hui

Relisez cela. Un laboratoire chinois open-weight vient d'implémenter le nouveau format d'API d'OpenAI, conçu pour ses produits agentiques, afin que l'agent de code d'OpenAI puisse fonctionner avec un modèle DeepSeek. Le journal des modifications est explicite : « Pour répondre à la demande de Codex, notre API prend désormais en charge le format Responses API. »

Dans cet article, vous allez voir comment vérifier la compatibilité, connecter V4-Flash à Codex en quelques minutes et éviter les principaux pièges. Pour une configuration API de base, commencez par notre guide bêta public V4-Flash.

Pourquoi l'API Responses est importante ici

OpenAI a introduit l'API Responses comme successeur de Chat Completions : une interface unique pour les charges de travail agentiques, avec des éléments de raisonnement, des outils intégrés et des événements de streaming sémantiques. Consultez Comment utiliser l'API OpenAI Responses pour le détail du format.

En pratique, c'est le format utilisé nativement par la pile d'agents d'OpenAI, y compris Codex.

Auparavant, utiliser un modèle non-OpenAI depuis un client Responses API exigeait un proxy de traduction. DeepSeek implémente désormais ce format côté serveur à l'adresse https://api.deepseek.com.

Votre SDK OpenAI existant peut donc être utilisé sans modification majeure :

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)
Enter fullscreen mode Exit fullscreen mode

L'API Responses fonctionne actuellement uniquement avec deepseek-v4-flash. DeepSeek annonce le support de deepseek-v4-pro pour début août 2026.

Quelle est la complétude de la compatibilité ?

DeepSeek publie une matrice de compatibilité détaillée. Voici ce que vous devez retenir avant de brancher un client ou un agent existant.

Pris en charge et fonctionnel

  • input et instructions, sous forme de chaîne ou de liste d'éléments ;
  • stream, avec la séquence complète d'événements sémantiques ;
  • temperature, top_p, max_output_tokens et top_logprobs ;
  • tools avec les types function et web_search ;
  • tool_choice, y compris le forçage d'une fonction spécifique ;
  • reasoning.effort pour régler la profondeur de raisonnement.

La recherche web s'exécute côté serveur.

Accepté mais sans effet

  • reasoning.summary est accepté, mais aucun résumé de raisonnement n'est généré ;
  • text.verbosity est accepté, sans effet ;
  • parallel_tool_calls est ignoré, car les appels d'outils parallèles sont toujours activés.

Non pris en charge par conception

  • previous_response_id et conversation : l'API est sans état. Vous devez conserver l'historique et le renvoyer sous forme de liste d'éléments input à chaque appel ;
  • store : chaque réponse retourne store: false ;
  • background, metadata, include, service_tier et les clés de cache de prompt.

Le cache de contexte est appliqué automatiquement à la place.

Les paramètres non pris en charge sont ignorés silencieusement plutôt que rejetés. C'est utile pour connecter un client Responses API existant sans modifier toutes ses requêtes.

En revanche, une requête dépassant la fenêtre de contexte de 1 million de tokens renvoie une erreur 400 : elle n'est pas tronquée automatiquement.

Vérifier votre gestionnaire SSE

Le streaming suit les événements de l'API Responses, de response.created à response.completed.

Les deltas de raisonnement arrivent dans des événements distincts, par exemple :

response.reasoning_text.delta
Enter fullscreen mode Exit fullscreen mode

Les deltas de texte de sortie utilisent leurs propres événements. Surtout, le flux ne se termine pas par :

data: [DONE]
Enter fullscreen mode Exit fullscreen mode

Il se termine par l'un des événements suivants :

response.completed
response.incomplete
response.failed
Enter fullscreen mode Exit fullscreen mode

Si votre parseur SSE attend systématiquement [DONE], il risque de rester bloqué. Consultez notre guide sur le streaming des réponses API avec des événements envoyés par le serveur pour mettre en place un parseur défensif.

Configuration de Codex avec DeepSeek-V4-Flash

Codex communique avec les modèles via l'API Responses. C'est précisément l'objectif de cette intégration.

Le guide d'intégration Codex de DeepSeek propose deux approches. Elles configurent les clients Codex qui partagent la même configuration : CLI, application de bureau ChatGPT et extension VS Code.

Utiliser le script en un clic

Assurez-vous d'avoir installé et exécuté au moins une fois la CLI Codex ou l'application de bureau ChatGPT.

Sous macOS ou Linux :

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Enter fullscreen mode Exit fullscreen mode

Sous Windows, utilisez PowerShell :

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Enter fullscreen mode Exit fullscreen mode

Lors de la première exécution, le script demande votre clé API DeepSeek. Il effectue ensuite les opérations suivantes :

  1. sauvegarde ~/.codex/config.toml dans ~/.codex/backup-deepseek/ ;
  2. écrit le catalogue de modèles dans ~/.codex/models.json ;
  3. ajoute une section [model_providers.deepseek] à la configuration ;
  4. préserve les serveurs MCP et les paramètres de confiance des projets ;
  5. valide la syntaxe avant d'écrire la configuration.

Vous pouvez le relancer pour changer de modèle ou restaurer la configuration d'origine depuis son menu.

Comme pour tout curl | bash, lisez le script avant de l'exécuter si votre politique de sécurité l'exige. Le mécanisme de sauvegarde et de validation est utile, mais le script modifie tout de même votre configuration Codex.

Vérifier le catalogue de modèles

Lisez le fichier models.json créé par le script. Il documente les paramètres utilisés par DeepSeek dans Codex :

  • fenêtre de contexte : 1 048 576 tokens ;
  • niveaux de raisonnement : low, high et max ;
  • niveau par défaut : high ;
  • appels d'outils parallèles pris en charge ;
  • version minimale de Codex : 0.144.0.

Aujourd'hui, seul deepseek-v4-flash est opérationnel. Le catalogue inclut déjà deepseek-v4-pro en prévision de son support.

Évaluer V4-Flash dans Codex

DeepSeek indique que le réentraînement post-0731 cible spécifiquement les charges de travail agentiques. Le fournisseur publie notamment les résultats suivants :

  • Terminal Bench 2.1 : 82,7 ;
  • Cybergym : 76,7 ;
  • Toolathlon vérifié : 70,3 ;
  • DeepSWE : 54,4.

DeepSeek indique que ces résultats dépassent V4-Pro-Preview. Traitez-les néanmoins comme des chiffres fournisseur tant que des évaluations indépendantes ne sont pas disponibles : ils ont été obtenus avec le banc de test DeepSeek, en effort maximal, et deux benchmarks annoncés sont internes.

Le point économique est plus simple à vérifier :

  • entrée sans cache : 0,14 $ par million de tokens ;
  • sortie : 0,28 $ par million de tokens ;
  • entrée avec cache : 0,0028 $ par million de tokens.

Pour les détails, consultez la section Tarification de notre guide bêta. Si vous comparez plusieurs agents de code, notre comparaison Claude Code vs Codex CLI couvre la partie agentique.

Vérifiez le point de terminaison avant de faire confiance à l'agent

Un agent n'est débogable qu'à la hauteur de l'API qui le pilote. Avant de laisser Codex modifier un dépôt réel, testez le point de terminaison Responses.

Vous pouvez le faire en quelques minutes dans Apidog :

  1. Ajoutez le point de terminaison suivant :
   POST https://api.deepseek.com/responses
Enter fullscreen mode Exit fullscreen mode

Stockez votre clé API dans une variable d'environnement.

  1. Envoyez une requête minimale et vérifiez la structure de sortie :
   {
     "model": "deepseek-v4-flash",
     "input": "Explique en une phrase ce qu'est une API.",
     "reasoning": {
       "effort": "low"
     }
   }
Enter fullscreen mode Exit fullscreen mode

Confirmez la présence d'un élément reasoning, suivi d'un élément message.

  1. Activez le streaming :
   {
     "model": "deepseek-v4-flash",
     "input": "Écris une fonction Python qui inverse une chaîne.",
     "stream": true
   }
Enter fullscreen mode Exit fullscreen mode

Observez la séquence SSE pour vérifier si votre client écoute response.output_text.delta et s'arrête correctement sur response.completed.

  1. Ajoutez un outil function et vérifiez le format de sortie function_call avant de connecter votre gestionnaire d'outils à Codex.

Lorsque le support de V4-Pro arrivera, relancez ces mêmes requêtes enregistrées avec le nouveau nom de modèle et comparez le comportement.

Téléchargez Apidog gratuitement pour conserver vos requêtes, variables d'environnement et tests dans un même projet.

FAQ

Quels modèles DeepSeek fonctionnent avec l'API Responses ?

Seul deepseek-v4-flash est pris en charge aujourd'hui. Le support de deepseek-v4-pro est prévu pour début août 2026.

Ai-je besoin d'un nouveau SDK ?

Non. Le SDK officiel OpenAI fonctionne. Définissez base_url sur https://api.deepseek.com, puis appelez client.responses.create. Consultez le guide bêta public V4-Flash pour les détails de configuration.

L'état multi-tour fonctionne-t-il comme chez OpenAI ?

Non. L'implémentation DeepSeek est sans état. previous_response_id, conversation et store ne sont pas pris en charge. Envoyez l'historique complet dans input à chaque appel.

Puis-je utiliser DeepSeek dans Codex en même temps que mon compte OpenAI ?

Oui. La configuration ajoute DeepSeek comme fournisseur de modèle. Le menu du script permet de changer de modèle, et la configuration d'origine est sauvegardée pour pouvoir être restaurée.

Est-ce la même chose que la compatibilité avec l'API Anthropic ?

Non. Il s'agit d'une fonctionnalité distincte. DeepSeek expose aussi un point de terminaison compatible Anthropic à l'adresse https://api.deepseek.com/anthropic, utilisé par l'intégration Claude Code. Le point de terminaison Responses API cible les outils au format OpenAI, comme Codex.

Ce que cette version signale réellement

La qualité des modèles converge, et la concurrence se déplace vers la couche d'intégration.

DeepSeek cible directement l'environnement où les développeurs travaillent déjà : des agents comme Codex. L'entreprise fournit le format d'API attendu, les scripts de configuration et une documentation explicite sur les paramètres ignorés.

La stratégie est claire : OpenAI fournit l'agent, DeepSeek fournit les tokens à un coût inférieur. Mais la seule réponse utile à la question « V4-Flash est-il meilleur pour mon dépôt ? » vient de vos propres évaluations.

Connectez-le à Apidog, exécutez votre suite de tests avec les deux modèles et choisissez selon les résultats réels, pas uniquement selon les tableaux de benchmarks.

Top comments (0)