Cachée dans l'annonce de la sortie du V4-Flash de DeepSeek du 31 juillet se trouve la ligne la plus stratégiquement intéressante : le V4-Flash officiel « prend en charge nativement le format Responses API et est entièrement adapté à Codex. »
Essayez Apidog dès aujourd’hui
Relisez cela. Un laboratoire chinois open-weight vient d'implémenter le nouveau format d'API d'OpenAI, conçu pour ses produits agentiques, afin que l'agent de code d'OpenAI puisse fonctionner avec un modèle DeepSeek. Le journal des modifications est explicite : « Pour répondre à la demande de Codex, notre API prend désormais en charge le format Responses API. »
Dans cet article, vous allez voir comment vérifier la compatibilité, connecter V4-Flash à Codex en quelques minutes et éviter les principaux pièges. Pour une configuration API de base, commencez par notre guide bêta public V4-Flash.
Pourquoi l'API Responses est importante ici
OpenAI a introduit l'API Responses comme successeur de Chat Completions : une interface unique pour les charges de travail agentiques, avec des éléments de raisonnement, des outils intégrés et des événements de streaming sémantiques. Consultez Comment utiliser l'API OpenAI Responses pour le détail du format.
En pratique, c'est le format utilisé nativement par la pile d'agents d'OpenAI, y compris Codex.
Auparavant, utiliser un modèle non-OpenAI depuis un client Responses API exigeait un proxy de traduction. DeepSeek implémente désormais ce format côté serveur à l'adresse https://api.deepseek.com.
Votre SDK OpenAI existant peut donc être utilisé sans modification majeure :
# pip3 install openai
from openai import OpenAI
client = OpenAI(
api_key="<your DeepSeek API key>",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
L'API Responses fonctionne actuellement uniquement avec
deepseek-v4-flash. DeepSeek annonce le support dedeepseek-v4-propour début août 2026.
Quelle est la complétude de la compatibilité ?
DeepSeek publie une matrice de compatibilité détaillée. Voici ce que vous devez retenir avant de brancher un client ou un agent existant.
Pris en charge et fonctionnel
-
inputetinstructions, sous forme de chaîne ou de liste d'éléments ; -
stream, avec la séquence complète d'événements sémantiques ; -
temperature,top_p,max_output_tokensettop_logprobs; -
toolsavec les typesfunctionetweb_search; -
tool_choice, y compris le forçage d'une fonction spécifique ; -
reasoning.effortpour régler la profondeur de raisonnement.
La recherche web s'exécute côté serveur.
Accepté mais sans effet
-
reasoning.summaryest accepté, mais aucun résumé de raisonnement n'est généré ; -
text.verbosityest accepté, sans effet ; -
parallel_tool_callsest ignoré, car les appels d'outils parallèles sont toujours activés.
Non pris en charge par conception
-
previous_response_idetconversation: l'API est sans état. Vous devez conserver l'historique et le renvoyer sous forme de liste d'élémentsinputà chaque appel ; -
store: chaque réponse retournestore: false; -
background,metadata,include,service_tieret les clés de cache de prompt.
Le cache de contexte est appliqué automatiquement à la place.
Les paramètres non pris en charge sont ignorés silencieusement plutôt que rejetés. C'est utile pour connecter un client Responses API existant sans modifier toutes ses requêtes.
En revanche, une requête dépassant la fenêtre de contexte de 1 million de tokens renvoie une erreur 400 : elle n'est pas tronquée automatiquement.
Vérifier votre gestionnaire SSE
Le streaming suit les événements de l'API Responses, de response.created à response.completed.
Les deltas de raisonnement arrivent dans des événements distincts, par exemple :
response.reasoning_text.delta
Les deltas de texte de sortie utilisent leurs propres événements. Surtout, le flux ne se termine pas par :
data: [DONE]
Il se termine par l'un des événements suivants :
response.completed
response.incomplete
response.failed
Si votre parseur SSE attend systématiquement [DONE], il risque de rester bloqué. Consultez notre guide sur le streaming des réponses API avec des événements envoyés par le serveur pour mettre en place un parseur défensif.
Configuration de Codex avec DeepSeek-V4-Flash
Codex communique avec les modèles via l'API Responses. C'est précisément l'objectif de cette intégration.
Le guide d'intégration Codex de DeepSeek propose deux approches. Elles configurent les clients Codex qui partagent la même configuration : CLI, application de bureau ChatGPT et extension VS Code.
Utiliser le script en un clic
Assurez-vous d'avoir installé et exécuté au moins une fois la CLI Codex ou l'application de bureau ChatGPT.
Sous macOS ou Linux :
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Sous Windows, utilisez PowerShell :
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Lors de la première exécution, le script demande votre clé API DeepSeek. Il effectue ensuite les opérations suivantes :
- sauvegarde
~/.codex/config.tomldans~/.codex/backup-deepseek/; - écrit le catalogue de modèles dans
~/.codex/models.json; - ajoute une section
[model_providers.deepseek]à la configuration ; - préserve les serveurs MCP et les paramètres de confiance des projets ;
- valide la syntaxe avant d'écrire la configuration.
Vous pouvez le relancer pour changer de modèle ou restaurer la configuration d'origine depuis son menu.
Comme pour tout curl | bash, lisez le script avant de l'exécuter si votre politique de sécurité l'exige. Le mécanisme de sauvegarde et de validation est utile, mais le script modifie tout de même votre configuration Codex.
Vérifier le catalogue de modèles
Lisez le fichier models.json créé par le script. Il documente les paramètres utilisés par DeepSeek dans Codex :
- fenêtre de contexte : 1 048 576 tokens ;
- niveaux de raisonnement :
low,highetmax; - niveau par défaut :
high; - appels d'outils parallèles pris en charge ;
- version minimale de Codex :
0.144.0.
Aujourd'hui, seul deepseek-v4-flash est opérationnel. Le catalogue inclut déjà deepseek-v4-pro en prévision de son support.
Évaluer V4-Flash dans Codex
DeepSeek indique que le réentraînement post-0731 cible spécifiquement les charges de travail agentiques. Le fournisseur publie notamment les résultats suivants :
- Terminal Bench 2.1 : 82,7 ;
- Cybergym : 76,7 ;
- Toolathlon vérifié : 70,3 ;
- DeepSWE : 54,4.
DeepSeek indique que ces résultats dépassent V4-Pro-Preview. Traitez-les néanmoins comme des chiffres fournisseur tant que des évaluations indépendantes ne sont pas disponibles : ils ont été obtenus avec le banc de test DeepSeek, en effort maximal, et deux benchmarks annoncés sont internes.
Le point économique est plus simple à vérifier :
- entrée sans cache : 0,14 $ par million de tokens ;
- sortie : 0,28 $ par million de tokens ;
- entrée avec cache : 0,0028 $ par million de tokens.
Pour les détails, consultez la section Tarification de notre guide bêta. Si vous comparez plusieurs agents de code, notre comparaison Claude Code vs Codex CLI couvre la partie agentique.
Vérifiez le point de terminaison avant de faire confiance à l'agent
Un agent n'est débogable qu'à la hauteur de l'API qui le pilote. Avant de laisser Codex modifier un dépôt réel, testez le point de terminaison Responses.
Vous pouvez le faire en quelques minutes dans Apidog :
- Ajoutez le point de terminaison suivant :
POST https://api.deepseek.com/responses
Stockez votre clé API dans une variable d'environnement.
- Envoyez une requête minimale et vérifiez la structure de sortie :
{
"model": "deepseek-v4-flash",
"input": "Explique en une phrase ce qu'est une API.",
"reasoning": {
"effort": "low"
}
}
Confirmez la présence d'un élément reasoning, suivi d'un élément message.
- Activez le streaming :
{
"model": "deepseek-v4-flash",
"input": "Écris une fonction Python qui inverse une chaîne.",
"stream": true
}
Observez la séquence SSE pour vérifier si votre client écoute response.output_text.delta et s'arrête correctement sur response.completed.
- Ajoutez un outil
functionet vérifiez le format de sortiefunction_callavant de connecter votre gestionnaire d'outils à Codex.
Lorsque le support de V4-Pro arrivera, relancez ces mêmes requêtes enregistrées avec le nouveau nom de modèle et comparez le comportement.
Téléchargez Apidog gratuitement pour conserver vos requêtes, variables d'environnement et tests dans un même projet.
FAQ
Quels modèles DeepSeek fonctionnent avec l'API Responses ?
Seul deepseek-v4-flash est pris en charge aujourd'hui. Le support de deepseek-v4-pro est prévu pour début août 2026.
Ai-je besoin d'un nouveau SDK ?
Non. Le SDK officiel OpenAI fonctionne. Définissez base_url sur https://api.deepseek.com, puis appelez client.responses.create. Consultez le guide bêta public V4-Flash pour les détails de configuration.
L'état multi-tour fonctionne-t-il comme chez OpenAI ?
Non. L'implémentation DeepSeek est sans état. previous_response_id, conversation et store ne sont pas pris en charge. Envoyez l'historique complet dans input à chaque appel.
Puis-je utiliser DeepSeek dans Codex en même temps que mon compte OpenAI ?
Oui. La configuration ajoute DeepSeek comme fournisseur de modèle. Le menu du script permet de changer de modèle, et la configuration d'origine est sauvegardée pour pouvoir être restaurée.
Est-ce la même chose que la compatibilité avec l'API Anthropic ?
Non. Il s'agit d'une fonctionnalité distincte. DeepSeek expose aussi un point de terminaison compatible Anthropic à l'adresse https://api.deepseek.com/anthropic, utilisé par l'intégration Claude Code. Le point de terminaison Responses API cible les outils au format OpenAI, comme Codex.
Ce que cette version signale réellement
La qualité des modèles converge, et la concurrence se déplace vers la couche d'intégration.
DeepSeek cible directement l'environnement où les développeurs travaillent déjà : des agents comme Codex. L'entreprise fournit le format d'API attendu, les scripts de configuration et une documentation explicite sur les paramètres ignorés.
La stratégie est claire : OpenAI fournit l'agent, DeepSeek fournit les tokens à un coût inférieur. Mais la seule réponse utile à la question « V4-Flash est-il meilleur pour mon dépôt ? » vient de vos propres évaluations.
Connectez-le à Apidog, exécutez votre suite de tests avec les deux modèles et choisissez selon les résultats réels, pas uniquement selon les tableaux de benchmarks.

Top comments (0)