Oculta dentro del anuncio del lanzamiento de V4-Flash del 31 de julio de DeepSeek se encuentra la línea más estratégicamente interesante: V4-Flash oficial «soporta de forma nativa el formato Responses API y está totalmente adaptado para Codex».
Vuelve a leer eso. Un laboratorio chino de código abierto acaba de implementar el formato API más nuevo de OpenAI, el que OpenAI construyó para sus propios productos de agente, específicamente para que el propio agente de codificación de OpenAI pueda ejecutarse en un modelo de DeepSeek. El registro de cambios establece claramente la motivación: «Para satisfacer la demanda de Codex, nuestra API ahora es compatible con el formato Responses API».
Este artículo cubre lo que eso significa en la práctica: cuán compatible es la implementación, qué se ignora silenciosamente, cómo integrar V4-Flash en Codex en dos minutos y dónde están los puntos críticos. Si primero solo necesitas una configuración básica de la API, comienza con nuestra guía beta pública de V4-Flash.
Por qué la API de Responses es importante aquí
OpenAI introdujo la API de Responses como sucesora de Chat Completions: una única interfaz diseñada para cargas de trabajo de agentes, con elementos de razonamiento de primera clase, herramientas integradas y eventos de streaming semántico. Desglosamos el formato en Cómo usar la API de Responses de OpenAI, pero la versión corta es: es el formato que la pila de agentes de OpenAI, incluido Codex, habla de forma nativa.
Hasta ahora, ejecutar un modelo que no fuera de OpenAI detrás de un cliente de la API de Responses significaba un proxy de traducción o nada. DeepSeek se saltó el proxy e implementó el formato en el lado del servidor en https://api.deepseek.com.
Tu SDK de OpenAI existente funciona sin cambios:
# pip3 install openai
from openai import OpenAI
client = OpenAI(
api_key="<your DeepSeek API key>",
base_url="https://api.deepseek.com"
)
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful assistant.",
input="Hi, how are you?",
)
print(response.output_text)
Una nota de alcance antes de que te entusiasmes: la API de Responses actualmente solo funciona con deepseek-v4-flash. DeepSeek dice que el soporte para deepseek-v4-pro llegará a principios de agosto de 2026.
¿Qué tan completa es la compatibilidad?
DeepSeek publicó una matriz de compatibilidad completa, lo cual es más de lo que la mayoría de los proveedores «compatibles con OpenAI» se molestan en hacer.
Soportado y funcionando
-
inputeinstructions, en formato de cadena o lista de elementos. -
streamcon la secuencia completa de eventos semánticos. -
temperature,top_p,max_output_tokensytop_logprobs. -
toolscon tiposfunctionyweb_search; la búsqueda web se ejecuta en el lado del servidor. -
tool_choice, incluyendo forzar una función específica. -
reasoning.effortpara controlar la profundidad del razonamiento.
Aceptado pero inerte
-
reasoning.summaryes aceptado, pero no se genera ningún resumen. -
text.verbosityes aceptado sin efecto. -
parallel_tool_callses ignorado porque la llamada a herramientas en paralelo siempre está activada.
No soportado, por diseño
-
previous_response_idyconversation: la API no tiene estado. Gestiona el historial de conversación y envíalo como una lista de elementos de entrada. -
store: cada respuesta regresa constore: false. -
background,metadata,include,service_tiery claves de caché de prompt. El caché de contexto ocurre automáticamente en su lugar.
La parte elegante es que los parámetros no soportados se ignoran silenciosamente en lugar de ser rechazados, por lo que los clientes existentes de la API de Responses se conectan sin modificaciones.
La parte implacable: las solicitudes que exceden la ventana de contexto de 1M de tokens devuelven un error 400 en lugar de ser truncadas.
El streaming sigue el modelo de eventos de la API de Responses, desde response.created hasta response.completed, con deltas de razonamiento (response.reasoning_text.delta) llegando como eventos separados del texto de salida.
No hay un terminador data: [DONE]; el flujo termina con uno de estos eventos:
response.completedresponse.incompleteresponse.failed
Si tu manejador SSE espera [DONE], se quedará colgado. Nuestra guía sobre streaming de respuestas de API con eventos enviados por el servidor cubre patrones de análisis defensivos para este tipo de diferencia de dialecto.
Configurando Codex con DeepSeek-V4-Flash
Codex se comunica con los modelos a través de la API de Responses, que es la razón principal de la existencia de este lanzamiento. La guía de integración de DeepSeek ofrece dos rutas.
Ambas configuran todos los clientes de Codex a la vez —CLI, la aplicación de escritorio ChatGPT y la extensión de VS Code— porque comparten una única configuración.
El script de un clic
Asegúrate de que Codex CLI o la aplicación de escritorio ChatGPT estén instalados y se hayan ejecutado al menos una vez. Después, ejecuta:
bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
En Windows, usa la variante de PowerShell:
irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
En la primera ejecución, el script solicita tu clave API de DeepSeek. Después realiza estas acciones:
- Hace una copia de seguridad de
~/.codex/config.tomlen~/.codex/backup-deepseek/. - Escribe un catálogo de modelos en
~/.codex/models.json. - Añade una sección
[model_providers.deepseek]a la configuración. - Conserva los servidores MCP y la configuración de confianza del proyecto.
- Valida la sintaxis antes de escribir cambios.
Puedes ejecutarlo de nuevo para cambiar de modelo o restaurar la configuración original desde el menú.
La precaución estándar se aplica al canalizar curl a bash: revisa el script primero si esa es tu política. El comportamiento de copia de seguridad y validación es una buena señal, pero sigue siendo un script de terceros que modifica tu configuración de Codex.
Lo que te dice el catálogo de modelos
Vale la pena leer el archivo models.json que escribe el script, porque documenta cómo DeepSeek posiciona el modelo dentro de Codex:
- Ventana de contexto: 1.048.576 tokens.
- Niveles de razonamiento:
low,highymax;highes el valor predeterminado. - Llamadas de herramientas paralelas soportadas.
- Requiere la versión
0.144.0o posterior del cliente de Codex.
El catálogo describe V4-Flash como el «último modelo de codificación agéntica de vanguardia», y solo deepseek-v4-flash funciona hoy. El catálogo ya incluye deepseek-v4-pro para cuando llegue el soporte a principios de agosto.
¿Realmente funciona bien dentro de Codex?
La propuesta de DeepSeek es que el reentrenamiento posterior al 0731 estaba dirigido exactamente a esta carga de trabajo.
Sus cifras de agentes publicadas son:
- Terminal Bench 2.1: 82.7
- Cybergym: 76.7
- Toolathlon verificado: 70.3
- DeepSWE: 54.4
Todos fueron reportados como superiores a V4-Pro-Preview. Trata estas cifras como números del proveedor hasta que aparezcan ejecuciones independientes: fueron producidos con el propio arnés de DeepSeek con el máximo esfuerzo, y dos de los puntos de referencia del anuncio son conjuntos de pruebas internos.
La economía es más difícil de discutir. A 0,14 $ por millón de tokens de entrada sin acierto de caché y 0,28 $ por millón de tokens de salida, V4-Flash cuesta una fracción de los modelos que Codex ejecuta normalmente. Los aciertos de caché reducen el coste de entrada a 0,0028 $.
Para ver la tabla de costes completa, consulta la sección de precios de nuestra guía beta. Si estás comparando Codex con alternativas, nuestra comparación de Claude Code vs Codex CLI cubre el lado del agente de la ecuación.
Verifica el punto final antes de confiar en el agente
Un agente es tan depurable como la API que lo respalda, y un punto final beta público completamente nuevo merece una prueba antes de dejar que Codex se suelte en un repositorio real.
Puedes hacerlo en cinco minutos con Apidog:
- Añade
POST https://api.deepseek.com/responsescomo un punto final y guarda tu clave en una variable de entorno. - Envía una carga mínima de
responses.createy confirma la forma de los elementos de salida: un elementoreasoningseguido de un elementomessage. - Activa
stream: truey observa la secuencia de eventos en vivo. Apidog muestra cada evento SSE a medida que llega, lo que permite verificar si tu cliente escucharesponse.output_text.deltao espera un evento que nunca llegará. - Guarda una solicitud con una herramienta
functiony confirma que el formato de salidafunction_callcoincide con lo que espera tu manejador.
Cuando llegue el lanzamiento de V4-Pro Responses en agosto, vuelve a ejecutar las mismas solicitudes guardadas contra el nuevo nombre del modelo y compara el comportamiento. Descarga Apidog gratis y mantén toda la suite en un solo proyecto.
Preguntas frecuentes
¿Qué modelos de DeepSeek funcionan con la API de Responses?
Solo deepseek-v4-flash por ahora. El soporte para deepseek-v4-pro está programado para principios de agosto de 2026.
¿Necesito un nuevo SDK?
No. El SDK oficial de OpenAI funciona: apunta base_url a https://api.deepseek.com y llama a client.responses.create. Los detalles de configuración están en nuestra guía beta pública de V4-Flash.
¿El estado multirrespuesta funciona como la versión de OpenAI?
No. La implementación de DeepSeek no tiene estado: previous_response_id, conversation y store no son compatibles. Envía el historial completo como elementos de entrada en cada llamada.
¿Puedo usar DeepSeek en Codex junto con mi cuenta de OpenAI?
Sí. La configuración añade DeepSeek como proveedor de modelos; el menú del script cambia entre modelos, y tu configuración original se respalda para que puedas restaurarla.
¿Es esto lo mismo que la compatibilidad con la API de Anthropic?
No. Es una característica separada. DeepSeek también expone un punto final en formato Anthropic en https://api.deepseek.com/anthropic, que es como funciona la integración de Claude Code. El punto final de la API de Responses existe para herramientas de agente en formato OpenAI como Codex.
Lo que realmente señala este lanzamiento
La calidad de los modelos está convergiendo, por lo que la competencia se está moviendo a la capa de integración. DeepSeek analizó dónde residen realmente los desarrolladores, dentro de agentes como Codex, y construyó la infraestructura necesaria para ser un backend de reemplazo allí, hasta el punto de publicar qué parámetros se ignoran silenciosamente.
Esa transparencia es poco habitual y hace que la historia de compatibilidad sea creíble.
La jugada es obvia e inteligente: OpenAI entrega el agente y DeepSeek sirve los tokens a una décima parte del precio. Si el modelo 0731 realmente supera a V4-Pro-Preview en tu base de código es algo que solo tus propias evaluaciones pueden responder.
Conéctalo a Apidog, ejecuta tu suite de pruebas contra ambos y deja que los resultados, no la tabla de benchmarks, decidan.

Top comments (0)