DEV Community

Cover image for DeepSeek-V4-Flash Ahora Soporta la API de Respuestas y Codex: Lo que los Desarrolladores Deben Saber
Roobia
Roobia

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash Ahora Soporta la API de Respuestas y Codex: Lo que los Desarrolladores Deben Saber

Oculta dentro del anuncio del lanzamiento de V4-Flash del 31 de julio de DeepSeek se encuentra la línea más estratégicamente interesante: V4-Flash oficial «soporta de forma nativa el formato Responses API y está totalmente adaptado para Codex».

Prueba Apidog hoy

Vuelve a leer eso. Un laboratorio chino de código abierto acaba de implementar el formato API más nuevo de OpenAI, el que OpenAI construyó para sus propios productos de agente, específicamente para que el propio agente de codificación de OpenAI pueda ejecutarse en un modelo de DeepSeek. El registro de cambios establece claramente la motivación: «Para satisfacer la demanda de Codex, nuestra API ahora es compatible con el formato Responses API».

Este artículo cubre lo que eso significa en la práctica: cuán compatible es la implementación, qué se ignora silenciosamente, cómo integrar V4-Flash en Codex en dos minutos y dónde están los puntos críticos. Si primero solo necesitas una configuración básica de la API, comienza con nuestra guía beta pública de V4-Flash.

Por qué la API de Responses es importante aquí

OpenAI introdujo la API de Responses como sucesora de Chat Completions: una única interfaz diseñada para cargas de trabajo de agentes, con elementos de razonamiento de primera clase, herramientas integradas y eventos de streaming semántico. Desglosamos el formato en Cómo usar la API de Responses de OpenAI, pero la versión corta es: es el formato que la pila de agentes de OpenAI, incluido Codex, habla de forma nativa.

Hasta ahora, ejecutar un modelo que no fuera de OpenAI detrás de un cliente de la API de Responses significaba un proxy de traducción o nada. DeepSeek se saltó el proxy e implementó el formato en el lado del servidor en https://api.deepseek.com.

Tu SDK de OpenAI existente funciona sin cambios:

# pip3 install openai
from openai import OpenAI

client = OpenAI(
    api_key="<your DeepSeek API key>",
    base_url="https://api.deepseek.com"
)

response = client.responses.create(
    model="deepseek-v4-flash",
    instructions="You are a helpful assistant.",
    input="Hi, how are you?",
)

print(response.output_text)
Enter fullscreen mode Exit fullscreen mode

Una nota de alcance antes de que te entusiasmes: la API de Responses actualmente solo funciona con deepseek-v4-flash. DeepSeek dice que el soporte para deepseek-v4-pro llegará a principios de agosto de 2026.

¿Qué tan completa es la compatibilidad?

DeepSeek publicó una matriz de compatibilidad completa, lo cual es más de lo que la mayoría de los proveedores «compatibles con OpenAI» se molestan en hacer.

Soportado y funcionando

  • input e instructions, en formato de cadena o lista de elementos.
  • stream con la secuencia completa de eventos semánticos.
  • temperature, top_p, max_output_tokens y top_logprobs.
  • tools con tipos function y web_search; la búsqueda web se ejecuta en el lado del servidor.
  • tool_choice, incluyendo forzar una función específica.
  • reasoning.effort para controlar la profundidad del razonamiento.

Aceptado pero inerte

  • reasoning.summary es aceptado, pero no se genera ningún resumen.
  • text.verbosity es aceptado sin efecto.
  • parallel_tool_calls es ignorado porque la llamada a herramientas en paralelo siempre está activada.

No soportado, por diseño

  • previous_response_id y conversation: la API no tiene estado. Gestiona el historial de conversación y envíalo como una lista de elementos de entrada.
  • store: cada respuesta regresa con store: false.
  • background, metadata, include, service_tier y claves de caché de prompt. El caché de contexto ocurre automáticamente en su lugar.

La parte elegante es que los parámetros no soportados se ignoran silenciosamente en lugar de ser rechazados, por lo que los clientes existentes de la API de Responses se conectan sin modificaciones.

La parte implacable: las solicitudes que exceden la ventana de contexto de 1M de tokens devuelven un error 400 en lugar de ser truncadas.

El streaming sigue el modelo de eventos de la API de Responses, desde response.created hasta response.completed, con deltas de razonamiento (response.reasoning_text.delta) llegando como eventos separados del texto de salida.

No hay un terminador data: [DONE]; el flujo termina con uno de estos eventos:

  • response.completed
  • response.incomplete
  • response.failed

Si tu manejador SSE espera [DONE], se quedará colgado. Nuestra guía sobre streaming de respuestas de API con eventos enviados por el servidor cubre patrones de análisis defensivos para este tipo de diferencia de dialecto.

Configurando Codex con DeepSeek-V4-Flash

Codex se comunica con los modelos a través de la API de Responses, que es la razón principal de la existencia de este lanzamiento. La guía de integración de DeepSeek ofrece dos rutas.

Ambas configuran todos los clientes de Codex a la vez —CLI, la aplicación de escritorio ChatGPT y la extensión de VS Code— porque comparten una única configuración.

El script de un clic

Asegúrate de que Codex CLI o la aplicación de escritorio ChatGPT estén instalados y se hayan ejecutado al menos una vez. Después, ejecuta:

bash <(curl -fsSL https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.sh)
Enter fullscreen mode Exit fullscreen mode

En Windows, usa la variante de PowerShell:

irm https://cdn.deepseek.com/api-docs/codex-deepseek-setup-en.ps1 | iex
Enter fullscreen mode Exit fullscreen mode

En la primera ejecución, el script solicita tu clave API de DeepSeek. Después realiza estas acciones:

  1. Hace una copia de seguridad de ~/.codex/config.toml en ~/.codex/backup-deepseek/.
  2. Escribe un catálogo de modelos en ~/.codex/models.json.
  3. Añade una sección [model_providers.deepseek] a la configuración.
  4. Conserva los servidores MCP y la configuración de confianza del proyecto.
  5. Valida la sintaxis antes de escribir cambios.

Puedes ejecutarlo de nuevo para cambiar de modelo o restaurar la configuración original desde el menú.

La precaución estándar se aplica al canalizar curl a bash: revisa el script primero si esa es tu política. El comportamiento de copia de seguridad y validación es una buena señal, pero sigue siendo un script de terceros que modifica tu configuración de Codex.

Lo que te dice el catálogo de modelos

Vale la pena leer el archivo models.json que escribe el script, porque documenta cómo DeepSeek posiciona el modelo dentro de Codex:

  • Ventana de contexto: 1.048.576 tokens.
  • Niveles de razonamiento: low, high y max; high es el valor predeterminado.
  • Llamadas de herramientas paralelas soportadas.
  • Requiere la versión 0.144.0 o posterior del cliente de Codex.

El catálogo describe V4-Flash como el «último modelo de codificación agéntica de vanguardia», y solo deepseek-v4-flash funciona hoy. El catálogo ya incluye deepseek-v4-pro para cuando llegue el soporte a principios de agosto.

¿Realmente funciona bien dentro de Codex?

La propuesta de DeepSeek es que el reentrenamiento posterior al 0731 estaba dirigido exactamente a esta carga de trabajo.

Sus cifras de agentes publicadas son:

  • Terminal Bench 2.1: 82.7
  • Cybergym: 76.7
  • Toolathlon verificado: 70.3
  • DeepSWE: 54.4

Todos fueron reportados como superiores a V4-Pro-Preview. Trata estas cifras como números del proveedor hasta que aparezcan ejecuciones independientes: fueron producidos con el propio arnés de DeepSeek con el máximo esfuerzo, y dos de los puntos de referencia del anuncio son conjuntos de pruebas internos.

La economía es más difícil de discutir. A 0,14 $ por millón de tokens de entrada sin acierto de caché y 0,28 $ por millón de tokens de salida, V4-Flash cuesta una fracción de los modelos que Codex ejecuta normalmente. Los aciertos de caché reducen el coste de entrada a 0,0028 $.

Para ver la tabla de costes completa, consulta la sección de precios de nuestra guía beta. Si estás comparando Codex con alternativas, nuestra comparación de Claude Code vs Codex CLI cubre el lado del agente de la ecuación.

Verifica el punto final antes de confiar en el agente

Un agente es tan depurable como la API que lo respalda, y un punto final beta público completamente nuevo merece una prueba antes de dejar que Codex se suelte en un repositorio real.

Puedes hacerlo en cinco minutos con Apidog:

  1. Añade POST https://api.deepseek.com/responses como un punto final y guarda tu clave en una variable de entorno.
  2. Envía una carga mínima de responses.create y confirma la forma de los elementos de salida: un elemento reasoning seguido de un elemento message.
  3. Activa stream: true y observa la secuencia de eventos en vivo. Apidog muestra cada evento SSE a medida que llega, lo que permite verificar si tu cliente escucha response.output_text.delta o espera un evento que nunca llegará.
  4. Guarda una solicitud con una herramienta function y confirma que el formato de salida function_call coincide con lo que espera tu manejador.

Cuando llegue el lanzamiento de V4-Pro Responses en agosto, vuelve a ejecutar las mismas solicitudes guardadas contra el nuevo nombre del modelo y compara el comportamiento. Descarga Apidog gratis y mantén toda la suite en un solo proyecto.

Preguntas frecuentes

¿Qué modelos de DeepSeek funcionan con la API de Responses?

Solo deepseek-v4-flash por ahora. El soporte para deepseek-v4-pro está programado para principios de agosto de 2026.

¿Necesito un nuevo SDK?

No. El SDK oficial de OpenAI funciona: apunta base_url a https://api.deepseek.com y llama a client.responses.create. Los detalles de configuración están en nuestra guía beta pública de V4-Flash.

¿El estado multirrespuesta funciona como la versión de OpenAI?

No. La implementación de DeepSeek no tiene estado: previous_response_id, conversation y store no son compatibles. Envía el historial completo como elementos de entrada en cada llamada.

¿Puedo usar DeepSeek en Codex junto con mi cuenta de OpenAI?

Sí. La configuración añade DeepSeek como proveedor de modelos; el menú del script cambia entre modelos, y tu configuración original se respalda para que puedas restaurarla.

¿Es esto lo mismo que la compatibilidad con la API de Anthropic?

No. Es una característica separada. DeepSeek también expone un punto final en formato Anthropic en https://api.deepseek.com/anthropic, que es como funciona la integración de Claude Code. El punto final de la API de Responses existe para herramientas de agente en formato OpenAI como Codex.

Lo que realmente señala este lanzamiento

La calidad de los modelos está convergiendo, por lo que la competencia se está moviendo a la capa de integración. DeepSeek analizó dónde residen realmente los desarrolladores, dentro de agentes como Codex, y construyó la infraestructura necesaria para ser un backend de reemplazo allí, hasta el punto de publicar qué parámetros se ignoran silenciosamente.

Esa transparencia es poco habitual y hace que la historia de compatibilidad sea creíble.

La jugada es obvia e inteligente: OpenAI entrega el agente y DeepSeek sirve los tokens a una décima parte del precio. Si el modelo 0731 realmente supera a V4-Pro-Preview en tu base de código es algo que solo tus propias evaluaciones pueden responder.

Conéctalo a Apidog, ejecuta tu suite de pruebas contra ambos y deja que los resultados, no la tabla de benchmarks, decidan.

Top comments (0)