DeepSeek lanzó la API oficial de DeepSeek-V4-Flash el 31 de julio de 2026. Según el anuncio y las notas de versión, el modelo mejora sus capacidades de agente, incorpora soporte nativo para la API de Respuestas de OpenAI y funciona con Codex desde el primer día.
Si ya llamabas a deepseek-v4-flash desde abril, utilizabas la versión preliminar. Ahora ese mismo identificador apunta a la versión oficial, DeepSeek-V4-Flash-0731, sin cambios de código ni migración.
Esta guía muestra cómo crear una clave, hacer llamadas con curl, Python y Node.js, configurar el modo de pensamiento, consumir respuestas en streaming y probar los endpoints. Si aún no conoces esta familia de modelos, empieza por ¿Qué es DeepSeek V4?.
💡 Cuando tengas una clave, prueba los endpoints antes de integrarlos. Apidog permite enviar solicitudes a la API de DeepSeek, inspeccionar eventos SSE de streaming y guardar solicitudes funcionales como pruebas reutilizables.
Lo que se lanzó el 31 de julio
Según el registro de cambios oficial, este lanzamiento cubre únicamente la API. La aplicación de DeepSeek, los modelos web y V4-Pro no cambian.
- DeepSeek-V4-Flash-0731 es la versión oficial de V4-Flash y está en beta pública mediante la API.
- Mantiene la misma arquitectura y tamaño que
V4-Flash-Preview. DeepSeek indica que el modelo fue reentrenado; las mejoras no provienen de una red más grande. - Sus benchmarks de agentes superan a V4-Pro-Preview, según las evaluaciones publicadas por DeepSeek: Terminal Bench 2.1 (82.7), Cybergym (76.7), Toolathlon verificado (70.3) y DeepSWE (54.4). Los resultados se probaron con el arnés de DeepSeek y el máximo esfuerzo.
- Incluye soporte nativo para la API de Respuestas e integración oficial con Codex. Consulta DeepSeek-V4-Flash ahora es compatible con la API de Respuestas y Codex.
- El lanzamiento oficial de DeepSeek-V4-Pro llegará próximamente. El registro de cambios anticipa soporte para la API de Respuestas y Codex para V4-Pro a principios de agosto de 2026.
Ten en cuenta que la afirmación de que supera ampliamente a V4-Pro-Preview procede de las evaluaciones de DeepSeek. Además, DSBench-FullStack y DSBench-Hard son conjuntos de pruebas internos. Conviene validar el modelo con tus propios prompts y pruebas de regresión.
Paso 1: crea una clave API
Ve a la Plataforma DeepSeek, inicia sesión y crea una clave en la página de claves API. Las claves empiezan por sk-.
No incluyas la clave directamente en el código. Guárdala como variable de entorno:
export DEEPSEEK_API_KEY="sk-your-key-here"
La API es compatible con los formatos de OpenAI y Anthropic, así que puedes reutilizar SDKs existentes.
| Formato | URL base |
|---|---|
| Compatible con OpenAI | https://api.deepseek.com |
| Compatible con Anthropic | https://api.deepseek.com/anthropic |
Paso 2: realiza una primera llamada
Empieza con una prueba mínima mediante curl:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Eres un asistente útil."},
{"role": "user", "content": "Resume qué cambió en DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Si recibes una respuesta válida, la autenticación, la URL base y el nombre del modelo están configurados correctamente.
Python con el SDK de OpenAI
Instala el SDK:
pip3 install openai
Después, configura base_url para apuntar a DeepSeek:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Eres un asistente útil."},
{
"role": "user",
"content": "Escribe una función Python que valide una dirección de correo electrónico."
}
],
stream=False
)
print(response.choices[0].message.content)
Node.js con el SDK de OpenAI
Instala el paquete:
npm install openai
Luego crea el cliente:
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{ role: "user", content: "¡Hola!" }
],
});
console.log(completion.choices[0].message.content);
El identificador deepseek-v4-flash apunta ahora a la versión 0731. Si ya usabas la versión preliminar, tu integración adoptará el modelo actualizado automáticamente.
Paso 3: controla el modo de pensamiento
V4-Flash admite modo con pensamiento y modo sin pensamiento. El modo con pensamiento está activado de forma predeterminada.
Usa thinking para habilitarlo o deshabilitarlo, y reasoning_effort para ajustar la profundidad del razonamiento:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Planifica una migración de base de datos de MySQL a Postgres."
}
],
reasoning_effort="high",
extra_body={"thinking": {"type": "enabled"}}
)
Antes de ajustar estos parámetros, considera estas restricciones:
-
temperatureytop_pno tienen efecto cuando el modo de pensamiento está activado. - FIM (fill-in-the-middle), aún en beta, solo funciona en modo sin pensamiento.
Como regla práctica:
- Desactiva el pensamiento para escenarios sensibles a la latencia, como autocompletado.
- Actívalo y usa un esfuerzo mayor para agentes, depuración compleja o planificación de varios pasos.
Paso 4: consume respuestas en streaming
Establece stream=True para recibir eventos enviados por el servidor (SSE). Si necesitas revisar el formato de estos eventos, consulta esta guía sobre cómo transmitir respuestas de LLM usando eventos enviados por el servidor.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "Explica la agrupación de conexiones."}
],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
En producción, procesa cada fragmento incrementalmente en lugar de esperar a que finalice la respuesta. Esto reduce la latencia percibida en interfaces de chat y flujos de agentes.
Precios durante la beta pública
Según la página oficial de modelos y precios, V4-Flash mantiene estos precios:
| Elemento | deepseek-v4-flash |
deepseek-v4-pro |
|---|---|---|
| Entrada, acierto de caché por 1M de tokens | $0.0028 | $0.003625 |
| Entrada, fallo de caché por 1M de tokens | $0.14 | $0.435 |
| Salida por 1M de tokens | $0.28 | $0.87 |
| Longitud de contexto | 1M de tokens | 1M de tokens |
| Salida máxima | 384K | 384K |
| Límite de concurrencia | 2,500 | 500 |
Puntos importantes para estimar costes:
- El almacenamiento en caché de contexto es automático. Un acierto de caché cuesta 50 veces menos que un fallo, por lo que los agentes que reutilizan prompts de sistema largos se benefician especialmente.
- DeepSeek anunció una política de hora punta y hora valle. El uso entre 9:00-12:00 y 14:00-18:00, hora de Pekín, se facturaría al doble del precio regular. Al 31 de julio, la documentación indica que la fecha efectiva está pendiente de anuncio oficial.
- El límite de concurrencia es de 2,500 solicitudes para Flash frente a 500 para Pro, lo que indica que Flash está orientado a cargas intensivas de agentes.
Para comparar costes dentro de la familia V4, incluida la reducción permanente de precio de V4-Pro, consulta el desglose de precios de la API DeepSeek V4.
Prueba y depura la API en Apidog
curl es suficiente para una prueba rápida, pero no para comparar variantes de prompts, alternar el modo de pensamiento o inspeccionar eventos de streaming. Puedes configurar un flujo de pruebas en Apidog en pocos minutos.
Crea un proyecto y añade el endpoint. Configura
POST https://api.deepseek.com/chat/completions. También puedes importar una especificación compatible con OpenAI para añadir varios endpoints a la vez.Guarda la clave en un entorno. Crea la variable
DEEPSEEK_API_KEYy úsala en el encabezado:
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Así puedes alternar entre claves de prueba y producción sin modificar solicitudes.
Envía solicitudes e inspecciona la salida. En llamadas con streaming, Apidog muestra eventos SSE a medida que llegan. Esto facilita distinguir los deltas de razonamiento de los deltas de contenido, sin revisar manualmente líneas
data:.Guarda variantes como pruebas. Mantén una solicitud con pensamiento activado y otra con pensamiento desactivado. Ejecútalas tras cada actualización del modelo para detectar cambios en respuestas, latencia o comportamiento de herramientas.
Puedes descargar Apidog gratis; este flujo funciona con el plan gratuito.
Preguntas frecuentes
¿Necesito cambiar mi código para obtener el nuevo modelo?
No. deepseek-v4-flash sirve ahora DeepSeek-V4-Flash-0731. Las integraciones existentes se actualizan automáticamente.
¿Es el mismo modelo que usa la aplicación de DeepSeek?
No. La actualización del 31 de julio cubre únicamente la API. La aplicación y los modelos web no cambian.
¿Qué ocurrió con deepseek-chat y deepseek-reasoner?
Estos nombres de modelo heredados estaban programados para retirarse el 24 de julio de 2026. Usa deepseek-v4-flash o deepseek-v4-pro. Consulta la guía sobre cómo usar la API DeepSeek V4 para revisar la migración.
¿Puedo usarlo gratis?
La API de DeepSeek funciona con pago por uso y no tiene un nivel gratuito permanente. Sin embargo, los precios por acierto de caché reducen mucho el coste de experimentar con contextos reutilizados. Consulta cómo usar la API DeepSeek V4 gratis para conocer las opciones actuales.
¿V4-Flash funciona con Codex y la API de Respuestas?
Sí. V4-Flash es, por ahora, el único modelo de DeepSeek compatible con ambos. Se espera soporte para V4-Pro a principios de agosto de 2026. Revisa la guía de la API de Respuestas y Codex para la configuración completa.
En resumen
DeepSeek-V4-Flash-0731 mantiene el mismo nombre de modelo, arquitectura y precios que su versión preliminar, pero incorpora mejoras de entrenamiento orientadas a cargas de trabajo de agentes. También añade soporte nativo para la API de Respuestas y Codex.
Configura una clave, apunta tu SDK compatible con OpenAI a https://api.deepseek.com y ejecuta tu propia suite de prompts antes de confiar en benchmarks publicados. Apidog puede acelerar ese proceso: guarda solicitudes como pruebas, compara configuraciones y vuelve a ejecutarlas cuando DeepSeek actualice el modelo.


Top comments (0)