DeepSeek V4 Pro salió de la fase de previsualización el 12 de agosto de 2026. La versión de disponibilidad general (GA), identificada como 0813, sirve el endpoint deepseek-v4-pro con una ventana de contexto de 1M de tokens, hasta 384K tokens de salida y un precio de entrada de $0.003625 por millón de tokens en aciertos de caché. Según Unite.AI, el modelo pasó cuatro meses en previsualización antes de convertirse en el buque insignia de DeepSeek.
Esta guía se centra en la implementación: configurar el SDK de OpenAI, elegir modos de pensamiento, procesar reasoning_content, habilitar streaming SSE, ejecutar llamadas a herramientas y estructurar prompts para maximizar la caché. Para conocer primero la arquitectura, consulta Qué es DeepSeek V4.
TL;DR
- La instantánea GA
0813está detrás del endpointdeepseek-v4-prodesde el 12 de agosto de 2026. - La API es compatible con OpenAI: configura el SDK
openaiconhttps://api.deepseek.comy usamodel="deepseek-v4-pro". - Ofrece 1M de tokens de contexto, hasta 384K de salida y tres modos:
non-think,think highythink max. - Los modos de pensamiento devuelven
reasoning_contentademás de la respuesta final. - La entrada cuesta $0.435/M en fallo de caché y $0.003625/M en acierto de caché; la salida cuesta $0.87/M.
- DeepSeek indicó el 6 de agosto que habrá un aumento “significativo” de precio, pero sin cifras ni fecha.
- Prueba solicitudes, entornos y streaming SSE en Apidog antes de integrar el modelo en producción.
Qué cambia con la compilación GA 0813
La previsualización se abrió en abril de 2026. V4 Flash se lanzó en julio y V4 Pro alcanzó disponibilidad general el 12 de agosto como compilación 0813, siguiendo la convención de fechas de DeepSeek, como v3-0324.
Para desarrollo y producción, la GA cambia tres aspectos importantes:
-
La instantánea es estable. Las versiones preview pueden cambiar sin aviso e invalidar evaluaciones o ajustes de prompts.
0813es un objetivo fijo hasta que DeepSeek publique otra instantánea. -
El alias de producción apunta a la GA. En la API oficial usa
deepseek-v4-pro. Si necesitas fijar explícitamente la instantánea, OpenRouter listadeepseek/deepseek-v4-pro-0813. - Todas las funciones están disponibles. Incluye modos de pensamiento, llamadas a funciones, salidas estructuradas, caché de prompts y compatibilidad con formatos OpenAI, Anthropic y Responses.
Bajo el capó, V4 Pro es un modelo de mezcla de expertos con 1.6T de parámetros totales y 49B activos por token. Sus esquemas de Atención Dispersa Comprimida y Atención Fuertemente Comprimida reducen el cálculo de inferencia por token al 27% de V3.2 y la caché KV al 10%. Esa reducción es relevante para hacer viable una ventana de 1M de tokens.
DeepSeek V4 Pro 0813: especificaciones
| Especificación | DeepSeek V4 Pro 0813 |
|---|---|
| Lanzamiento | GA el 12 de agosto de 2026, instantánea 0813
|
| Arquitectura | Mezcla de expertos, 1.6T parámetros totales, 49B activos por token |
| Atención | Atención Dispersa Comprimida + Atención Fuertemente Comprimida |
| Costo de inferencia frente a V3.2 | 27% del cálculo por token, 10% de la caché KV |
| Ventana de contexto | 1.000.000 tokens |
| Salida máxima | 384K tokens |
| Modos de pensamiento | sin pensamiento, pensamiento alto, pensamiento máximo |
| Precio de entrada | $0.435/M tokens en fallo de caché, $0.003625/M en acierto |
| Precio de salida | $0.87/M tokens |
| Formatos de API | Chat Completions de OpenAI, Messages de Anthropic, Responses de DeepSeek |
| ID del modelo | deepseek-v4-pro |
| Alternativa |
deepseek-v4-flash: 284B total / 13B activos, $0.14/M de entrada y $0.28/M de salida |
La ficha de DeepSeek informa resultados de SWE-bench Verified de 80.6%, Terminal Bench 2.0 de 67.9%, GPQA Diamond de 90.1% y LiveCodeBench de 93.5% para V4-Pro-Max. Son métricas auto-reportadas por el proveedor, así que ejecuta evaluaciones específicas de tu tarea antes de migrar una carga de trabajo importante.
Obtén una clave API y ejecuta tu primera solicitud
Sigue estos pasos:
- Crea una cuenta en platform.deepseek.com y añade crédito. La API es prepago.
- Abre la sección de claves API, genera una clave y cópiala inmediatamente.
- Guarda la clave como variable de entorno:
export DEEPSEEK_API_KEY="sk-..."
La API es compatible con Chat Completions de OpenAI. Usa el paquete openai y apunta el cliente a DeepSeek. Tanto https://api.deepseek.com como https://api.deepseek.com/v1 funcionan como URL base; /v1 es una capa de compatibilidad de protocolo, no una versión del modelo.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "system", "content": "You are a concise technical assistant."},
{"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
],
)
print(response.choices[0].message.content)
print(response.usage)
Registra response.usage desde la primera prueba. En este modelo, la diferencia entre un acierto y un fallo de caché puede cambiar significativamente el costo de una sesión larga.
Para una prueba rápida por HTTP:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{"role": "user", "content": "List three ways to version a REST API."}
]
}'
Consulta la documentación oficial de DeepSeek para todos los parámetros, el endpoint compatible con Anthropic y la API Responses de DeepSeek.
Usa los tres modos de pensamiento
V4 Pro expone el razonamiento mediante un selector. El endpoint es el mismo; cambia el presupuesto de razonamiento según la tarea:
-
Sin pensamiento (
non-think): respuesta directa. Úsalo para clasificación, extracción, formateo y resúmenes. -
Pensamiento alto (
think high): devuelve razonamiento enreasoning_contentantes de la respuesta final. Es una opción práctica para programación, depuración y análisis de varios pasos. -
Pensamiento máximo (
think max): usa el mayor presupuesto de razonamiento. Resérvalo para problemas complejos donde la latencia y el costo adicional estén justificados.
Configura el modo con reasoning_effort:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability.",
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Dos reglas prácticas:
- No reenvíes
reasoning_contentcomo parte del historial de conversación. Conserva y reenvía solocontent. - Los tokens de razonamiento se facturan como salida, a $0.87/M. No establezcas
maxcomo valor predeterminado sin medir costo y latencia.
Habilita respuestas en streaming
Con salidas de hasta 384K tokens y razonamiento extenso, evita esperar a recibir la respuesta completa. Activa stream=True y procesa tanto los deltas de razonamiento como los de contenido:
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": "Design a rate limiter for a public API. Compare token bucket and sliding window.",
},
],
)
for chunk in stream:
if not chunk.choices:
continue # El chunk final puede incluir solo datos de usage.
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
En una interfaz, muestra la fase de razonamiento como un estado colapsado de “pensando” y cambia a la respuesta visible cuando empiecen a llegar deltas de content. El transporte usa eventos enviados por el servidor; consulta esta guía de streaming de respuestas API con SSE para revisar la mecánica.
Implementa llamadas a herramientas y salidas estructuradas
V4 Pro admite llamadas a funciones compatibles con OpenAI. Puedes reutilizar el patrón habitual de agentes:
- Define herramientas.
- Lee
tool_calls. - Ejecuta la función en tu aplicación.
- Añade el resultado al historial.
- Repite hasta obtener una respuesta final.
Ejemplo de definición de herramienta:
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
},
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{"role": "user", "content": "Is /v1/orders healthy right now?"}
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Cuando necesites JSON parseable, usa el parámetro estándar response_format. Para la estructura completa de mensajes de herramientas y respuestas, revisa la documentación oficial.
Diseña prompts para aprovechar la caché
La caché de prompts es una de las características más importantes para la arquitectura. DeepSeek almacena automáticamente prefijos repetidos sin cabeceras especiales ni configuración de TTL:
- Fallo de caché: $0.435/M tokens de entrada
- Acierto de caché: $0.003625/M tokens de entrada
El descuento es de 120 veces para prefijos que la API ya ha procesado.
Supón un agente de código con 200K tokens de contexto de repositorio y 50 llamadas durante una sesión:
-
Sin caché:
50 × 200K × $0.435/M ≈ $4.35 -
Con caché automática: un fallo inicial de
≈ $0.087más 49 aciertos de≈ $0.0007cada uno, para un total aproximado de≈ $0.12
La sesión es aproximadamente 35 veces más barata si mantienes estable el inicio del prompt.
Estructura tus mensajes así:
[Contenido estable]
- Prompt del sistema
- Documentación
- Contexto del repositorio
- Políticas y reglas
[Contenido variable]
- Último mensaje del usuario
- Estado actual de la tarea
- Marcas de tiempo
- IDs de solicitud
Un cambio temprano invalida el prefijo de caché desde ese punto. Por ejemplo, añadir una marca de tiempo al prompt del sistema puede convertir cada llamada en un fallo de caché completo.
Una ventana de contexto de 1M cuesta aproximadamente $0.435 en un fallo, pero si se reutiliza como prefijo estable puede leerse por cerca de un tercio de centavo por llamada. Para más contexto, consulta Qué es el almacenamiento en caché de prompts.
Prueba deepseek-v4-pro en Apidog
Antes de integrar el modelo en producción, valida solicitudes, streaming y consumo con un cliente de API. Como DeepSeek es compatible con OpenAI, Apidog puede trabajar con el endpoint sin una configuración especial.
-
Importa la solicitud. Pega el comando
curlanterior en Apidog para convertirlo en una solicitud editable con cabeceras, autenticación y cuerpo ya analizados. -
Crea entornos para Pro y Flash. Guarda
base_url, la clave API y el nombre del modelo como variables. Cambia entredeepseek-v4-proydeepseek-v4-flashcon un cambio de entorno. -
Inspecciona SSE. Envía una solicitud con
"stream": truepara revisar cómo llegan primero los deltas dereasoning_contenty después los de contenido. - Guarda una colección de regresión. Cuando DeepSeek publique otra instantánea, ejecuta las mismas solicitudes y compara respuestas, latencia y uso antes de actualizar.
El visor de respuestas también muestra usage en cada solicitud, útil para comprobar la proporción de aciertos de caché mientras ajustas prompts.
Precios actuales y aumento anunciado
Precios de lista para los endpoints V4:
| Modelo | Entrada, fallo de caché | Entrada, acierto de caché | Salida |
|---|---|---|---|
deepseek-v4-pro |
$0.435/M | $0.003625/M | $0.87/M |
deepseek-v4-flash |
$0.14/M | — | $0.28/M |
El 6 de agosto de 2026, DeepSeek avisó de un aumento “significativo” en el precio de la API. No publicó cifras ni fecha de aplicación.
Mientras no haya más detalles:
- Mide el costo por tarea con datos reales de
usage. - Maximiza los aciertos de caché manteniendo estables los prefijos.
- Mantén V4 Flash como opción de enrutamiento para tareas simples y de alto volumen.
- Reserva Pro para codificación agéntica, análisis de contexto largo y tareas que requieran razonamiento.
Consulta la guía de precios de la API DeepSeek V4 para un desglose más detallado.
Preguntas frecuentes
¿Funcionará mi código existente del SDK de OpenAI sin cambios?
Casi. Cambia base_url a https://api.deepseek.com, usa una clave de DeepSeek y establece model="deepseek-v4-pro". Chat Completions, streaming, herramientas y salidas estructuradas siguen formatos compatibles con OpenAI.
Si tu equipo usa Anthropic, puede utilizar el endpoint Messages compatible de DeepSeek.
¿Cuándo debería usar V4 Flash en lugar de V4 Pro?
Usa Flash para clasificación, extracción, chat simple y cargas sensibles a la latencia que no necesiten razonamiento profundo. Usa Pro para programación agéntica, análisis de contexto largo y tareas que aprovechen los modos de pensamiento.
Enruta por tipo de tarea y métricas reales, no por preferencia de modelo.
¿Puedo usar V4 Pro 0813 en Cursor?
Sí. Cursor acepta endpoints personalizados compatibles con OpenAI, por lo que puedes configurar la compilación GA como modelo personalizado. Consulta Cómo usar DeepSeek V4 Pro con Cursor.
Para terminar
Empieza con una clave API, una solicitud mínima, streaming y métricas de usage. Después, selecciona el modo de pensamiento según la tarea y estructura los prompts para mantener los prefijos estables.
El descuento de caché de 120 veces convierte el diseño del prompt en una decisión de arquitectura. Guarda una colección de pruebas en Apidog, vuelve a ejecutarla cuando llegue una nueva instantánea y mide el impacto de cualquier cambio de precio.


Top comments (0)