DEV Community

Cover image for ¿Cómo usar la API DeepSeek V4 Pro 0813?
Roobia
Roobia

Posted on • Originally published at apidog.com

¿Cómo usar la API DeepSeek V4 Pro 0813?

DeepSeek V4 Pro salió de la fase de previsualización el 12 de agosto de 2026. La versión de disponibilidad general (GA), identificada como 0813, sirve el endpoint deepseek-v4-pro con una ventana de contexto de 1M de tokens, hasta 384K tokens de salida y un precio de entrada de $0.003625 por millón de tokens en aciertos de caché. Según Unite.AI, el modelo pasó cuatro meses en previsualización antes de convertirse en el buque insignia de DeepSeek.

Prueba Apidog hoy

Esta guía se centra en la implementación: configurar el SDK de OpenAI, elegir modos de pensamiento, procesar reasoning_content, habilitar streaming SSE, ejecutar llamadas a herramientas y estructurar prompts para maximizar la caché. Para conocer primero la arquitectura, consulta Qué es DeepSeek V4.

TL;DR

  • La instantánea GA 0813 está detrás del endpoint deepseek-v4-pro desde el 12 de agosto de 2026.
  • La API es compatible con OpenAI: configura el SDK openai con https://api.deepseek.com y usa model="deepseek-v4-pro".
  • Ofrece 1M de tokens de contexto, hasta 384K de salida y tres modos: non-think, think high y think max.
  • Los modos de pensamiento devuelven reasoning_content además de la respuesta final.
  • La entrada cuesta $0.435/M en fallo de caché y $0.003625/M en acierto de caché; la salida cuesta $0.87/M.
  • DeepSeek indicó el 6 de agosto que habrá un aumento “significativo” de precio, pero sin cifras ni fecha.
  • Prueba solicitudes, entornos y streaming SSE en Apidog antes de integrar el modelo en producción.

Qué cambia con la compilación GA 0813

La previsualización se abrió en abril de 2026. V4 Flash se lanzó en julio y V4 Pro alcanzó disponibilidad general el 12 de agosto como compilación 0813, siguiendo la convención de fechas de DeepSeek, como v3-0324.

DeepSeek V4 Pro GA 0813

Para desarrollo y producción, la GA cambia tres aspectos importantes:

  1. La instantánea es estable. Las versiones preview pueden cambiar sin aviso e invalidar evaluaciones o ajustes de prompts. 0813 es un objetivo fijo hasta que DeepSeek publique otra instantánea.
  2. El alias de producción apunta a la GA. En la API oficial usa deepseek-v4-pro. Si necesitas fijar explícitamente la instantánea, OpenRouter lista deepseek/deepseek-v4-pro-0813.
  3. Todas las funciones están disponibles. Incluye modos de pensamiento, llamadas a funciones, salidas estructuradas, caché de prompts y compatibilidad con formatos OpenAI, Anthropic y Responses.

Bajo el capó, V4 Pro es un modelo de mezcla de expertos con 1.6T de parámetros totales y 49B activos por token. Sus esquemas de Atención Dispersa Comprimida y Atención Fuertemente Comprimida reducen el cálculo de inferencia por token al 27% de V3.2 y la caché KV al 10%. Esa reducción es relevante para hacer viable una ventana de 1M de tokens.

DeepSeek V4 Pro 0813: especificaciones

Especificación DeepSeek V4 Pro 0813
Lanzamiento GA el 12 de agosto de 2026, instantánea 0813
Arquitectura Mezcla de expertos, 1.6T parámetros totales, 49B activos por token
Atención Atención Dispersa Comprimida + Atención Fuertemente Comprimida
Costo de inferencia frente a V3.2 27% del cálculo por token, 10% de la caché KV
Ventana de contexto 1.000.000 tokens
Salida máxima 384K tokens
Modos de pensamiento sin pensamiento, pensamiento alto, pensamiento máximo
Precio de entrada $0.435/M tokens en fallo de caché, $0.003625/M en acierto
Precio de salida $0.87/M tokens
Formatos de API Chat Completions de OpenAI, Messages de Anthropic, Responses de DeepSeek
ID del modelo deepseek-v4-pro
Alternativa deepseek-v4-flash: 284B total / 13B activos, $0.14/M de entrada y $0.28/M de salida

La ficha de DeepSeek informa resultados de SWE-bench Verified de 80.6%, Terminal Bench 2.0 de 67.9%, GPQA Diamond de 90.1% y LiveCodeBench de 93.5% para V4-Pro-Max. Son métricas auto-reportadas por el proveedor, así que ejecuta evaluaciones específicas de tu tarea antes de migrar una carga de trabajo importante.

Obtén una clave API y ejecuta tu primera solicitud

Sigue estos pasos:

  1. Crea una cuenta en platform.deepseek.com y añade crédito. La API es prepago.
  2. Abre la sección de claves API, genera una clave y cópiala inmediatamente.
  3. Guarda la clave como variable de entorno:
export DEEPSEEK_API_KEY="sk-..."
Enter fullscreen mode Exit fullscreen mode

La API es compatible con Chat Completions de OpenAI. Usa el paquete openai y apunta el cliente a DeepSeek. Tanto https://api.deepseek.com como https://api.deepseek.com/v1 funcionan como URL base; /v1 es una capa de compatibilidad de protocolo, no una versión del modelo.

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "system", "content": "You are a concise technical assistant."},
        {"role": "user", "content": "Explain idempotency in REST APIs in two sentences."},
    ],
)

print(response.choices[0].message.content)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Registra response.usage desde la primera prueba. En este modelo, la diferencia entre un acierto y un fallo de caché puede cambiar significativamente el costo de una sesión larga.

Para una prueba rápida por HTTP:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {"role": "user", "content": "List three ways to version a REST API."}
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Consulta la documentación oficial de DeepSeek para todos los parámetros, el endpoint compatible con Anthropic y la API Responses de DeepSeek.

Usa los tres modos de pensamiento

V4 Pro expone el razonamiento mediante un selector. El endpoint es el mismo; cambia el presupuesto de razonamiento según la tarea:

  • Sin pensamiento (non-think): respuesta directa. Úsalo para clasificación, extracción, formateo y resúmenes.
  • Pensamiento alto (think high): devuelve razonamiento en reasoning_content antes de la respuesta final. Es una opción práctica para programación, depuración y análisis de varios pasos.
  • Pensamiento máximo (think max): usa el mayor presupuesto de razonamiento. Resérvalo para problemas complejos donde la latencia y el costo adicional estén justificados.

Configura el modo con reasoning_effort:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",  # "none" | "high" | "max"
    messages=[
        {
            "role": "user",
            "content": "Our API returns 502s under load but only behind the CDN. Walk through likely causes in order of probability.",
        },
    ],
)

message = response.choices[0].message

print("--- Reasoning ---")
print(message.reasoning_content)

print("--- Answer ---")
print(message.content)
Enter fullscreen mode Exit fullscreen mode

Dos reglas prácticas:

  1. No reenvíes reasoning_content como parte del historial de conversación. Conserva y reenvía solo content.
  2. Los tokens de razonamiento se facturan como salida, a $0.87/M. No establezcas max como valor predeterminado sin medir costo y latencia.

Habilita respuestas en streaming

Con salidas de hasta 384K tokens y razonamiento extenso, evita esperar a recibir la respuesta completa. Activa stream=True y procesa tanto los deltas de razonamiento como los de contenido:

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": "Design a rate limiter for a public API. Compare token bucket and sliding window.",
        },
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue  # El chunk final puede incluir solo datos de usage.

    delta = chunk.choices[0].delta

    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True)
    elif delta.content:
        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

En una interfaz, muestra la fase de razonamiento como un estado colapsado de “pensando” y cambia a la respuesta visible cuando empiecen a llegar deltas de content. El transporte usa eventos enviados por el servidor; consulta esta guía de streaming de respuestas API con SSE para revisar la mecánica.

Implementa llamadas a herramientas y salidas estructuradas

V4 Pro admite llamadas a funciones compatibles con OpenAI. Puedes reutilizar el patrón habitual de agentes:

  1. Define herramientas.
  2. Lee tool_calls.
  3. Ejecuta la función en tu aplicación.
  4. Añade el resultado al historial.
  5. Repite hasta obtener una respuesta final.

Ejemplo de definición de herramienta:

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {
                    "type": "string",
                    "description": "Path, e.g. /v1/orders",
                },
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {"role": "user", "content": "Is /v1/orders healthy right now?"}
    ],
    tools=tools,
)

print(response.choices[0].message.tool_calls)
Enter fullscreen mode Exit fullscreen mode

Cuando necesites JSON parseable, usa el parámetro estándar response_format. Para la estructura completa de mensajes de herramientas y respuestas, revisa la documentación oficial.

Diseña prompts para aprovechar la caché

La caché de prompts es una de las características más importantes para la arquitectura. DeepSeek almacena automáticamente prefijos repetidos sin cabeceras especiales ni configuración de TTL:

  • Fallo de caché: $0.435/M tokens de entrada
  • Acierto de caché: $0.003625/M tokens de entrada

El descuento es de 120 veces para prefijos que la API ya ha procesado.

Supón un agente de código con 200K tokens de contexto de repositorio y 50 llamadas durante una sesión:

  • Sin caché: 50 × 200K × $0.435/M ≈ $4.35
  • Con caché automática: un fallo inicial de ≈ $0.087 más 49 aciertos de ≈ $0.0007 cada uno, para un total aproximado de ≈ $0.12

La sesión es aproximadamente 35 veces más barata si mantienes estable el inicio del prompt.

Estructura tus mensajes así:

[Contenido estable]
- Prompt del sistema
- Documentación
- Contexto del repositorio
- Políticas y reglas

[Contenido variable]
- Último mensaje del usuario
- Estado actual de la tarea
- Marcas de tiempo
- IDs de solicitud
Enter fullscreen mode Exit fullscreen mode

Un cambio temprano invalida el prefijo de caché desde ese punto. Por ejemplo, añadir una marca de tiempo al prompt del sistema puede convertir cada llamada en un fallo de caché completo.

Una ventana de contexto de 1M cuesta aproximadamente $0.435 en un fallo, pero si se reutiliza como prefijo estable puede leerse por cerca de un tercio de centavo por llamada. Para más contexto, consulta Qué es el almacenamiento en caché de prompts.

Prueba deepseek-v4-pro en Apidog

Antes de integrar el modelo en producción, valida solicitudes, streaming y consumo con un cliente de API. Como DeepSeek es compatible con OpenAI, Apidog puede trabajar con el endpoint sin una configuración especial.

Prueba de DeepSeek V4 Pro en Apidog

  1. Importa la solicitud. Pega el comando curl anterior en Apidog para convertirlo en una solicitud editable con cabeceras, autenticación y cuerpo ya analizados.
  2. Crea entornos para Pro y Flash. Guarda base_url, la clave API y el nombre del modelo como variables. Cambia entre deepseek-v4-pro y deepseek-v4-flash con un cambio de entorno.
  3. Inspecciona SSE. Envía una solicitud con "stream": true para revisar cómo llegan primero los deltas de reasoning_content y después los de contenido.
  4. Guarda una colección de regresión. Cuando DeepSeek publique otra instantánea, ejecuta las mismas solicitudes y compara respuestas, latencia y uso antes de actualizar.

El visor de respuestas también muestra usage en cada solicitud, útil para comprobar la proporción de aciertos de caché mientras ajustas prompts.

Precios actuales y aumento anunciado

Precios de lista para los endpoints V4:

Modelo Entrada, fallo de caché Entrada, acierto de caché Salida
deepseek-v4-pro $0.435/M $0.003625/M $0.87/M
deepseek-v4-flash $0.14/M $0.28/M

El 6 de agosto de 2026, DeepSeek avisó de un aumento “significativo” en el precio de la API. No publicó cifras ni fecha de aplicación.

Mientras no haya más detalles:

  • Mide el costo por tarea con datos reales de usage.
  • Maximiza los aciertos de caché manteniendo estables los prefijos.
  • Mantén V4 Flash como opción de enrutamiento para tareas simples y de alto volumen.
  • Reserva Pro para codificación agéntica, análisis de contexto largo y tareas que requieran razonamiento.

Consulta la guía de precios de la API DeepSeek V4 para un desglose más detallado.

Preguntas frecuentes

¿Funcionará mi código existente del SDK de OpenAI sin cambios?

Casi. Cambia base_url a https://api.deepseek.com, usa una clave de DeepSeek y establece model="deepseek-v4-pro". Chat Completions, streaming, herramientas y salidas estructuradas siguen formatos compatibles con OpenAI.

Si tu equipo usa Anthropic, puede utilizar el endpoint Messages compatible de DeepSeek.

¿Cuándo debería usar V4 Flash en lugar de V4 Pro?

Usa Flash para clasificación, extracción, chat simple y cargas sensibles a la latencia que no necesiten razonamiento profundo. Usa Pro para programación agéntica, análisis de contexto largo y tareas que aprovechen los modos de pensamiento.

Enruta por tipo de tarea y métricas reales, no por preferencia de modelo.

¿Puedo usar V4 Pro 0813 en Cursor?

Sí. Cursor acepta endpoints personalizados compatibles con OpenAI, por lo que puedes configurar la compilación GA como modelo personalizado. Consulta Cómo usar DeepSeek V4 Pro con Cursor.

Para terminar

Empieza con una clave API, una solicitud mínima, streaming y métricas de usage. Después, selecciona el modo de pensamiento según la tarea y estructura los prompts para mantener los prefijos estables.

El descuento de caché de 120 veces convierte el diseño del prompt en una decisión de arquitectura. Guarda una colección de pruebas en Apidog, vuelve a ejecutarla cuando llegue una nueva instantánea y mide el impacto de cualquier cambio de precio.

Top comments (0)