DEV Community

Cover image for Como Usar a API DeepSeek V4 Pro 0813?
Lucas
Lucas

Posted on Originally published at apidog.com

Como Usar a API DeepSeek V4 Pro 0813?

DeepSeek V4 Pro saiu da prévia em 12 de agosto de 2026. A versão GA (disponibilidade geral), identificada pelo snapshot 0813, atende o endpoint deepseek-v4-pro e oferece janela de contexto de 1 milhão de tokens, até 384 mil tokens de saída e entrada a $0,003625 por milhão de tokens em cache hit. Conforme relatado pela Unite.AI, o modelo passou quatro meses em prévia antes de se tornar o carro-chefe da DeepSeek.

Experimente o Apidog hoje

Este guia foca na implementação: primeira chamada com o SDK OpenAI, modos de pensamento, reasoning_content, streaming, ferramentas e cache de prompt. Para o contexto de arquitetura, leia O que é DeepSeek V4.

TL;DR

  • Use deepseek-v4-pro para acessar o snapshot GA 0813 a partir de 12 de agosto de 2026.
  • A API é compatível com OpenAI: configure o SDK openai com https://api.deepseek.com.
  • O modelo oferece 1 milhão de tokens de contexto, até 384 mil tokens de saída e os modos non-think, think high e think max.
  • Preços: entrada de $0.435/M em cache miss, $0.003625/M em cache hit e saída de $0.87/M.
  • Prefixos de prompt repetidos são armazenados em cache automaticamente.
  • A DeepSeek avisou em 6 de agosto sobre um aumento “significativo” de preços, ainda sem valores ou data.
  • Teste requisições, streaming SSE e comparações entre Pro e Flash no Apidog antes de levar a integração para produção.

O que a versão GA 0813 muda para desenvolvedores

A prévia foi lançada em abril de 2026. O V4 Flash chegou em julho e, em 12 de agosto, o V4 Pro passou para GA com o snapshot 0813, seguindo a convenção de versões datadas da DeepSeek.

DeepSeek V4 Pro GA

Na prática, o GA traz três mudanças importantes:

  1. Snapshot estável

    Modelos em prévia podem mudar sem aviso e invalidar avaliações ou ajustes de prompt. O 0813 é um alvo fixo até o lançamento de outro snapshot.

  2. Alias de produção

    Na API oficial, use deepseek-v4-pro. Para referenciar explicitamente o snapshot, o OpenRouter lista deepseek/deepseek-v4-pro-0813.

  3. Recursos completos no endpoint

    Modos de pensamento, chamada de função, saídas estruturadas, cache de prompt e formatos OpenAI, Anthropic e Responses estão disponíveis.

O V4 Pro é um modelo de mistura de especialistas com 1.6T de parâmetros totais e 49B ativos por token. A DeepSeek informa que os mecanismos Compressed Sparse Attention e Heavily Compressed Attention reduzem o cálculo de inferência de token único para 27% do V3.2 e o cache KV para 10%.

DeepSeek V4 Pro 0813: especificações

Especificação DeepSeek V4 Pro 0813
Lançamento GA em 12 de agosto de 2026 (0813)
Arquitetura Mistura de especialistas, 1.6T parâmetros totais, 49B ativos por token
Atenção Compressed Sparse Attention + Heavily Compressed Attention
Custo de inferência vs. V3.2 27% do cálculo de token único, 10% do cache KV
Janela de contexto 1.000.000 tokens
Saída máxima 384 mil tokens
Modos de pensamento non-think, think high, think max
Entrada $0.435/M em cache miss; $0.003625/M em cache hit
Saída $0.87/M
Formatos de API OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses
ID do modelo deepseek-v4-pro
Modelo menor deepseek-v4-flash — 284B total / 13B ativo, $0.14/M entrada e $0.28/M saída

O cartão de modelo da DeepSeek informa 80.6% no SWE-bench Verified, 67.9% no Terminal Bench 2.0, 90.1% no GPQA Diamond e 93.5% no LiveCodeBench para V4-Pro-Max. Esses resultados são auto-relatados pelo fornecedor; execute avaliações com suas próprias tarefas antes de migrar uma carga de trabalho crítica.

Obtenha uma chave de API e faça a primeira chamada

Siga este fluxo:

  1. Crie uma conta em platform.deepseek.com e adicione crédito. A API é pré-paga.
  2. Gere uma chave em API Keys e copie-a imediatamente.
  3. Exporte a chave como variável de ambiente:
export DEEPSEEK_API_KEY="sk-..."
Enter fullscreen mode Exit fullscreen mode

A API usa o protocolo OpenAI Chat Completions. Instale o cliente:

pip install openai
Enter fullscreen mode Exit fullscreen mode

Faça uma chamada com Python:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["DEEPSEEK_API_KEY"],
    base_url="https://api.deepseek.com",
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "system",
            "content": "You are a concise technical assistant.",
        },
        {
            "role": "user",
            "content": "Explain idempotency in REST APIs in two sentences.",
        },
    ],
)

print(response.choices[0].message.content)
print(response.usage)
Enter fullscreen mode Exit fullscreen mode

Tanto https://api.deepseek.com quanto https://api.deepseek.com/v1 funcionam como base_url. O sufixo /v1 existe para compatibilidade de protocolo, não para selecionar uma versão do modelo.

Monitore response.usage desde a primeira integração. Em contextos longos, a diferença entre cache hit e cache miss pode mudar substancialmente o custo.

Para um teste de fumaça com HTTP bruto:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [
      {
        "role": "user",
        "content": "List three ways to version a REST API."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Consulte os documentos oficiais da DeepSeek para parâmetros adicionais, endpoint Anthropic Messages e a API Responses da DeepSeek.

Trabalhando com os três modos de pensamento

O V4 Pro expõe o nível de raciocínio por meio de reasoning_effort:

  • none: resposta direta; use para classificação, extração, formatação e resumo.
  • high: raciocínio antes da resposta; recomendado para código, depuração e análise em várias etapas.
  • max: orçamento máximo de raciocínio; reserve para problemas complexos.

Exemplo com high:

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",  # "none" | "high" | "max"
    messages=[
        {
            "role": "user",
            "content": (
                "Our API returns 502s under load but only behind the CDN. "
                "Walk through likely causes in order of probability."
            ),
        },
    ],
)

message = response.choices[0].message

print("--- Reasoning ---")
print(message.reasoning_content)

print("--- Answer ---")
print(message.content)
Enter fullscreen mode Exit fullscreen mode

Ao implementar conversas multi-turno:

  • Não reenvie reasoning_content no histórico.
  • Envie apenas o content das respostas anteriores.
  • Considere tokens de raciocínio como tokens de saída, cobrados a $0.87/M.
  • Escolha o modo por tarefa em vez de usar max como padrão.

Respostas em streaming

Para respostas longas, use streaming. Em modos de pensamento, os deltas de reasoning_content podem chegar antes dos deltas de content.

stream = client.chat.completions.create(
    model="deepseek-v4-pro",
    reasoning_effort="high",
    stream=True,
    messages=[
        {
            "role": "user",
            "content": (
                "Design a rate limiter for a public API. "
                "Compare token bucket and sliding window."
            ),
        },
    ],
)

for chunk in stream:
    if not chunk.choices:
        continue  # O chunk final pode conter apenas usage.

    delta = chunk.choices[0].delta

    if getattr(delta, "reasoning_content", None):
        print(delta.reasoning_content, end="", flush=True)
    elif delta.content:
        print(delta.content, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Na interface, uma abordagem útil é exibir o raciocínio como “Pensando...” em uma área recolhida e mostrar a resposta final quando os deltas de content começarem.

O transporte usa Server-Sent Events. Veja o guia sobre streaming de respostas de API com SSE para os detalhes do protocolo.

Chamada de ferramentas e saídas estruturadas

O V4 Pro suporta ferramentas no formato OpenAI. Defina o schema, leia tool_calls, execute a ferramenta e envie o resultado na próxima mensagem do loop.

tools = [{
    "type": "function",
    "function": {
        "name": "get_endpoint_status",
        "description": "Check the health of an internal API endpoint",
        "parameters": {
            "type": "object",
            "properties": {
                "endpoint": {
                    "type": "string",
                    "description": "Path, e.g. /v1/orders",
                }
            },
            "required": ["endpoint"],
        },
    },
}]

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[
        {
            "role": "user",
            "content": "Is /v1/orders healthy right now?",
        }
    ],
    tools=tools,
)

print(response.choices[0].message.tool_calls)
Enter fullscreen mode Exit fullscreen mode

Para JSON analisável, use response_format conforme o formato suportado pela API. Os documentos oficiais detalham o formato das mensagens e o ciclo completo de ferramentas.

Economia de cache de prompt: como estruturar o contexto

A DeepSeek armazena prefixos de prompt automaticamente. Não há cabeçalhos de cache ou configuração manual de TTL.

  • Cache miss: $0.435/M tokens de entrada.
  • Cache hit: $0.003625/M tokens de entrada.
  • Desconto: cerca de 120x para trechos já vistos pela API.

Considere um agente de código com 200 mil tokens de contexto de repositório e 50 chamadas na mesma sessão:

  • Sem cache: 50 × 200 mil × $0.435/M ≈ $4.35
  • Com cache: um miss de $0.087 + 49 hits de aproximadamente $0.0007 cada ≈ $0.12

A diferença depende da ordem do prompt. Organize as mensagens assim:

  1. Conteúdo estável: prompt do sistema, documentação, regras e contexto do repositório.
  2. Conteúdo semi-estável: estado da sessão e resultados reutilizáveis.
  3. Conteúdo volátil: mensagem atual do usuário, timestamps, IDs de requisição e dados dinâmicos.

Um timestamp no início do prompt pode invalidar o prefixo cacheado e transformar cada chamada em cache miss.

Com esse modelo de preço, preencher 1 milhão de tokens custa $0.435 em um miss, mas aproximadamente um terço de centavo em um hit. Para mais contexto, leia O que é cache de prompt.

Testando deepseek-v4-pro no Apidog

Antes de integrar em produção, teste o endpoint em uma ferramenta de depuração. Como a API é compatível com OpenAI, o Apidog pode importar e executar as requisições sem configuração especial.

Testando DeepSeek V4 Pro no Apidog

Fluxo recomendado:

  1. Importe o comando cURL

    Cole o comando anterior no Apidog para gerar uma requisição editável com URL, cabeçalhos, autenticação e corpo.

  2. Crie ambientes para Pro e Flash

    Armazene base_url, chave de API e nome do modelo em variáveis. Assim, você alterna entre deepseek-v4-pro e deepseek-v4-flash sem editar a requisição manualmente.

  3. Inspecione o stream SSE

    Envie uma requisição com "stream": true para observar a sequência de eventos e verificar quando reasoning_content termina e content começa.

  4. Salve uma coleção de avaliação

    Mantenha prompts representativos da sua aplicação. Quando um novo snapshot chegar, execute novamente a coleção antes de atualizar o modelo em produção.

Verifique também o bloco usage de cada resposta. Ele permite medir tokens e validar se a estrutura do prompt está realmente produzindo cache hits.

Preços atuais e aumento anunciado

Modelo Entrada: miss Entrada: cache hit Saída
deepseek-v4-pro $0.435/M $0.003625/M $0.87/M
deepseek-v4-flash $0.14/M $0.28/M

Em 6 de agosto de 2026, a DeepSeek alertou sobre um aumento “significativo” no preço da API, sem informar valores ou data de vigência.

Enquanto os novos preços não são divulgados:

  • Meça o custo por tarefa usando os dados de usage.
  • Priorize prefixos estáveis para aumentar a taxa de cache hit.
  • Use o V4 Flash para tarefas simples e de alto volume.
  • Reserve o V4 Pro para código agêntico, contexto longo e problemas que exigem raciocínio.

Para comparar preços entre provedores, consulte o guia de preços da API DeepSeek V4.

FAQ

Meu código com SDK OpenAI funcionará sem alterações?

Quase. Altere:

  • base_url para https://api.deepseek.com;
  • a chave de API;
  • model para deepseek-v4-pro.

Chat Completions, streaming, ferramentas e saídas estruturadas seguem formatos compatíveis com OpenAI. Também há endpoint Anthropic Messages para equipes que usam o SDK Anthropic.

Quando usar V4 Flash em vez de V4 Pro?

Use o Flash para classificação, extração, chat simples e tarefas sensíveis à latência. O Pro é mais indicado para codificação agêntica, análise de contexto longo e tarefas que justificam o custo adicional de saída.

Roteie por tipo de tarefa e avalie com dados reais.

Posso usar o V4 Pro 0813 no Cursor?

Sim. O Cursor aceita endpoints personalizados compatíveis com OpenAI. Veja a configuração em Como usar DeepSeek V4 Pro com Cursor.

Conclusão

Para começar com o V4 Pro, implemente nesta ordem:

  1. Gere e armazene a chave de API.
  2. Execute uma chamada básica com o SDK OpenAI.
  3. Registre usage em todas as requisições.
  4. Teste reasoning_effort por categoria de tarefa.
  5. Use streaming para respostas longas.
  6. Estruture prompts com conteúdo estável no início.
  7. Mantenha uma coleção de regressão no Apidog.

O desconto de cache de 120x torna a estrutura do prompt uma decisão de arquitetura. Meça cache hits, compare Pro e Flash com seus próprios prompts e reavalie o comportamento quando a DeepSeek publicar outro snapshot ou atualizar os preços.

Top comments (0)