DeepSeek V4 Pro saiu da prévia em 12 de agosto de 2026. A versão GA (disponibilidade geral), identificada pelo snapshot 0813, atende o endpoint deepseek-v4-pro e oferece janela de contexto de 1 milhão de tokens, até 384 mil tokens de saída e entrada a $0,003625 por milhão de tokens em cache hit. Conforme relatado pela Unite.AI, o modelo passou quatro meses em prévia antes de se tornar o carro-chefe da DeepSeek.
Este guia foca na implementação: primeira chamada com o SDK OpenAI, modos de pensamento, reasoning_content, streaming, ferramentas e cache de prompt. Para o contexto de arquitetura, leia O que é DeepSeek V4.
TL;DR
- Use
deepseek-v4-propara acessar o snapshot GA0813a partir de 12 de agosto de 2026. - A API é compatível com OpenAI: configure o SDK
openaicomhttps://api.deepseek.com. - O modelo oferece 1 milhão de tokens de contexto, até 384 mil tokens de saída e os modos
non-think,think highethink max. - Preços: entrada de $0.435/M em cache miss, $0.003625/M em cache hit e saída de $0.87/M.
- Prefixos de prompt repetidos são armazenados em cache automaticamente.
- A DeepSeek avisou em 6 de agosto sobre um aumento “significativo” de preços, ainda sem valores ou data.
- Teste requisições, streaming SSE e comparações entre Pro e Flash no Apidog antes de levar a integração para produção.
O que a versão GA 0813 muda para desenvolvedores
A prévia foi lançada em abril de 2026. O V4 Flash chegou em julho e, em 12 de agosto, o V4 Pro passou para GA com o snapshot 0813, seguindo a convenção de versões datadas da DeepSeek.
Na prática, o GA traz três mudanças importantes:
Snapshot estável
Modelos em prévia podem mudar sem aviso e invalidar avaliações ou ajustes de prompt. O0813é um alvo fixo até o lançamento de outro snapshot.Alias de produção
Na API oficial, usedeepseek-v4-pro. Para referenciar explicitamente o snapshot, o OpenRouter listadeepseek/deepseek-v4-pro-0813.Recursos completos no endpoint
Modos de pensamento, chamada de função, saídas estruturadas, cache de prompt e formatos OpenAI, Anthropic e Responses estão disponíveis.
O V4 Pro é um modelo de mistura de especialistas com 1.6T de parâmetros totais e 49B ativos por token. A DeepSeek informa que os mecanismos Compressed Sparse Attention e Heavily Compressed Attention reduzem o cálculo de inferência de token único para 27% do V3.2 e o cache KV para 10%.
DeepSeek V4 Pro 0813: especificações
| Especificação | DeepSeek V4 Pro 0813 |
|---|---|
| Lançamento | GA em 12 de agosto de 2026 (0813) |
| Arquitetura | Mistura de especialistas, 1.6T parâmetros totais, 49B ativos por token |
| Atenção | Compressed Sparse Attention + Heavily Compressed Attention |
| Custo de inferência vs. V3.2 | 27% do cálculo de token único, 10% do cache KV |
| Janela de contexto | 1.000.000 tokens |
| Saída máxima | 384 mil tokens |
| Modos de pensamento |
non-think, think high, think max
|
| Entrada | $0.435/M em cache miss; $0.003625/M em cache hit |
| Saída | $0.87/M |
| Formatos de API | OpenAI Chat Completions, Anthropic Messages, DeepSeek Responses |
| ID do modelo | deepseek-v4-pro |
| Modelo menor |
deepseek-v4-flash — 284B total / 13B ativo, $0.14/M entrada e $0.28/M saída |
O cartão de modelo da DeepSeek informa 80.6% no SWE-bench Verified, 67.9% no Terminal Bench 2.0, 90.1% no GPQA Diamond e 93.5% no LiveCodeBench para V4-Pro-Max. Esses resultados são auto-relatados pelo fornecedor; execute avaliações com suas próprias tarefas antes de migrar uma carga de trabalho crítica.
Obtenha uma chave de API e faça a primeira chamada
Siga este fluxo:
- Crie uma conta em platform.deepseek.com e adicione crédito. A API é pré-paga.
- Gere uma chave em API Keys e copie-a imediatamente.
- Exporte a chave como variável de ambiente:
export DEEPSEEK_API_KEY="sk-..."
A API usa o protocolo OpenAI Chat Completions. Instale o cliente:
pip install openai
Faça uma chamada com Python:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["DEEPSEEK_API_KEY"],
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "system",
"content": "You are a concise technical assistant.",
},
{
"role": "user",
"content": "Explain idempotency in REST APIs in two sentences.",
},
],
)
print(response.choices[0].message.content)
print(response.usage)
Tanto https://api.deepseek.com quanto https://api.deepseek.com/v1 funcionam como base_url. O sufixo /v1 existe para compatibilidade de protocolo, não para selecionar uma versão do modelo.
Monitore response.usage desde a primeira integração. Em contextos longos, a diferença entre cache hit e cache miss pode mudar substancialmente o custo.
Para um teste de fumaça com HTTP bruto:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-d '{
"model": "deepseek-v4-pro",
"messages": [
{
"role": "user",
"content": "List three ways to version a REST API."
}
]
}'
Consulte os documentos oficiais da DeepSeek para parâmetros adicionais, endpoint Anthropic Messages e a API Responses da DeepSeek.
Trabalhando com os três modos de pensamento
O V4 Pro expõe o nível de raciocínio por meio de reasoning_effort:
-
none: resposta direta; use para classificação, extração, formatação e resumo. -
high: raciocínio antes da resposta; recomendado para código, depuração e análise em várias etapas. -
max: orçamento máximo de raciocínio; reserve para problemas complexos.
Exemplo com high:
response = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high", # "none" | "high" | "max"
messages=[
{
"role": "user",
"content": (
"Our API returns 502s under load but only behind the CDN. "
"Walk through likely causes in order of probability."
),
},
],
)
message = response.choices[0].message
print("--- Reasoning ---")
print(message.reasoning_content)
print("--- Answer ---")
print(message.content)
Ao implementar conversas multi-turno:
- Não reenvie
reasoning_contentno histórico. - Envie apenas o
contentdas respostas anteriores. - Considere tokens de raciocínio como tokens de saída, cobrados a $0.87/M.
- Escolha o modo por tarefa em vez de usar
maxcomo padrão.
Respostas em streaming
Para respostas longas, use streaming. Em modos de pensamento, os deltas de reasoning_content podem chegar antes dos deltas de content.
stream = client.chat.completions.create(
model="deepseek-v4-pro",
reasoning_effort="high",
stream=True,
messages=[
{
"role": "user",
"content": (
"Design a rate limiter for a public API. "
"Compare token bucket and sliding window."
),
},
],
)
for chunk in stream:
if not chunk.choices:
continue # O chunk final pode conter apenas usage.
delta = chunk.choices[0].delta
if getattr(delta, "reasoning_content", None):
print(delta.reasoning_content, end="", flush=True)
elif delta.content:
print(delta.content, end="", flush=True)
Na interface, uma abordagem útil é exibir o raciocínio como “Pensando...” em uma área recolhida e mostrar a resposta final quando os deltas de content começarem.
O transporte usa Server-Sent Events. Veja o guia sobre streaming de respostas de API com SSE para os detalhes do protocolo.
Chamada de ferramentas e saídas estruturadas
O V4 Pro suporta ferramentas no formato OpenAI. Defina o schema, leia tool_calls, execute a ferramenta e envie o resultado na próxima mensagem do loop.
tools = [{
"type": "function",
"function": {
"name": "get_endpoint_status",
"description": "Check the health of an internal API endpoint",
"parameters": {
"type": "object",
"properties": {
"endpoint": {
"type": "string",
"description": "Path, e.g. /v1/orders",
}
},
"required": ["endpoint"],
},
},
}]
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[
{
"role": "user",
"content": "Is /v1/orders healthy right now?",
}
],
tools=tools,
)
print(response.choices[0].message.tool_calls)
Para JSON analisável, use response_format conforme o formato suportado pela API. Os documentos oficiais detalham o formato das mensagens e o ciclo completo de ferramentas.
Economia de cache de prompt: como estruturar o contexto
A DeepSeek armazena prefixos de prompt automaticamente. Não há cabeçalhos de cache ou configuração manual de TTL.
- Cache miss:
$0.435/Mtokens de entrada. - Cache hit:
$0.003625/Mtokens de entrada. - Desconto: cerca de 120x para trechos já vistos pela API.
Considere um agente de código com 200 mil tokens de contexto de repositório e 50 chamadas na mesma sessão:
-
Sem cache:
50 × 200 mil × $0.435/M ≈ $4.35 -
Com cache: um miss de
$0.087+ 49 hits de aproximadamente$0.0007cada ≈$0.12
A diferença depende da ordem do prompt. Organize as mensagens assim:
- Conteúdo estável: prompt do sistema, documentação, regras e contexto do repositório.
- Conteúdo semi-estável: estado da sessão e resultados reutilizáveis.
- Conteúdo volátil: mensagem atual do usuário, timestamps, IDs de requisição e dados dinâmicos.
Um timestamp no início do prompt pode invalidar o prefixo cacheado e transformar cada chamada em cache miss.
Com esse modelo de preço, preencher 1 milhão de tokens custa $0.435 em um miss, mas aproximadamente um terço de centavo em um hit. Para mais contexto, leia O que é cache de prompt.
Testando deepseek-v4-pro no Apidog
Antes de integrar em produção, teste o endpoint em uma ferramenta de depuração. Como a API é compatível com OpenAI, o Apidog pode importar e executar as requisições sem configuração especial.
Fluxo recomendado:
Importe o comando cURL
Cole o comando anterior no Apidog para gerar uma requisição editável com URL, cabeçalhos, autenticação e corpo.Crie ambientes para Pro e Flash
Armazenebase_url, chave de API e nome do modelo em variáveis. Assim, você alterna entredeepseek-v4-proedeepseek-v4-flashsem editar a requisição manualmente.Inspecione o stream SSE
Envie uma requisição com"stream": truepara observar a sequência de eventos e verificar quandoreasoning_contenttermina econtentcomeça.Salve uma coleção de avaliação
Mantenha prompts representativos da sua aplicação. Quando um novo snapshot chegar, execute novamente a coleção antes de atualizar o modelo em produção.
Verifique também o bloco usage de cada resposta. Ele permite medir tokens e validar se a estrutura do prompt está realmente produzindo cache hits.
Preços atuais e aumento anunciado
| Modelo | Entrada: miss | Entrada: cache hit | Saída |
|---|---|---|---|
deepseek-v4-pro |
$0.435/M | $0.003625/M | $0.87/M |
deepseek-v4-flash |
$0.14/M | — | $0.28/M |
Em 6 de agosto de 2026, a DeepSeek alertou sobre um aumento “significativo” no preço da API, sem informar valores ou data de vigência.
Enquanto os novos preços não são divulgados:
- Meça o custo por tarefa usando os dados de
usage. - Priorize prefixos estáveis para aumentar a taxa de cache hit.
- Use o V4 Flash para tarefas simples e de alto volume.
- Reserve o V4 Pro para código agêntico, contexto longo e problemas que exigem raciocínio.
Para comparar preços entre provedores, consulte o guia de preços da API DeepSeek V4.
FAQ
Meu código com SDK OpenAI funcionará sem alterações?
Quase. Altere:
-
base_urlparahttps://api.deepseek.com; - a chave de API;
-
modelparadeepseek-v4-pro.
Chat Completions, streaming, ferramentas e saídas estruturadas seguem formatos compatíveis com OpenAI. Também há endpoint Anthropic Messages para equipes que usam o SDK Anthropic.
Quando usar V4 Flash em vez de V4 Pro?
Use o Flash para classificação, extração, chat simples e tarefas sensíveis à latência. O Pro é mais indicado para codificação agêntica, análise de contexto longo e tarefas que justificam o custo adicional de saída.
Roteie por tipo de tarefa e avalie com dados reais.
Posso usar o V4 Pro 0813 no Cursor?
Sim. O Cursor aceita endpoints personalizados compatíveis com OpenAI. Veja a configuração em Como usar DeepSeek V4 Pro com Cursor.
Conclusão
Para começar com o V4 Pro, implemente nesta ordem:
- Gere e armazene a chave de API.
- Execute uma chamada básica com o SDK OpenAI.
- Registre
usageem todas as requisições. - Teste
reasoning_effortpor categoria de tarefa. - Use streaming para respostas longas.
- Estruture prompts com conteúdo estável no início.
- Mantenha uma coleção de regressão no Apidog.
O desconto de cache de 120x torna a estrutura do prompt uma decisão de arquitetura. Meça cache hits, compare Pro e Flash com seus próprios prompts e reavalie o comportamento quando a DeepSeek publicar outro snapshot ou atualizar os preços.


Top comments (0)