DeepSeek lançou a API oficial DeepSeek-V4-Flash esta manhã. O anúncio foi feito em 31 de julho de 2026, e as notas de lançamento deixam três pontos claros: as capacidades de agente receberam uma atualização relevante, o modelo agora oferece suporte nativo ao formato da API de Respostas da OpenAI e funciona com Codex desde o primeiro dia.
Se você chama deepseek-v4-flash desde abril, estava usando a versão de prévia. Este lançamento promove o modelo para a versão oficial, DeepSeek-V4-Flash-0731, sem exigir mudanças no código. O nome do modelo continua o mesmo.
Neste guia, você vai:
- Criar uma chave de API.
- Fazer sua primeira requisição com cURL, Python ou Node.js.
- Configurar o modo de pensamento e o esforço de raciocínio.
- Consumir respostas em streaming.
- Validar e depurar chamadas com o Apidog.
Se você ainda não conhece a linha DeepSeek, comece por O Que É DeepSeek V4?.
💡 Depois de criar sua chave, teste os endpoints antes de integrá-los à aplicação. O Apidog permite enviar requisições para a API DeepSeek, inspecionar respostas de streaming evento por evento e salvar chamadas funcionais como testes reutilizáveis.
O que foi realmente lançado em 31 de julho
De acordo com o registro oficial de mudanças, o lançamento abrange apenas a API. O aplicativo DeepSeek, os modelos web e a API V4-Pro permanecem inalterados.
Resumo do lançamento:
- DeepSeek-V4-Flash-0731 é a versão oficial da linha V4-Flash, agora em beta pública na API.
- A arquitetura e o tamanho são os mesmos do V4-Flash-Preview. Segundo a DeepSeek, o modelo foi re-pós-treinado; os ganhos vêm do treinamento, não de uma rede maior.
- Os benchmarks de agente superaram o V4-Pro-Preview. A DeepSeek reporta Terminal Bench 2.1 em 82.7, Cybergym em 76.7, Toolathlon verificado em 70.3 e DeepSWE em 54.4. Esses números foram publicados pela própria DeepSeek e testados com sua estrutura no esforço máximo.
- Há suporte nativo à API de Respostas e integração oficial com Codex. Veja os detalhes em DeepSeek-V4-Flash agora suporta a API de Respostas e Codex.
- O lançamento oficial do DeepSeek-V4-Pro “seguirá em breve”, segundo o registro de alterações. O suporte à API de Respostas e ao Codex para o V4-Pro é esperado para o início de agosto de 2026.
Os benchmarks principais vêm da avaliação da própria DeepSeek. Além disso, DSBench-FullStack e DSBench-Hard são conjuntos de testes internos. Avaliações independentes podem levar alguns dias para aparecer.
Passo 1: obtenha sua chave de API
Acesse a Plataforma DeepSeek, faça login e crie uma chave na página de Chaves de API.
As chaves começam com sk-. Não as inclua diretamente no código: use uma variável de ambiente.
export DEEPSEEK_API_KEY="sk-your-key-here"
A API DeepSeek é compatível com os formatos da OpenAI e da Anthropic. Você não precisa de um SDK específico da DeepSeek.
| Formato | URL base |
|---|---|
| Compatível com OpenAI | https://api.deepseek.com |
| Compatível com Anthropic | https://api.deepseek.com/anthropic |
Passo 2: faça sua primeira chamada
Comece com uma chamada curl para validar a chave e o endpoint:
curl https://api.deepseek.com/chat/completions \
-H "Content-Type: application/json" \
-H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
-d '{
"model": "deepseek-v4-flash",
"messages": [
{"role": "system", "content": "Você é um assistente útil."},
{"role": "user", "content": "Resuma o que mudou no DeepSeek-V4-Flash-0731."}
],
"stream": false
}'
Python com o SDK da OpenAI
Instale o SDK:
pip3 install openai
Em seguida, configure base_url para a API DeepSeek:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("DEEPSEEK_API_KEY"),
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "system", "content": "Você é um assistente útil."},
{
"role": "user",
"content": "Escreva uma função Python que valide um endereço de e-mail."
}
],
stream=False
)
print(response.choices[0].message.content)
Node.js com o SDK da OpenAI
Instale o pacote:
npm install openai
Faça a chamada:
import OpenAI from "openai";
const openai = new OpenAI({
baseURL: "https://api.deepseek.com",
apiKey: process.env.DEEPSEEK_API_KEY,
});
const completion = await openai.chat.completions.create({
model: "deepseek-v4-flash",
messages: [
{ role: "user", content: "Olá!" }
],
});
console.log(completion.choices[0].message.content);
Como deepseek-v4-flash agora aponta para o lançamento 0731, integrações que já usavam a versão de prévia passam a utilizar o modelo atualizado automaticamente. Não há migração de nome de modelo.
Passo 3: controle o modo de pensamento e o esforço de raciocínio
O V4-Flash oferece modo com e sem pensamento. O modo de pensamento é o padrão.
Use:
-
thinkingpara ativar ou desativar o modo de pensamento. -
reasoning_effortpara ajustar a profundidade do raciocínio.
Exemplo com esforço alto:
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Planeje uma migração de banco de dados do MySQL para o Postgres."
}
],
reasoning_effort="high",
extra_body={
"thinking": {
"type": "enabled"
}
}
)
Antes de ajustar esses parâmetros, considere duas limitações:
-
temperatureetop_pnão têm efeito enquanto o modo de pensamento está ativado. - A conclusão FIM (fill-in-the-middle), ainda em beta, funciona apenas no modo sem pensamento.
Use o modo sem pensamento em endpoints sensíveis à latência, como autocompletar. Para loops de agentes, planejamento ou depuração complexa, mantenha o pensamento ativado e aumente o esforço de raciocínio.
Passo 4: transmita a resposta
Defina stream: true para receber eventos enviados pelo servidor (SSE).
Se você precisa revisar o formato dos eventos, consulte o guia sobre streaming de respostas de LLM com eventos enviados pelo servidor.
stream = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{
"role": "user",
"content": "Explique o pool de conexões."
}
],
stream=True
)
for chunk in stream:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="")
Em produção, acumule os deltas no cliente ou envie-os diretamente para a interface. Para depurar uma integração SSE, valide separadamente:
- O cabeçalho
Authorization. - O campo
stream: true. - O tratamento de chunks vazios.
- A finalização da resposta no cliente.
Preços durante a beta pública
De acordo com a página oficial de Modelos e Preços, o V4-Flash permanece com preços baixos:
| Item | deepseek-v4-flash |
deepseek-v4-pro |
|---|---|---|
| Entrada, acerto de cache — por 1M tokens | $0.0028 | $0.003625 |
| Entrada, erro de cache — por 1M tokens | $0.14 | $0.435 |
| Saída — por 1M tokens | $0.28 | $0.87 |
| Comprimento do contexto | 1M tokens | 1M tokens |
| Saída máxima | 384K | 384K |
| Limite de concorrência | 2.500 | 500 |
Pontos importantes:
- O cache de contexto é automático. Um acerto de cache custa 50 vezes menos que um erro de cache. Fluxos de agente que reutilizam o mesmo prompt de sistema podem se beneficiar disso.
- A DeepSeek anunciou preços para horários de pico e fora de pico. O uso entre 9:00–12:00 e 14:00–18:00, no horário de Pequim, será cobrado com o dobro do preço regular. Em 31 de julho, a documentação indicava que a data de início permanecia “sujeita ao anúncio oficial”.
- O limite de concorrência é de 2.500 requisições simultâneas para Flash, contra 500 para Pro.
Para comparar custos em toda a família V4, incluindo o histórico do corte permanente de preços do V4-Pro, consulte o detalhamento de preços da API DeepSeek V4.
Teste e depure a API no Apidog
curl é suficiente para um teste rápido. Mas, ao comparar respostas com e sem pensamento, testar streaming ou observar chamadas de ferramentas, é útil inspecionar cada requisição de forma visual.
Você pode fazer isso no Apidog:
Crie um projeto e adicione o endpoint.
Crie uma requisiçãoPOST https://api.deepseek.com/chat/completions. Se preferir, importe uma especificação compatível com OpenAI para adicionar vários endpoints de uma vez.Armazene a chave como variável de ambiente.
AdicioneDEEPSEEK_API_KEYem um ambiente do Apidog e use o valor no cabeçalho:
Authorization: Bearer {{DEEPSEEK_API_KEY}}
Isso permite alternar entre credenciais de teste e produção sem editar a requisição.
Envie e inspecione a resposta.
Para chamadas com streaming, o Apidog renderiza os eventos SSE conforme chegam. Assim, você pode acompanhar deltas de raciocínio e de conteúdo sem analisar manualmente linhasdata:.Salve variações como testes.
Mantenha uma requisição com pensamento ativado e outra com pensamento desativado. Execute ambas após atualizações do modelo para verificar se os prompts continuam se comportando como esperado.
Baixe o Apidog gratuitamente. O fluxo descrito funciona no plano gratuito.
Perguntas frequentes
Preciso mudar meu código para usar o novo modelo?
Não. O nome deepseek-v4-flash agora serve o DeepSeek-V4-Flash-0731. Integrações existentes são atualizadas automaticamente.
Este é o mesmo modelo do aplicativo DeepSeek?
Não. A atualização de 31 de julho abrange apenas a API. O aplicativo e os modelos web permanecem inalterados.
O que aconteceu com deepseek-chat e deepseek-reasoner?
Esses nomes legados estavam programados para serem descontinuados em 24 de julho de 2026. Use deepseek-v4-flash ou deepseek-v4-pro.
Veja o guia sobre como usar a API DeepSeek V4 para detalhes de migração.
Posso usá-lo gratuitamente?
A API DeepSeek é cobrada por uso e não possui um nível gratuito permanente. No entanto, o preço para acertos de cache reduz o custo de experimentação.
Veja como usar a API DeepSeek V4 gratuitamente para as opções atuais.
O V4-Flash funciona com Codex e a API de Respostas?
Sim. Até o momento, ele é o único modelo DeepSeek com suporte a ambos. O suporte ao V4-Pro é esperado para o início de agosto de 2026.
A configuração está no guia da API de Respostas e Codex.
Conclusão
DeepSeek-V4-Flash-0731 mantém o mesmo nome de modelo, preços e arquitetura da prévia, mas traz resultados de benchmarks de agentes que, segundo os testes da DeepSeek, superam o V4-Pro-Preview. O suporte à API de Respostas e ao Codex indica um foco em cargas de trabalho de agentes com alta concorrência.
O próximo passo é simples:
- Crie uma chave.
- Aponte seu SDK OpenAI para
https://api.deepseek.com. - Execute seus próprios prompts e testes de regressão.
- Compare resultados antes de promover o modelo para produção.
O Apidog acelera esse ciclo: salve prompts como casos de teste e execute-os novamente a cada atualização do modelo.


Top comments (0)