DEV Community

Cover image for DeepSeek-V4-Flash API Lançada: Tutorial de Uso da API Oficial (Beta Pública)
Lucas
Lucas

Posted on • Originally published at apidog.com

DeepSeek-V4-Flash API Lançada: Tutorial de Uso da API Oficial (Beta Pública)

DeepSeek lançou a API oficial DeepSeek-V4-Flash esta manhã. O anúncio foi feito em 31 de julho de 2026, e as notas de lançamento deixam três pontos claros: as capacidades de agente receberam uma atualização relevante, o modelo agora oferece suporte nativo ao formato da API de Respostas da OpenAI e funciona com Codex desde o primeiro dia.

Experimente o Apidog hoje

Se você chama deepseek-v4-flash desde abril, estava usando a versão de prévia. Este lançamento promove o modelo para a versão oficial, DeepSeek-V4-Flash-0731, sem exigir mudanças no código. O nome do modelo continua o mesmo.

Neste guia, você vai:

  1. Criar uma chave de API.
  2. Fazer sua primeira requisição com cURL, Python ou Node.js.
  3. Configurar o modo de pensamento e o esforço de raciocínio.
  4. Consumir respostas em streaming.
  5. Validar e depurar chamadas com o Apidog.

Se você ainda não conhece a linha DeepSeek, comece por O Que É DeepSeek V4?.

💡 Depois de criar sua chave, teste os endpoints antes de integrá-los à aplicação. O Apidog permite enviar requisições para a API DeepSeek, inspecionar respostas de streaming evento por evento e salvar chamadas funcionais como testes reutilizáveis.

O que foi realmente lançado em 31 de julho

De acordo com o registro oficial de mudanças, o lançamento abrange apenas a API. O aplicativo DeepSeek, os modelos web e a API V4-Pro permanecem inalterados.

Resumo do lançamento:

  • DeepSeek-V4-Flash-0731 é a versão oficial da linha V4-Flash, agora em beta pública na API.
  • A arquitetura e o tamanho são os mesmos do V4-Flash-Preview. Segundo a DeepSeek, o modelo foi re-pós-treinado; os ganhos vêm do treinamento, não de uma rede maior.
  • Os benchmarks de agente superaram o V4-Pro-Preview. A DeepSeek reporta Terminal Bench 2.1 em 82.7, Cybergym em 76.7, Toolathlon verificado em 70.3 e DeepSWE em 54.4. Esses números foram publicados pela própria DeepSeek e testados com sua estrutura no esforço máximo.
  • suporte nativo à API de Respostas e integração oficial com Codex. Veja os detalhes em DeepSeek-V4-Flash agora suporta a API de Respostas e Codex.
  • O lançamento oficial do DeepSeek-V4-Pro “seguirá em breve”, segundo o registro de alterações. O suporte à API de Respostas e ao Codex para o V4-Pro é esperado para o início de agosto de 2026.

Os benchmarks principais vêm da avaliação da própria DeepSeek. Além disso, DSBench-FullStack e DSBench-Hard são conjuntos de testes internos. Avaliações independentes podem levar alguns dias para aparecer.

Resultados de benchmark do DeepSeek V4 Flash

Passo 1: obtenha sua chave de API

Acesse a Plataforma DeepSeek, faça login e crie uma chave na página de Chaves de API.

As chaves começam com sk-. Não as inclua diretamente no código: use uma variável de ambiente.

export DEEPSEEK_API_KEY="sk-your-key-here"
Enter fullscreen mode Exit fullscreen mode

A API DeepSeek é compatível com os formatos da OpenAI e da Anthropic. Você não precisa de um SDK específico da DeepSeek.

Formato URL base
Compatível com OpenAI https://api.deepseek.com
Compatível com Anthropic https://api.deepseek.com/anthropic

Passo 2: faça sua primeira chamada

Comece com uma chamada curl para validar a chave e o endpoint:

curl https://api.deepseek.com/chat/completions \
  -H "Content-Type: application/json" \
  -H "Authorization: Bearer ${DEEPSEEK_API_KEY}" \
  -d '{
    "model": "deepseek-v4-flash",
    "messages": [
      {"role": "system", "content": "Você é um assistente útil."},
      {"role": "user", "content": "Resuma o que mudou no DeepSeek-V4-Flash-0731."}
    ],
    "stream": false
  }'
Enter fullscreen mode Exit fullscreen mode

Python com o SDK da OpenAI

Instale o SDK:

pip3 install openai
Enter fullscreen mode Exit fullscreen mode

Em seguida, configure base_url para a API DeepSeek:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("DEEPSEEK_API_KEY"),
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {"role": "system", "content": "Você é um assistente útil."},
        {
            "role": "user",
            "content": "Escreva uma função Python que valide um endereço de e-mail."
        }
    ],
    stream=False
)

print(response.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Node.js com o SDK da OpenAI

Instale o pacote:

npm install openai
Enter fullscreen mode Exit fullscreen mode

Faça a chamada:

import OpenAI from "openai";

const openai = new OpenAI({
  baseURL: "https://api.deepseek.com",
  apiKey: process.env.DEEPSEEK_API_KEY,
});

const completion = await openai.chat.completions.create({
  model: "deepseek-v4-flash",
  messages: [
    { role: "user", content: "Olá!" }
  ],
});

console.log(completion.choices[0].message.content);
Enter fullscreen mode Exit fullscreen mode

Como deepseek-v4-flash agora aponta para o lançamento 0731, integrações que já usavam a versão de prévia passam a utilizar o modelo atualizado automaticamente. Não há migração de nome de modelo.

Passo 3: controle o modo de pensamento e o esforço de raciocínio

O V4-Flash oferece modo com e sem pensamento. O modo de pensamento é o padrão.

Use:

  • thinking para ativar ou desativar o modo de pensamento.
  • reasoning_effort para ajustar a profundidade do raciocínio.

Exemplo com esforço alto:

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Planeje uma migração de banco de dados do MySQL para o Postgres."
        }
    ],
    reasoning_effort="high",
    extra_body={
        "thinking": {
            "type": "enabled"
        }
    }
)
Enter fullscreen mode Exit fullscreen mode

Antes de ajustar esses parâmetros, considere duas limitações:

  • temperature e top_p não têm efeito enquanto o modo de pensamento está ativado.
  • A conclusão FIM (fill-in-the-middle), ainda em beta, funciona apenas no modo sem pensamento.

Use o modo sem pensamento em endpoints sensíveis à latência, como autocompletar. Para loops de agentes, planejamento ou depuração complexa, mantenha o pensamento ativado e aumente o esforço de raciocínio.

Passo 4: transmita a resposta

Defina stream: true para receber eventos enviados pelo servidor (SSE).

Se você precisa revisar o formato dos eventos, consulte o guia sobre streaming de respostas de LLM com eventos enviados pelo servidor.

stream = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[
        {
            "role": "user",
            "content": "Explique o pool de conexões."
        }
    ],
    stream=True
)

for chunk in stream:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="")
Enter fullscreen mode Exit fullscreen mode

Em produção, acumule os deltas no cliente ou envie-os diretamente para a interface. Para depurar uma integração SSE, valide separadamente:

  1. O cabeçalho Authorization.
  2. O campo stream: true.
  3. O tratamento de chunks vazios.
  4. A finalização da resposta no cliente.

Preços durante a beta pública

De acordo com a página oficial de Modelos e Preços, o V4-Flash permanece com preços baixos:

Item deepseek-v4-flash deepseek-v4-pro
Entrada, acerto de cache — por 1M tokens $0.0028 $0.003625
Entrada, erro de cache — por 1M tokens $0.14 $0.435
Saída — por 1M tokens $0.28 $0.87
Comprimento do contexto 1M tokens 1M tokens
Saída máxima 384K 384K
Limite de concorrência 2.500 500

Pontos importantes:

  • O cache de contexto é automático. Um acerto de cache custa 50 vezes menos que um erro de cache. Fluxos de agente que reutilizam o mesmo prompt de sistema podem se beneficiar disso.
  • A DeepSeek anunciou preços para horários de pico e fora de pico. O uso entre 9:00–12:00 e 14:00–18:00, no horário de Pequim, será cobrado com o dobro do preço regular. Em 31 de julho, a documentação indicava que a data de início permanecia “sujeita ao anúncio oficial”.
  • O limite de concorrência é de 2.500 requisições simultâneas para Flash, contra 500 para Pro.

Para comparar custos em toda a família V4, incluindo o histórico do corte permanente de preços do V4-Pro, consulte o detalhamento de preços da API DeepSeek V4.

Teste e depure a API no Apidog

curl é suficiente para um teste rápido. Mas, ao comparar respostas com e sem pensamento, testar streaming ou observar chamadas de ferramentas, é útil inspecionar cada requisição de forma visual.

Você pode fazer isso no Apidog:

Teste de API DeepSeek no Apidog

  1. Crie um projeto e adicione o endpoint.

    Crie uma requisição POST https://api.deepseek.com/chat/completions. Se preferir, importe uma especificação compatível com OpenAI para adicionar vários endpoints de uma vez.

  2. Armazene a chave como variável de ambiente.

    Adicione DEEPSEEK_API_KEY em um ambiente do Apidog e use o valor no cabeçalho:

   Authorization: Bearer {{DEEPSEEK_API_KEY}}
Enter fullscreen mode Exit fullscreen mode

Isso permite alternar entre credenciais de teste e produção sem editar a requisição.

  1. Envie e inspecione a resposta.

    Para chamadas com streaming, o Apidog renderiza os eventos SSE conforme chegam. Assim, você pode acompanhar deltas de raciocínio e de conteúdo sem analisar manualmente linhas data:.

  2. Salve variações como testes.

    Mantenha uma requisição com pensamento ativado e outra com pensamento desativado. Execute ambas após atualizações do modelo para verificar se os prompts continuam se comportando como esperado.

Baixe o Apidog gratuitamente. O fluxo descrito funciona no plano gratuito.

Perguntas frequentes

Preciso mudar meu código para usar o novo modelo?

Não. O nome deepseek-v4-flash agora serve o DeepSeek-V4-Flash-0731. Integrações existentes são atualizadas automaticamente.

Este é o mesmo modelo do aplicativo DeepSeek?

Não. A atualização de 31 de julho abrange apenas a API. O aplicativo e os modelos web permanecem inalterados.

O que aconteceu com deepseek-chat e deepseek-reasoner?

Esses nomes legados estavam programados para serem descontinuados em 24 de julho de 2026. Use deepseek-v4-flash ou deepseek-v4-pro.

Veja o guia sobre como usar a API DeepSeek V4 para detalhes de migração.

Posso usá-lo gratuitamente?

A API DeepSeek é cobrada por uso e não possui um nível gratuito permanente. No entanto, o preço para acertos de cache reduz o custo de experimentação.

Veja como usar a API DeepSeek V4 gratuitamente para as opções atuais.

O V4-Flash funciona com Codex e a API de Respostas?

Sim. Até o momento, ele é o único modelo DeepSeek com suporte a ambos. O suporte ao V4-Pro é esperado para o início de agosto de 2026.

A configuração está no guia da API de Respostas e Codex.

Conclusão

DeepSeek-V4-Flash-0731 mantém o mesmo nome de modelo, preços e arquitetura da prévia, mas traz resultados de benchmarks de agentes que, segundo os testes da DeepSeek, superam o V4-Pro-Preview. O suporte à API de Respostas e ao Codex indica um foco em cargas de trabalho de agentes com alta concorrência.

O próximo passo é simples:

  1. Crie uma chave.
  2. Aponte seu SDK OpenAI para https://api.deepseek.com.
  3. Execute seus próprios prompts e testes de regressão.
  4. Compare resultados antes de promover o modelo para produção.

O Apidog acelera esse ciclo: salve prompts como casos de teste e execute-os novamente a cada atualização do modelo.

Top comments (0)