DEV Community

Cover image for Aumento de Preço da DeepSeek API: Manual de Otimização de Custos para Desenvolvedores
Lucas
Lucas

Posted on Originally published at apidog.com

Aumento de Preço da DeepSeek API: Manual de Otimização de Custos para Desenvolvedores

DeepSeek construiu sua base de desenvolvedores com uma troca simples: modelos quase de ponta a preços que tornavam o custo irrelevante. Em 6 de agosto de 2026, a empresa alertou que essa troca está prestes a mudar. Em um anúncio primeiramente coberto por Dataconomy, a DeepSeek disse que os preços da API aumentarão “em breve” e que o aumento deverá ser “significativo”. Sem números, sem data efetiva e sem detalhamento por modelo ou nível de preço.

Experimente o Apidog hoje

O contexto torna o aviso crível. A DeepSeek cita aumento dos custos de computação, gargalos de capacidade e tráfego massivo em V4-Flash e V4-Pro. Esta é a segunda mudança de preço em menos de um mês: tarifas de pico e fora de pico chegaram em meados de julho, e o V4-Pro 0813 atingiu disponibilidade geral em 12 de agosto. A eWeek enquadra a mudança como um teste da vantagem de baixo custo que tornou a DeepSeek uma escolha econômica para equipes na APAC e além.

Você não controla as novas taxas. Mas pode controlar quantos tokens compra, qual modelo usa, em que horário envia as requisições e qual provedor atende cada rota.

Este guia mostra como agir antes do reajuste, incluindo cenários de 1,5x, 2x e 3x para uma carga de trabalho de exemplo.

TL;DR

  • A DeepSeek anunciou um aumento “significativo” no preço da API em 6 de agosto de 2026, sem informar valor, data ou impacto por modelo.
  • Sua maior alavanca é o cache automático de prefixo de prompt: entradas em cache custam menos de 1% da taxa de cache-miss. Estabilize os prefixos agora.
  • Roteie por tarefa: use V4-Flash para chamadas simples e de alto volume; reserve V4-Pro para raciocínio profundo.
  • Limite o esforço de pensamento por rota para não pagar tokens de raciocínio em tarefas mecânicas.
  • Execute cargas em lote nas janelas fora de pico introduzidas pela DeepSeek em julho.
  • Mantenha um segundo provedor pronto. A OpenRouter precifica modelos DeepSeek de forma independente, e uma suíte de testes no Apidog pode validar o failover.
  • Mesmo em um cenário especulativo de 3x, a saída do V4-Pro custaria $2,61 por milhão de tokens, abaixo dos $25–30 por milhão atribuídos por comparações públicas a concorrentes de ponta.

O que a DeepSeek anunciou — e o que não anunciou

A divulgação é limitada:

  • Os preços da API aumentarão “em breve”.
  • O aumento será “significativo”.
  • As causas são custos de computação, gargalos de capacidade e tráfego intenso nos endpoints V4-Flash e V4-Pro.

Em 13 de agosto, as taxas atuais ainda se aplicavam.

O que continua desconhecido:

  • O percentual do aumento.
  • A data efetiva.
  • Se V4-Flash e V4-Pro subirão pelo mesmo fator.
  • Se cache-hit e cache-miss escalarão igualmente.
  • Se cargas de trabalho de raciocínio terão tratamento diferente.

Discussões no Hacker News especulam aumentos entre 2x e 3x, mas não há confirmação oficial. Planeje para uma faixa de cenários, não para um único número.

Estas são as tarifas que os cenários multiplicariam:

Modelo Entrada (cache miss) Entrada (cache hit) Saída
DeepSeek V4-Pro $0,435 / M tokens $0,003625 / M tokens $0,87 / M tokens
DeepSeek V4-Flash $0,14 / M tokens $0,28 / M tokens

Ambos os modelos têm janela de contexto de 1M tokens. Consulte o guia de preços da API DeepSeek V4 para o detalhamento e acompanhe o cartão de tarifas atualizado na documentação da API DeepSeek.

Duas proporções orientam as decisões deste artigo:

  1. A entrada com cache custa menos de 1% da entrada sem cache.
  2. O V4-Pro custa aproximadamente 3x o V4-Flash em entrada e saída.

Passo 1: meça sua exposição antes do aumento

Um aumento de preço é apenas um multiplicador sobre o seu consumo atual. Antes de alterar prompts, modelos ou rotas, instrumente as chamadas para saber exatamente onde estão os tokens.

Registre, no mínimo:

  • Funcionalidade ou endpoint que disparou a chamada.
  • Modelo utilizado.
  • Tokens de entrada.
  • Tokens de saída.
  • Tokens atendidos pelo cache.
usage = response.usage

log.info("llm_call", extra={
    "feature": "ticket-summarizer",
    "model": "deepseek-v4-flash",
    "input_tokens": usage.prompt_tokens,
    "output_tokens": usage.completion_tokens,
    "cache_hit_tokens": usage.prompt_cache_hit_tokens,
})
Enter fullscreen mode Exit fullscreen mode

O padrão de atribuição por funcionalidade, painéis e economia unitária está em como rastrear o gasto da API OpenAI por funcionalidade e pode ser aplicado à DeepSeek sem mudanças estruturais.

Com uma semana de dados, responda:

  1. Quais funcionalidades consomem a maior parte do orçamento?
  2. Qual porcentagem dos tokens de entrada atinge o cache?
  3. Quais rotas usam V4-Pro para trabalho que V4-Flash poderia executar?
  4. Em qual multiplicador de preço cada funcionalidade deixa de ser economicamente viável?

Esse quarto item é seu limite de decisão para trocar ou dividir tráfego entre provedores.

Passo 2: maximize os hits de cache

A DeepSeek armazena prefixos de prompt automaticamente. Quando os tokens iniciais de uma requisição correspondem aos de uma requisição recente, o prefixo repetido é cobrado como cache-hit.

No V4-Pro:

  • Cache miss: $0,435 por milhão de tokens de entrada.
  • Cache hit: $0,003625 por milhão de tokens de entrada.

Não há flags de controle de cache ou TTL para gerenciar. O desconto depende de a estrutura do prompt ser repetível. Para revisar a mecânica, consulte o que é cache de prompt e como funciona.

Estruture prompts como estático primeiro, dinâmico por último

O cache corresponde a prefixos exatos de tokens. Organize os prompts nesta ordem:

[Prompt do sistema estável]
[Políticas estáveis]
[Definições de ferramentas em ordem determinística]
[Exemplos few-shot estáveis]
[Contexto de sessão ou documentos recuperados]
[Mensagem atual do usuário]
Enter fullscreen mode Exit fullscreen mode

Aplique estas regras:

  • Coloque primeiro o conteúdo que nunca muda: instruções do sistema, políticas, ferramentas e exemplos.
  • Mantenha os mesmos bytes e a mesma ordem em todas as chamadas.
  • Empurre dados variáveis para o final: mensagens do usuário, documentos recuperados, IDs e contexto de sessão.
  • Remova timestamps, IDs de requisição e saudações personalizadas do início do prompt.
  • Garanta que listas de ferramentas e objetos JSON sejam serializados em ordem determinística.

Um timestamp no prompt do sistema pode invalidar todo o prefixo. O mesmo vale para um array de ferramentas cuja ordem muda entre requisições.

Isso é especialmente relevante em loops de agentes. Se o agente reenvia a conversa inteira a cada turno, todo o conteúdo anterior à mensagem mais recente pode ser atendido pelo cache — desde que o prefixo permaneça estável.

Calcule a taxa de acerto por resposta

A DeepSeek expõe dados de cache no objeto usage, conforme a documentação da API DeepSeek:

u = response.usage

hit_rate = u.prompt_cache_hit_tokens / (
    u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)
Enter fullscreen mode Exit fullscreen mode

Envie essa métrica para seu painel por funcionalidade:

metrics.gauge(
    "llm.cache_hit_rate",
    hit_rate,
    tags={
        "feature": "ticket-summarizer",
        "model": "deepseek-v4-pro",
    },
)
Enter fullscreen mode Exit fullscreen mode

Se uma rota repetitiva tiver taxa baixa de cache-hit, revise o prefixo antes de aceitar o custo como inevitável.

Passo 3: roteie por tarefa, não por hábito

O V4-Pro custa aproximadamente 3x o V4-Flash. Esse custo pode ser justificável para raciocínio profundo, mas não para reformatação de JSON ou classificação simples.

Audite os dados coletados no Passo 1 e defina rotas explícitas:

Forma da carga de trabalho Modelo recomendado
Classificação, extração, formatação e roteamento de intenção V4-Flash, pensamento mínimo
Resumos, respostas RAG e geração de rascunhos V4-Flash primeiro; promover para Pro somente quando avaliações falharem
Loops de agente, depuração difícil e análise de arquitetura V4-Pro, com orçamento de pensamento

Evite deixar a escolha de modelo implícita no código. Centralize-a em uma função ou camada de roteamento:

def select_model(task_type: str) -> str:
    flash_tasks = {
        "classification",
        "extraction",
        "formatting",
        "intent-routing",
        "summarization",
    }

    if task_type in flash_tasks:
        return "deepseek-v4-flash"

    return "deepseek-v4-pro"
Enter fullscreen mode Exit fullscreen mode

Limite o esforço de pensamento por rota

Rastros de raciocínio são cobrados como tokens de saída. No V4-Pro, saída custa $0,87 por milhão de tokens.

Defina uma política simples:

  • Tarefas mecânicas: sem pensamento ou pensamento mínimo.
  • Tarefas com avaliação intermediária: esforço moderado.
  • Agentes e análise complexa: pensamento profundo apenas quando a qualidade mensurável justificar.

Não reduza qualidade por intuição. Faça a alteração, rode suas avaliações e compare os resultados:

1. Mova uma rota do V4-Pro para o V4-Flash.
2. Execute o conjunto de avaliações.
3. Compare taxa de aprovação, precisão e latência.
4. Mantenha a mudança se os critérios continuarem atendidos.
5. Promova novamente para Pro apenas as entradas que falharem.
Enter fullscreen mode Exit fullscreen mode

Passo 4: mova trabalhos em lote para horários fora de pico

A DeepSeek introduziu precificação de pico e fora de pico em meados de julho. As janelas e descontos atuais estão no cartão de tarifas da documentação da API DeepSeek.

Priorize cargas sem usuário aguardando resposta:

  • Execuções noturnas de avaliação.
  • Preenchimento de embeddings.
  • Rotulagem de datasets.
  • Suítes de regressão de prompts no CI.
  • Geração de relatórios.
  • Processamento de filas internas.

Em vez de disparar essas tarefas sob demanda, use uma fila com horário de liberação:

job = {
    "type": "nightly-evaluation",
    "release_at": "off_peak_window",
    "payload": evaluation_batch,
}

queue.enqueue(job)
Enter fullscreen mode Exit fullscreen mode

Essa otimização não exige nova validação de qualidade: os tokens e o modelo são os mesmos; apenas o horário muda.

A ressalva é que a DeepSeek não informou se a diferença entre pico e fora de pico sobreviverá ao próximo reajuste. Aproveite as tarifas atuais e revise a configuração quando a tabela de preços for atualizada.

Sua conta em cenários de 1,5x, 2x e 3x

Os valores abaixo são cenários ilustrativos, não previsões. A DeepSeek não anunciou multiplicadores, e não há garantia de que todos os níveis de preço escalarão uniformemente.

Carga mensal de exemplo:

  • V4-Pro: 400M tokens de entrada, 60% de cache-hit e 60M tokens de saída.
    • Cache miss: $69,60
    • Cache hit: $0,87
    • Saída: $52,20
    • Total Pro: $122,67
  • V4-Flash: 600M tokens de entrada e 120M tokens de saída.
    • Entrada: $84,00
    • Saída: $33,60
    • Total Flash: $117,60

Fatura base: $240,27.

A coluna otimizada aplica os Passos 2 e 3:

  • Taxa de cache-hit do Pro sobe de 60% para 85%.
  • Saída do Pro cai de 60M para 45M tokens por meio de orçamentos de pensamento.
  • V4-Flash permanece inalterado.
Cenário de taxa Conta não otimizada Otimizada (Passos 2–3)
Taxas atuais $240 $184
Aumento de 1,5x $360 $276
Aumento de 2x $481 $368
Aumento de 3x $721 $552

A leitura prática é simples: uma carga otimizada com aumento de 2x ($368) custa aproximadamente o mesmo que uma carga não otimizada com aumento de 1,5x ($360).

As economias estruturais acompanham qualquer multiplicador. Uma redução de 23% vale cerca de $56 hoje e $168 em um cenário de 3x.

O desconto fora de pico não está incluído na tabela porque depende da programação vigente. Portanto, a coluna otimizada é conservadora.

Quando trocar modelos supera a otimização

Mesmo no cenário especulativo de 3x, a saída do V4-Pro chegaria a $2,61 por milhão de tokens. Comparações públicas colocam a saída de concorrentes de ponta entre $25 e $30 por milhão.

A vantagem de custo diminui, mas não desaparece automaticamente.

Otimize e permaneça quando

  • DeepSeek passa nas suas avaliações de qualidade.
  • Seu tráfego possui prompts cacheáveis.
  • As rotas podem ser encaminhadas entre Flash e Pro.
  • Você tem capacidade de engenharia para implementar as mudanças antes do reajuste.

Troque ou divida o tráfego quando

  • Sua taxa de cache-hit é estruturalmente baixa porque cada requisição carrega documentos longos e únicos.
  • Você paga por V4-Pro em tarefas que um modelo menor de outro provedor aprova nas suas avaliações.
  • O multiplicador anunciado ultrapassa o limite econômico calculado no Passo 1.
  • Você precisa reduzir risco operacional de depender de um único provedor.

Para a maioria das equipes, a resposta será híbrida:

  1. Mantenha DeepSeek nas rotas em que vence em custo por avaliação aprovada.
  2. Mova rotas em que outro modelo entrega melhor custo ou qualidade.
  3. Execute testes de paridade continuamente entre provedores.

Conclusão

A DeepSeek informou que os preços vão subir, mas ainda não detalhou quanto, quando ou como cada modelo será afetado.

Use esse período para executar ações mensuráveis:

  1. Instrumente gasto e tokens por funcionalidade.
  2. Estabilize os prefixos de prompt para aumentar cache-hit.
  3. Roteie tarefas simples para V4-Flash.
  4. Limite pensamento em rotas que não exigem raciocínio profundo.
  5. Programe workloads em lote para janelas fora de pico.
  6. Valide um segundo provedor antes de precisar dele.

Para testar o failover, baixe o Apidog gratuitamente. Crie a suíte uma vez, execute-a contra api.deepseek.com e contra seu fallback usando ambientes separados por provedor, e agende execuções para garantir que ambos continuem compatíveis.

Top comments (0)