DeepSeek construiu sua base de desenvolvedores com uma troca simples: modelos quase de ponta a preços que tornavam o custo irrelevante. Em 6 de agosto de 2026, a empresa alertou que essa troca está prestes a mudar. Em um anúncio primeiramente coberto por Dataconomy, a DeepSeek disse que os preços da API aumentarão “em breve” e que o aumento deverá ser “significativo”. Sem números, sem data efetiva e sem detalhamento por modelo ou nível de preço.
O contexto torna o aviso crível. A DeepSeek cita aumento dos custos de computação, gargalos de capacidade e tráfego massivo em V4-Flash e V4-Pro. Esta é a segunda mudança de preço em menos de um mês: tarifas de pico e fora de pico chegaram em meados de julho, e o V4-Pro 0813 atingiu disponibilidade geral em 12 de agosto. A eWeek enquadra a mudança como um teste da vantagem de baixo custo que tornou a DeepSeek uma escolha econômica para equipes na APAC e além.
Você não controla as novas taxas. Mas pode controlar quantos tokens compra, qual modelo usa, em que horário envia as requisições e qual provedor atende cada rota.
Este guia mostra como agir antes do reajuste, incluindo cenários de 1,5x, 2x e 3x para uma carga de trabalho de exemplo.
TL;DR
- A DeepSeek anunciou um aumento “significativo” no preço da API em 6 de agosto de 2026, sem informar valor, data ou impacto por modelo.
- Sua maior alavanca é o cache automático de prefixo de prompt: entradas em cache custam menos de 1% da taxa de cache-miss. Estabilize os prefixos agora.
- Roteie por tarefa: use V4-Flash para chamadas simples e de alto volume; reserve V4-Pro para raciocínio profundo.
- Limite o esforço de pensamento por rota para não pagar tokens de raciocínio em tarefas mecânicas.
- Execute cargas em lote nas janelas fora de pico introduzidas pela DeepSeek em julho.
- Mantenha um segundo provedor pronto. A OpenRouter precifica modelos DeepSeek de forma independente, e uma suíte de testes no Apidog pode validar o failover.
- Mesmo em um cenário especulativo de 3x, a saída do V4-Pro custaria $2,61 por milhão de tokens, abaixo dos $25–30 por milhão atribuídos por comparações públicas a concorrentes de ponta.
O que a DeepSeek anunciou — e o que não anunciou
A divulgação é limitada:
- Os preços da API aumentarão “em breve”.
- O aumento será “significativo”.
- As causas são custos de computação, gargalos de capacidade e tráfego intenso nos endpoints V4-Flash e V4-Pro.
Em 13 de agosto, as taxas atuais ainda se aplicavam.
O que continua desconhecido:
- O percentual do aumento.
- A data efetiva.
- Se V4-Flash e V4-Pro subirão pelo mesmo fator.
- Se cache-hit e cache-miss escalarão igualmente.
- Se cargas de trabalho de raciocínio terão tratamento diferente.
Discussões no Hacker News especulam aumentos entre 2x e 3x, mas não há confirmação oficial. Planeje para uma faixa de cenários, não para um único número.
Estas são as tarifas que os cenários multiplicariam:
| Modelo | Entrada (cache miss) | Entrada (cache hit) | Saída |
|---|---|---|---|
| DeepSeek V4-Pro | $0,435 / M tokens | $0,003625 / M tokens | $0,87 / M tokens |
| DeepSeek V4-Flash | $0,14 / M tokens | — | $0,28 / M tokens |
Ambos os modelos têm janela de contexto de 1M tokens. Consulte o guia de preços da API DeepSeek V4 para o detalhamento e acompanhe o cartão de tarifas atualizado na documentação da API DeepSeek.
Duas proporções orientam as decisões deste artigo:
- A entrada com cache custa menos de 1% da entrada sem cache.
- O V4-Pro custa aproximadamente 3x o V4-Flash em entrada e saída.
Passo 1: meça sua exposição antes do aumento
Um aumento de preço é apenas um multiplicador sobre o seu consumo atual. Antes de alterar prompts, modelos ou rotas, instrumente as chamadas para saber exatamente onde estão os tokens.
Registre, no mínimo:
- Funcionalidade ou endpoint que disparou a chamada.
- Modelo utilizado.
- Tokens de entrada.
- Tokens de saída.
- Tokens atendidos pelo cache.
usage = response.usage
log.info("llm_call", extra={
"feature": "ticket-summarizer",
"model": "deepseek-v4-flash",
"input_tokens": usage.prompt_tokens,
"output_tokens": usage.completion_tokens,
"cache_hit_tokens": usage.prompt_cache_hit_tokens,
})
O padrão de atribuição por funcionalidade, painéis e economia unitária está em como rastrear o gasto da API OpenAI por funcionalidade e pode ser aplicado à DeepSeek sem mudanças estruturais.
Com uma semana de dados, responda:
- Quais funcionalidades consomem a maior parte do orçamento?
- Qual porcentagem dos tokens de entrada atinge o cache?
- Quais rotas usam V4-Pro para trabalho que V4-Flash poderia executar?
- Em qual multiplicador de preço cada funcionalidade deixa de ser economicamente viável?
Esse quarto item é seu limite de decisão para trocar ou dividir tráfego entre provedores.
Passo 2: maximize os hits de cache
A DeepSeek armazena prefixos de prompt automaticamente. Quando os tokens iniciais de uma requisição correspondem aos de uma requisição recente, o prefixo repetido é cobrado como cache-hit.
No V4-Pro:
- Cache miss: $0,435 por milhão de tokens de entrada.
- Cache hit: $0,003625 por milhão de tokens de entrada.
Não há flags de controle de cache ou TTL para gerenciar. O desconto depende de a estrutura do prompt ser repetível. Para revisar a mecânica, consulte o que é cache de prompt e como funciona.
Estruture prompts como estático primeiro, dinâmico por último
O cache corresponde a prefixos exatos de tokens. Organize os prompts nesta ordem:
[Prompt do sistema estável]
[Políticas estáveis]
[Definições de ferramentas em ordem determinística]
[Exemplos few-shot estáveis]
[Contexto de sessão ou documentos recuperados]
[Mensagem atual do usuário]
Aplique estas regras:
- Coloque primeiro o conteúdo que nunca muda: instruções do sistema, políticas, ferramentas e exemplos.
- Mantenha os mesmos bytes e a mesma ordem em todas as chamadas.
- Empurre dados variáveis para o final: mensagens do usuário, documentos recuperados, IDs e contexto de sessão.
- Remova timestamps, IDs de requisição e saudações personalizadas do início do prompt.
- Garanta que listas de ferramentas e objetos JSON sejam serializados em ordem determinística.
Um timestamp no prompt do sistema pode invalidar todo o prefixo. O mesmo vale para um array de ferramentas cuja ordem muda entre requisições.
Isso é especialmente relevante em loops de agentes. Se o agente reenvia a conversa inteira a cada turno, todo o conteúdo anterior à mensagem mais recente pode ser atendido pelo cache — desde que o prefixo permaneça estável.
Calcule a taxa de acerto por resposta
A DeepSeek expõe dados de cache no objeto usage, conforme a documentação da API DeepSeek:
u = response.usage
hit_rate = u.prompt_cache_hit_tokens / (
u.prompt_cache_hit_tokens + u.prompt_cache_miss_tokens
)
Envie essa métrica para seu painel por funcionalidade:
metrics.gauge(
"llm.cache_hit_rate",
hit_rate,
tags={
"feature": "ticket-summarizer",
"model": "deepseek-v4-pro",
},
)
Se uma rota repetitiva tiver taxa baixa de cache-hit, revise o prefixo antes de aceitar o custo como inevitável.
Passo 3: roteie por tarefa, não por hábito
O V4-Pro custa aproximadamente 3x o V4-Flash. Esse custo pode ser justificável para raciocínio profundo, mas não para reformatação de JSON ou classificação simples.
Audite os dados coletados no Passo 1 e defina rotas explícitas:
| Forma da carga de trabalho | Modelo recomendado |
|---|---|
| Classificação, extração, formatação e roteamento de intenção | V4-Flash, pensamento mínimo |
| Resumos, respostas RAG e geração de rascunhos | V4-Flash primeiro; promover para Pro somente quando avaliações falharem |
| Loops de agente, depuração difícil e análise de arquitetura | V4-Pro, com orçamento de pensamento |
Evite deixar a escolha de modelo implícita no código. Centralize-a em uma função ou camada de roteamento:
def select_model(task_type: str) -> str:
flash_tasks = {
"classification",
"extraction",
"formatting",
"intent-routing",
"summarization",
}
if task_type in flash_tasks:
return "deepseek-v4-flash"
return "deepseek-v4-pro"
Limite o esforço de pensamento por rota
Rastros de raciocínio são cobrados como tokens de saída. No V4-Pro, saída custa $0,87 por milhão de tokens.
Defina uma política simples:
- Tarefas mecânicas: sem pensamento ou pensamento mínimo.
- Tarefas com avaliação intermediária: esforço moderado.
- Agentes e análise complexa: pensamento profundo apenas quando a qualidade mensurável justificar.
Não reduza qualidade por intuição. Faça a alteração, rode suas avaliações e compare os resultados:
1. Mova uma rota do V4-Pro para o V4-Flash.
2. Execute o conjunto de avaliações.
3. Compare taxa de aprovação, precisão e latência.
4. Mantenha a mudança se os critérios continuarem atendidos.
5. Promova novamente para Pro apenas as entradas que falharem.
Passo 4: mova trabalhos em lote para horários fora de pico
A DeepSeek introduziu precificação de pico e fora de pico em meados de julho. As janelas e descontos atuais estão no cartão de tarifas da documentação da API DeepSeek.
Priorize cargas sem usuário aguardando resposta:
- Execuções noturnas de avaliação.
- Preenchimento de embeddings.
- Rotulagem de datasets.
- Suítes de regressão de prompts no CI.
- Geração de relatórios.
- Processamento de filas internas.
Em vez de disparar essas tarefas sob demanda, use uma fila com horário de liberação:
job = {
"type": "nightly-evaluation",
"release_at": "off_peak_window",
"payload": evaluation_batch,
}
queue.enqueue(job)
Essa otimização não exige nova validação de qualidade: os tokens e o modelo são os mesmos; apenas o horário muda.
A ressalva é que a DeepSeek não informou se a diferença entre pico e fora de pico sobreviverá ao próximo reajuste. Aproveite as tarifas atuais e revise a configuração quando a tabela de preços for atualizada.
Sua conta em cenários de 1,5x, 2x e 3x
Os valores abaixo são cenários ilustrativos, não previsões. A DeepSeek não anunciou multiplicadores, e não há garantia de que todos os níveis de preço escalarão uniformemente.
Carga mensal de exemplo:
-
V4-Pro: 400M tokens de entrada, 60% de cache-hit e 60M tokens de saída.
- Cache miss: $69,60
- Cache hit: $0,87
- Saída: $52,20
- Total Pro: $122,67
-
V4-Flash: 600M tokens de entrada e 120M tokens de saída.
- Entrada: $84,00
- Saída: $33,60
- Total Flash: $117,60
Fatura base: $240,27.
A coluna otimizada aplica os Passos 2 e 3:
- Taxa de cache-hit do Pro sobe de 60% para 85%.
- Saída do Pro cai de 60M para 45M tokens por meio de orçamentos de pensamento.
- V4-Flash permanece inalterado.
| Cenário de taxa | Conta não otimizada | Otimizada (Passos 2–3) |
|---|---|---|
| Taxas atuais | $240 | $184 |
| Aumento de 1,5x | $360 | $276 |
| Aumento de 2x | $481 | $368 |
| Aumento de 3x | $721 | $552 |
A leitura prática é simples: uma carga otimizada com aumento de 2x ($368) custa aproximadamente o mesmo que uma carga não otimizada com aumento de 1,5x ($360).
As economias estruturais acompanham qualquer multiplicador. Uma redução de 23% vale cerca de $56 hoje e $168 em um cenário de 3x.
O desconto fora de pico não está incluído na tabela porque depende da programação vigente. Portanto, a coluna otimizada é conservadora.
Quando trocar modelos supera a otimização
Mesmo no cenário especulativo de 3x, a saída do V4-Pro chegaria a $2,61 por milhão de tokens. Comparações públicas colocam a saída de concorrentes de ponta entre $25 e $30 por milhão.
A vantagem de custo diminui, mas não desaparece automaticamente.
Otimize e permaneça quando
- DeepSeek passa nas suas avaliações de qualidade.
- Seu tráfego possui prompts cacheáveis.
- As rotas podem ser encaminhadas entre Flash e Pro.
- Você tem capacidade de engenharia para implementar as mudanças antes do reajuste.
Troque ou divida o tráfego quando
- Sua taxa de cache-hit é estruturalmente baixa porque cada requisição carrega documentos longos e únicos.
- Você paga por V4-Pro em tarefas que um modelo menor de outro provedor aprova nas suas avaliações.
- O multiplicador anunciado ultrapassa o limite econômico calculado no Passo 1.
- Você precisa reduzir risco operacional de depender de um único provedor.
Para a maioria das equipes, a resposta será híbrida:
- Mantenha DeepSeek nas rotas em que vence em custo por avaliação aprovada.
- Mova rotas em que outro modelo entrega melhor custo ou qualidade.
- Execute testes de paridade continuamente entre provedores.
Conclusão
A DeepSeek informou que os preços vão subir, mas ainda não detalhou quanto, quando ou como cada modelo será afetado.
Use esse período para executar ações mensuráveis:
- Instrumente gasto e tokens por funcionalidade.
- Estabilize os prefixos de prompt para aumentar cache-hit.
- Roteie tarefas simples para V4-Flash.
- Limite pensamento em rotas que não exigem raciocínio profundo.
- Programe workloads em lote para janelas fora de pico.
- Valide um segundo provedor antes de precisar dele.
Para testar o failover, baixe o Apidog gratuitamente. Crie a suíte uma vez, execute-a contra api.deepseek.com e contra seu fallback usando ambientes separados por provedor, e agende execuções para garantir que ambos continuem compatíveis.
Top comments (0)