DEV Community

Cover image for OpenAI Reduz Drasticamente Preços da API GPT-5.6: Luna Cai 80%, Terra Cai 20% (Nova Tabela de Preços)
Lucas
Lucas

Posted on • Originally published at apidog.com

OpenAI Reduz Drasticamente Preços da API GPT-5.6: Luna Cai 80%, Terra Cai 20% (Nova Tabela de Preços)

A OpenAI reduziu os preços da API de dois dos três modelos GPT-5.6 em 30 de julho de 2026. O GPT-5.6 Luna agora custa 80% menos: US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída. O GPT-5.6 Terra caiu 20%, para US$ 2 de entrada e US$ 12 de saída. O GPT-5.6 Sol, modelo de raciocínio carro-chefe, mantém as taxas de US$ 5 e US$ 30, mas ganhou um modo Rápido que processa tokens 2,5x mais rápido pelo dobro do preço padrão.

Experimente o Apidog hoje

Se o seu modelo de custos foi calculado com os preços de lançamento do GPT-5.6, ele já está desatualizado. Neste post, você verá a nova tabela de preços, o impacto no roteamento de modelos e um processo prático para recalcular custos com tráfego real. Para comparar os níveis, ferramentas como o Apidog permitem executar o mesmo prompt em Sol, Terra e Luna e medir o consumo de tokens antes de alterar a produção.

A nova tabela de preços do GPT-5.6

A comparação abaixo mostra os preços por milhão de tokens:

Modelo Entrada antiga Nova entrada Saída antiga Nova saída Mudança
GPT-5.6 Sol US$ 5,00 US$ 5,00 US$ 30,00 US$ 30,00 Sem mudança
GPT-5.6 Terra US$ 2,50 US$ 2,00 US$ 15,00 US$ 12,00 -20%
GPT-5.6 Luna US$ 1,00 US$ 0,20 US$ 6,00 US$ 1,20 -80%

Os novos preços entraram em vigor em 30 de julho de 2026 e se aplicam ao nível padrão da API. A diferença entre o topo e a base da família passou de 5x na disponibilidade geral em 9 de julho para 25x.

Isso muda a decisão de roteamento:

  • Antes, usar Luna em vez de Sol reduzia a conta em cerca de 80%.
  • Agora, essa mesma troca pode reduzir o custo em até 96%, dependendo da proporção entre tokens de entrada e saída.

Os descontos de cache de prompts continuam se aplicando além dessas taxas. Como a OpenAI não publicou preços de entrada em cache separados para as novas tarifas de Luna e Terra no anúncio, confira a página oficial de preços antes de atualizar previsões que dependem de leituras em cache.

O que mudou no GPT-5.6 Sol

O preço padrão do Sol não foi reduzido, mas suas opções de latência mudaram.

A OpenAI introduziu o modo Rápido para Sol:

  • geração de tokens 2,5x mais rápida;
  • custo de 2x a taxa padrão;
  • substitui o nível anterior de Processamento Prioritário.

Se seu tráfego de produção usa Processamento Prioritário, atualize essa configuração e revise a cobrança correspondente.

Na prática, Sol passa a ser segmentado por latência, não por desconto. Use-o quando o raciocínio mais avançado e a resposta interativa justificarem o custo. Para tarefas de alto volume ou menos críticas, Terra e Luna se tornam opções mais econômicas.

Por que a OpenAI cortou os preços

A OpenAI atribui os cortes a ganhos de eficiência de infraestrutura e inferência. O anúncio cita quatro fatores:

  • melhor roteamento de hardware na frota de inferência;
  • software de inferência mais eficiente em produção;
  • algoritmos de cache de contexto aprimorados;
  • kernels de produção reescritos pelo próprio GPT-5.6 Sol.

Segundo a OpenAI, Sol reescreveu autonomamente kernels de serviço, reduzindo a sobrecarga ponta a ponta em 20% e melhorando a eficiência de geração de tokens em mais de 15%.

Também há pressão competitiva. A cobertura do VentureBeat posiciona o corte como uma resposta ao nível Flash do Google. O custo combinado de entrada e saída de Luna agora é de US$ 1,40 por milhão de tokens, abaixo de:

O que muda para suas cargas de trabalho

O corte de 80% em Luna é a alteração com maior impacto arquitetural.

Loops de agentes ficam mais baratos

Cargas agentivas costumam gerar cadeias longas de chamadas:

  1. planejar;
  2. chamar uma ferramenta;
  3. ler o resultado;
  4. corrigir ou tentar novamente;
  5. produzir a resposta final.

Com US$ 0,20 por milhão de tokens de entrada e US$ 1,20 de saída, Luna se torna uma opção mais viável para esses loops de alto volume.

Classificação, extração e sumarização podem descer de nível

Se tarefas como classificação, extração estruturada e sumarização permaneceram em Terra por uma margem de qualidade percebida, execute uma nova avaliação.

A qualidade dos modelos não mudou, mas a relação custo-benefício mudou. Uma carga que custava US$ 100 por dia em Terra pode custar aproximadamente US$ 11 em Luna, dependendo da distribuição de tokens de entrada e saída.

Terra continua sendo um padrão prático

Nossa análise Sol vs Terra vs Luna recomendava Terra como escolha equilibrada para trabalho diário. Essa recomendação continua válida, agora com custo 20% menor.

O nível de esforço ainda pode pesar mais que a tabela

O GPT-5.6 oferece seis níveis de esforço de raciocínio. Um esforço maior tende a gerar mais tokens de saída, que continuam sendo a parte mais cara da cobrança em todos os níveis.

Reduzir o preço do modelo não corrige uma configuração de esforço superdimensionada. Meça o impacto dessa configuração antes de mudar apenas o ID do modelo.

Como recalcular seus custos com dados reais

Não baseie a decisão apenas em percentuais de marketing. Meça o tráfego que sua aplicação realmente envia.

Use este fluxo:

  1. Separe uma amostra representativa de prompts de produção.
  2. Execute as mesmas solicitações em gpt-5.6-luna, gpt-5.6-terra e gpt-5.6-sol.
  3. Registre tokens de entrada e saída de cada resposta.
  4. Aplique as novas tarifas.
  5. Compare custo, latência e qualidade no seu conjunto de avaliação.
  6. Atualize as regras de roteamento com base nos resultados.

Uma fórmula simples para estimar o custo é:

custo =
(tokens_de_entrada / 1_000_000 × tarifa_de_entrada) +
(tokens_de_saida / 1_000_000 × tarifa_de_saida)
Enter fullscreen mode Exit fullscreen mode

Por exemplo, para uma chamada Luna com 50 mil tokens de entrada e 10 mil tokens de saída:

entrada: 50.000 / 1.000.000 × US$ 0,20 = US$ 0,01
saída:   10.000 / 1.000.000 × US$ 1,20 = US$ 0,012

custo total: US$ 0,022
Enter fullscreen mode Exit fullscreen mode

O Apidog ajuda a executar esse teste sem duplicar configurações:

  1. Configure o endpoint de conclusão de chat uma vez.
  2. Defina o ID do modelo como variável de ambiente.
  3. Execute o mesmo cenário para Luna, Terra e Sol.
  4. Compare o bloco usage em cada resposta.
  5. Registre contagens reais de tokens em vez de trabalhar apenas com estimativas.

Se você está integrando GPT-5.6 pela primeira vez, consulte o guia de uso da API GPT-5.6, que cobre autenticação, IDs de modelo e formato de solicitação. Também é possível simular o endpoint enquanto aguarda aprovação de orçamento e trocar para o tráfego real sem reescrever seus testes.

Baixe o Apidog gratuitamente para executar a comparação.

A guerra de preços continua

Esta é a terceira grande mudança de preços na faixa mais barata da fronteira neste verão. O Google atualizou o nível Flash em julho, a Anthropic lançou o Claude Opus 5 pela metade do preço do Fable 5, e a OpenAI reduziu Luna para um custo inferior às opções Gemini Flash citadas.

A qualidade ainda diferencia os modelos de ponta. Porém, no nível de modelos usados como “cavalo de batalha”, a regra é cada vez mais direta: o fornecedor mais barato tende a receber as cargas em lote.

Para equipes que trabalham com APIs, a escolha de modelo não deve ser uma decisão anual. Trate o roteamento como infraestrutura:

  • mantenha o ID do modelo em configuração;
  • use variáveis de ambiente ou feature flags;
  • preserve um conjunto de avaliação estável;
  • monitore tokens, latência, erros e qualidade;
  • repita a comparação sempre que um fornecedor alterar preços.

Equipes com testes e observabilidade ao redor do roteamento capturam reduções de custo em dias, não em trimestres.

Perguntas frequentes

Quais são os novos preços da API GPT-5.6?

A partir de 30 de julho de 2026:

  • Luna: US$ 0,20 por milhão de tokens de entrada e US$ 1,20 por milhão de tokens de saída;
  • Terra: US$ 2 de entrada e US$ 12 de saída;
  • Sol: US$ 5 de entrada e US$ 30 de saída.

Sol também recebeu um modo Rápido, com processamento 2,5x mais veloz pelo dobro da taxa padrão.

O GPT-5.6 Sol teve corte de preço?

Não. As taxas padrão de Sol permanecem inalteradas.

A mudança é estrutural: o novo modo Rápido substitui Processamento Prioritário e troca 2x o preço por 2,5x a velocidade.

O GPT-5.6 Luna agora é mais barato que Gemini Flash?

Pelo preço de tabela, sim. A taxa combinada de entrada e saída de Luna é US$ 1,40 por milhão de tokens, contra US$ 2,80 para Gemini 3.5 Flash-Lite e US$ 9 para Gemini 3.6 Flash.

Preço não substitui avaliação de qualidade. Execute os modelos no seu próprio conjunto de testes antes de migrar tráfego. Para experimentar primeiro sem custo, veja como usar GPT-5.6 gratuitamente.

Os cortes de preços são aplicados automaticamente?

Sim. As novas taxas se aplicam ao uso padrão da API desde 30 de julho de 2026, sem alterações no código.

Você só precisa agir se usa Processamento Prioritário em Sol, pois ele está sendo substituído pelo modo Rápido.

O que fazer esta semana

Execute esta lista de verificação:

  • [ ] Atualize seu modelo de custos com as novas tarifas.
  • [ ] Identifique cargas que podem migrar de Terra ou Sol para Luna.
  • [ ] Reavalie os limites de roteamento para Terra após o corte de 20%.
  • [ ] Verifique configurações de esforço de raciocínio.
  • [ ] Migre Processamento Prioritário de Sol para o modo Rápido, se necessário.
  • [ ] Execute o mesmo conjunto de prompts nos três modelos.
  • [ ] Decida com base em custo, qualidade e latência reais.

Um cenário de teste no Apidog, três IDs de modelo e os dados de usage são suficientes para quantificar o impacto do corte no seu tráfego.

Top comments (0)