DEV Community

Cover image for GPT-6.1 Sol vs Claude Sonnet 5.5: Mesmos Preços ($2/$10), Lançados Quase Juntos e Sem Benchmark Comum
Lucas
Lucas

Posted on Originally published at apidog.com

GPT-6.1 Sol vs Claude Sonnet 5.5: Mesmos Preços ($2/$10), Lançados Quase Juntos e Sem Benchmark Comum

GPT-6.1 Sol e Claude Sonnet 5.5 custam US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Os lançamentos ocorreram com apenas um dia de diferença: Sonnet 5.5 em 28 de setembro de 2026 e GPT-6.1 Sol em 29 de setembro. Como nenhum fornecedor publicou um benchmark direto entre essas versões, a forma mais confiável de escolher é executar os dois modelos nas suas tarefas reais e comparar o custo por tarefa aprovada — não apenas o preço por token.

Experimente o Apidog hoje

Este guia reúne especificações, preços, benchmarks divulgados pelos fornecedores e dados de terceiros — que ainda avaliam o GPT-6 Sol, não o GPT-6.1 Sol. No final, você verá como montar uma comparação reproduzível no Apidog. Para detalhes de cada modelo, consulte o que é GPT-6.1 Sol e o que é Claude Sonnet 5.5.

GPT-6.1 Sol vs Claude Sonnet 5.5: especificações e preços

Fontes: página de preços da OpenAI, visão geral do Sonnet 5.5 e preços da Anthropic, além da página do modelo GPT-6.1 Sol.

GPT-6.1 Sol Claude Sonnet 5.5
ID do modelo gpt-6.1-sol claude-sonnet-5-5
(Bedrock: anthropic.claude-sonnet-5-5)
Lançado 29 de setembro de 2026 28 de setembro de 2026
Entrada / saída por 1M US$ 2 / US$ 10 US$ 2 / US$ 10
Leituras de cache por 1M US$ 0,10 US$ 0,20
Escritas de cache por 1M US$ 2,50 US$ 2,50 (5 minutos), US$ 4 (1 hora)
Lote por 1M US$ 1 / US$ 5 US$ 1 / US$ 5
Prompts acima de 272K tokens de entrada US$ 4 entrada, US$ 0,20 cache, US$ 15 saída para toda a requisição Sem taxa adicional na janela de 1M
Nível mais rápido Fast por US$ 4 / US$ 20; Ultrafast “em breve” Modo rápido não disponível
Janela de contexto 1.050.000 (922.000 de entrada máxima) 1M
Saída máxima 128.000 128K (300K em Lote com cabeçalho beta)
Corte de conhecimento 30 de abril de 2026 Junho de 2026
Níveis de esforço low, medium (padrão), high, xhigh, max; sem none low, medium, high (padrão da API), xhigh, max; o pensamento não pode ser desativado
Formato da API Respostas com ferramentas, Conclusões de Chat sem ferramentas, Lote Mensagens, Lote
Outras plataformas OpenRouter: openai/gpt-6.1-sol Bedrock, Google Cloud, Microsoft Foundry, Claude Platform na AWS
Acesso gratuito Nenhum. Plus, Pro, Business, Enterprise e Edu têm acesso no ChatGPT Work e Codex, conforme a documentação dos modelos Disponível para conversa em Claude.ai; a API cobra por token

Onde o preço realmente muda

Há dois pontos que afetam diretamente o custo:

  1. Cache abaixo de 272K tokens de entrada

    As leituras de cache do GPT-6.1 Sol custam metade das do Sonnet 5.5. Se sua aplicação reutiliza um prompt de sistema longo, instruções fixas ou documentos estáveis, a OpenAI pode ter custo menor.

  2. Prompts acima de 272K tokens de entrada

    O cenário se inverte. Segundo a página do modelo GPT-6.1 Sol, a requisição inteira passa a usar 2x as taxas de entrada e cache e 1,5x a taxa de saída. O Sonnet 5.5 mantém as taxas de US$ 2 e US$ 10.

Por exemplo, sem cache, um prompt de 400.000 tokens com resposta de 5.000 tokens custa aproximadamente:

  • GPT-6.1 Sol: US$ 1,68
  • Claude Sonnet 5.5: US$ 0,85

Preço de tabela não basta: o consumo de tokens e a taxa de aprovação por tarefa definem o custo efetivo.

O que cada fornecedor afirma — e contra qual modelo

OpenAI sobre GPT-6.1 Sol Anthropic sobre Claude Sonnet 5.5
Comparado com GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 Sonnet 5, Opus 5.5, GPT-6 Sol
Inclui o outro modelo Não Não; GPT-6.1 Sol ainda não existia
Manchete “Inteligência próxima à Astra” por um quinto do preço padrão de tokens da Astra Mais de 30% mais rápido que Sonnet 5, com até 30% menos custo por tarefa
Quem realizou os testes OpenAI; resultados de concorrentes vieram de relatórios públicos, conforme nota de rodapé Anthropic, Cognition, Cursor, Artificial Analysis e Surge AI, dependendo do benchmark

A postagem de lançamento do GPT-6.1 Sol apresenta os seguintes resultados:

  • AutomationBench 1.0.6, esforço médio: +2,2 pontos percentuais sobre o Opus 5.5 por aproximadamente um terço do custo, além de +4,8 pp sobre o GPT-6 Sol.
  • Terminal-Bench Science 0.1, esforço máximo: US$ 5,47 por tarefa, contra US$ 23,21 do Opus 5.5. O GPT-6 Astra ainda tem pontuação superior, com 68,1%.
  • OSWorld 2.0 offline, esforço máximo: +7 pp sobre o GPT-6 Sol por menos da metade do custo.

A postagem de lançamento do Sonnet 5.5 inclui o GPT-6 Sol como referência:

  • FrontierCode 1.1, executado pela Cognition: Sonnet 5.5 alcança 52,1% em xhigh e 46,2% em max, contra 49,3% do GPT-6 Sol. Em esforço alto, a Anthropic afirma que o Sonnet 5.5 iguala a melhor pontuação do GPT-6 Sol por cerca de um quinto do custo.
  • GDPval-AA v2.1 e AA-Briefcase v1.1, executados pela Artificial Analysis: 1844 contra 1487 e 1811 contra 1483, respectivamente.

A análise dos benchmarks do Sonnet 5.5 cobre o restante da tabela publicada pela Anthropic.

Por que não fazer uma comparação indireta?

É tentador usar o Opus 5.5 como ponte, porque ambos os fornecedores citam AutomationBench e Terminal-Bench Science. Mas os ambientes e configurações não são equivalentes:

  • A OpenAI relata AutomationBench 1.0.6 com esforço médio no próprio ambiente.
  • A tabela do cartão de sistema da Anthropic executa Claude com esforço máximo.
  • A Anthropic informa Sonnet 5.5 em 59,9% no Terminal-Bench Science, mas a OpenAI não publica uma pontuação bruta equivalente para GPT-6.1 Sol.
  • A OpenAI usou OSWorld 2.0 offline; a Anthropic usou OSWorld 2.1.

A comparação GPT-6 Sol vs Claude Opus 5.5 encontrou a mesma limitação: benchmarks com nomes semelhantes não são necessariamente comparáveis.

O que terceiros mediram no GPT-6 Sol, não no 6.1

As comparações independentes disponíveis ainda emparelham Sonnet 5.5 com o GPT-6 Sol anterior. A mais abrangente é da Artificial Analysis, cujo Intelligence Index v4.3.2 agrega 10 avaliações.

Esforço Índice Sonnet 5.5 Sonnet 5.5: custo por tarefa Índice GPT-6 Sol GPT-6 Sol: custo por tarefa
Médio 41 US$ 0,59 40 US$ 0,25
Alto 47 US$ 1,08 43 US$ 0,38
Xhigh 52 US$ 2,74 44 US$ 0,52
Máximo 56 US$ 7,60 48 US$ 1,05

No esforço máximo, a mesma página mede:

  • Sonnet 5.5: 138 tokens de saída por segundo
  • GPT-6 Sol: 76 tokens de saída por segundo

O Sonnet 5.5 teve pontuação mais alta e custo maior por tarefa em todos os níveis exibidos, apesar de os preços por token serem idênticos. A diferença é o número de tokens consumidos durante a execução.

Um exemplo útil: o Sonnet 5.5 em esforço alto registrou índice 47 por US$ 1,08 por tarefa, enquanto o GPT-6 Sol em esforço máximo alcançou 48 por US$ 1,05.

Os próprios gráficos da Anthropic mostram esse trade-off:

  • No AA-Briefcase, o GPT-6 Sol custa menos por tarefa em todos os níveis — US$ 0,34 contra US$ 1,64 em médio — enquanto o Sonnet 5.5 pontua mais alto.
  • No FrontierCode, Sonnet 5.5 em alto atinge 49,4% por US$ 0,42 por tarefa, contra 49,3% do GPT-6 Sol em máximo por US$ 2,07.

Esses dados se referem ao GPT-6 Sol, não ao GPT-6.1 Sol. A OpenAI afirma que o GPT-6.1 Sol supera o GPT-6 Sol com esforço igual ou menor em vários benchmarks, mas será necessário aguardar medições independentes.

Onde cada modelo tende a ser mais forte

GPT-6.1 Sol

A OpenAI posiciona o GPT-6.1 Sol para codificação complexa, uso de computador e trabalho profissional que exige desempenho próximo ao Astra com menor custo.

Pontos destacados pelo fornecedor:

  • Automação agêntica;
  • Uso de computador;
  • Tarefas científicas;
  • Menos erros factuais em esforço baixo;
  • Cargas de trabalho com cache intenso abaixo de 272K tokens de entrada;
  • Opção de velocidade paga com o nível Fast.

Claude Sonnet 5.5

A Anthropic posiciona o Sonnet 5.5 para tarefas cotidianas bem definidas, correção de bugs e criação ou melhoria de documentos, slides e planilhas.

Pontos destacados pelo fornecedor:

  • Codificação agêntica;
  • Trabalho de conhecimento;
  • Uso de computador;
  • 70,6% no Terminal-Bench 4.0 em max, executado pela Anthropic;
  • 80,1% parcial no OSWorld 2.1;
  • Prompts acima de 272K tokens;
  • Disponibilidade em Bedrock, Google Cloud e Microsoft Foundry.

A Anthropic afirma que o Opus 5.5 continua mais forte em trabalhos complexos e abertos. Veja a comparação Sonnet 5.5 vs Opus 5.5.

Controle esforço e variância

Dois detalhes podem invalidar uma comparação rápida:

  1. Os padrões de esforço são diferentes

    O GPT-6.1 Sol usa medium como padrão; o Sonnet 5.5 usa high como padrão na API. Compare pares correspondentes, como medium vs medium e high vs high.

  2. Controles de amostragem não devem ser usados como variável principal

    O Sonnet 5.5 retorna erro 400 para valores não padrão de temperature, top_p ou top_k. A orientação do GPT-6 recomenda diminuir temperature e top_p quando o esforço não for none.

Para medir variância, execute cada tarefa mais de uma vez e registre taxa de aprovação, tokens, latência e custo.

Execute a comparação no Apidog

Use de 20 a 50 tarefas do seu tráfego real. Priorize tarefas com resultado verificável, por exemplo:

  • geração de JSON válido;
  • classificação com rótulo esperado;
  • extração estruturada;
  • testes de código;
  • validação de campos obrigatórios;
  • resolução de tickets com critérios de aceite.

1. Crie o ambiente

No Apidog, crie um ambiente com estes segredos:

OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Enter fullscreen mode Exit fullscreen mode

Mantenha chaves de API fora das requisições e use variáveis de ambiente.

2. Salve uma requisição para cada fornecedor

As APIs têm formatos diferentes. Consulte a referência de Respostas da OpenAI e a referência de Mensagens da Anthropic. A comparação de formatos de API explica por que essa diferença importa.

OpenAI Responses API

POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{
  "model": "gpt-6.1-sol",
  "reasoning": {
    "effort": "{{EFFORT}}"
  },
  "max_output_tokens": 25000,
  "input": "{{prompt}}"
}
Enter fullscreen mode Exit fullscreen mode

Anthropic Messages API

POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 25000,
  "output_config": {
    "effort": "{{EFFORT}}"
  },
  "messages": [
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

3. Adicione asserções de resposta e qualidade

Valide primeiro se a API concluiu normalmente. Depois, valide o resultado contra uma coluna expected do seu CSV ou dataset.

Verificação OpenAI Responses Anthropic Messages
Finalizado normalmente $.status igual a completed $.stop_reason igual a end_turn
Resposta presente $.output[*].type contém message $.content[*].type contém text
Tokens de saída, incluindo raciocínio $.usage.output_tokens $.usage.output_tokens
Leituras de cache $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
Escritas de cache $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens

Para resultados estruturados, uma asserção prática pode verificar:

  • campo obrigatório presente;
  • JSON válido;
  • valor igual ao esperado;
  • expressão regular;
  • tempo máximo de resposta;
  • ausência de campos proibidos.

4. Calcule o custo de cada resposta

Use um script pós-processador ou exporte os dados de uso para calcular o custo.

Para a OpenAI:

  • input_tokens inclui tokens em cache e tokens de escrita de cache;
  • subtraia esses valores antes de aplicar a taxa padrão de US$ 2 por milhão;
  • aplique as taxas de cache separadamente;
  • aplique a regra de entrada acima de 272K tokens.

Consulte a documentação de cache de prompt da OpenAI.

Para a Anthropic:

  • input_tokens conta apenas os tokens após o último ponto de interrupção do cache;
  • use cache_read_input_tokens e cache_creation_input_tokens para calcular leituras e escritas de cache.

Consulte a documentação de cache de prompt da Anthropic.

5. Execute o cenário com o CSV

Adicione ambas as requisições a um cenário de teste. Mantenha os prompts em uma única linha e sem aspas duplas no CSV.

Exemplo de prompts.csv:

prompt,expected
Classifique o sentimento: excelente produto,positivo
Classifique o sentimento: atendimento ruim,negativo
Enter fullscreen mode Exit fullscreen mode

Execute o cenário pela CLI do Apidog:

apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Enter fullscreen mode Exit fullscreen mode

Repita a execução para cada nível de esforço relevante:

# GPT-6.1 Sol e Sonnet 5.5 em medium
--env-var "EFFORT=medium"

# GPT-6.1 Sol e Sonnet 5.5 em high
--env-var "EFFORT=high"
Enter fullscreen mode Exit fullscreen mode

6. Compare custo por tarefa aprovada

Use esta fórmula:

custo por tarefa aprovada = gasto total / número de tarefas aprovadas
Enter fullscreen mode Exit fullscreen mode

Registre ao menos estas métricas por modelo e nível de esforço:

Métrica Por que medir
Taxa de aprovação Mede qualidade útil
Custo total Mede gasto real
Custo por tarefa aprovada Normaliza qualidade e custo
Tokens de entrada e saída Explica diferenças de custo
Uso de cache Mostra o impacto do prompt reutilizado
Latência Ajuda em fluxos interativos ou síncronos
Taxa de erro Identifica falhas de API ou formato

Execute pelo menos medium e high em ambos os modelos. O mesmo nome de esforço não representa necessariamente o mesmo nível de raciocínio entre fornecedores.

Para detalhes adicionais, consulte o guia da API GPT-6.1 Sol e como usar a API Claude Sonnet 5.5.

FAQ

O GPT-6.1 Sol é mais barato que o Claude Sonnet 5.5?

O preço de tabela é o mesmo: US$ 2 por 1M tokens de entrada e US$ 10 por 1M tokens de saída. O GPT-6.1 Sol tem leituras de cache mais baratas, enquanto o Sonnet 5.5 é mais barato para entradas acima de 272K tokens. O custo real depende dos tokens usados e da taxa de aprovação por tarefa.

Qual é melhor para codificação?

Não existe benchmark compartilhado entre GPT-6.1 Sol e Claude Sonnet 5.5. A Anthropic relata Sonnet 5.5 acima do GPT-6 Sol no FrontierCode. A OpenAI relata que GPT-6.1 Sol supera a melhor pontuação DeepSWE do GPT-6 Sol em 6,4 pp. Teste ambos no seu repositório, pipeline de CI e tarefas reais.

Qual é mais rápido?

A Artificial Analysis mediu 138 tokens por segundo para Sonnet 5.5 e 76 para GPT-6 Sol, ambos em esforço máximo. Ainda não há números independentes equivalentes para GPT-6.1 Sol.

Algum dos dois é gratuito?

O GPT-6.1 Sol não tem nível gratuito de API. O Sonnet 5.5 está disponível nos aplicativos de chat Claude.ai, mas a API cobra por token. Veja como usar o Claude Sonnet 5.5 gratuitamente.

Escolha executando ambos

Pegue dez tarefas do seu backlog e execute os dois modelos em medium e high. Compare:

  1. tarefas aprovadas;
  2. custo total;
  3. custo por tarefa aprovada;
  4. latência;
  5. consumo de tokens;
  6. comportamento com cache.

Use o Apidog para salvar esse par de requisições como um cenário reutilizável. Assim, você pode repetir o teste quando a Artificial Analysis publicar dados do GPT-6.1 Sol ou quando qualquer fornecedor lançar um novo snapshot.

Top comments (0)