GPT-6.1 Sol e Claude Sonnet 5.5 custam US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Os lançamentos ocorreram com apenas um dia de diferença: Sonnet 5.5 em 28 de setembro de 2026 e GPT-6.1 Sol em 29 de setembro. Como nenhum fornecedor publicou um benchmark direto entre essas versões, a forma mais confiável de escolher é executar os dois modelos nas suas tarefas reais e comparar o custo por tarefa aprovada — não apenas o preço por token.
Este guia reúne especificações, preços, benchmarks divulgados pelos fornecedores e dados de terceiros — que ainda avaliam o GPT-6 Sol, não o GPT-6.1 Sol. No final, você verá como montar uma comparação reproduzível no Apidog. Para detalhes de cada modelo, consulte o que é GPT-6.1 Sol e o que é Claude Sonnet 5.5.
GPT-6.1 Sol vs Claude Sonnet 5.5: especificações e preços
Fontes: página de preços da OpenAI, visão geral do Sonnet 5.5 e preços da Anthropic, além da página do modelo GPT-6.1 Sol.
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| ID do modelo | gpt-6.1-sol |
claude-sonnet-5-5(Bedrock: anthropic.claude-sonnet-5-5) |
| Lançado | 29 de setembro de 2026 | 28 de setembro de 2026 |
| Entrada / saída por 1M | US$ 2 / US$ 10 | US$ 2 / US$ 10 |
| Leituras de cache por 1M | US$ 0,10 | US$ 0,20 |
| Escritas de cache por 1M | US$ 2,50 | US$ 2,50 (5 minutos), US$ 4 (1 hora) |
| Lote por 1M | US$ 1 / US$ 5 | US$ 1 / US$ 5 |
| Prompts acima de 272K tokens de entrada | US$ 4 entrada, US$ 0,20 cache, US$ 15 saída para toda a requisição | Sem taxa adicional na janela de 1M |
| Nível mais rápido | Fast por US$ 4 / US$ 20; Ultrafast “em breve” | Modo rápido não disponível |
| Janela de contexto | 1.050.000 (922.000 de entrada máxima) | 1M |
| Saída máxima | 128.000 | 128K (300K em Lote com cabeçalho beta) |
| Corte de conhecimento | 30 de abril de 2026 | Junho de 2026 |
| Níveis de esforço |
low, medium (padrão), high, xhigh, max; sem none
|
low, medium, high (padrão da API), xhigh, max; o pensamento não pode ser desativado |
| Formato da API | Respostas com ferramentas, Conclusões de Chat sem ferramentas, Lote | Mensagens, Lote |
| Outras plataformas | OpenRouter: openai/gpt-6.1-sol
|
Bedrock, Google Cloud, Microsoft Foundry, Claude Platform na AWS |
| Acesso gratuito | Nenhum. Plus, Pro, Business, Enterprise e Edu têm acesso no ChatGPT Work e Codex, conforme a documentação dos modelos | Disponível para conversa em Claude.ai; a API cobra por token |
Onde o preço realmente muda
Há dois pontos que afetam diretamente o custo:
Cache abaixo de 272K tokens de entrada
As leituras de cache do GPT-6.1 Sol custam metade das do Sonnet 5.5. Se sua aplicação reutiliza um prompt de sistema longo, instruções fixas ou documentos estáveis, a OpenAI pode ter custo menor.Prompts acima de 272K tokens de entrada
O cenário se inverte. Segundo a página do modelo GPT-6.1 Sol, a requisição inteira passa a usar 2x as taxas de entrada e cache e 1,5x a taxa de saída. O Sonnet 5.5 mantém as taxas de US$ 2 e US$ 10.
Por exemplo, sem cache, um prompt de 400.000 tokens com resposta de 5.000 tokens custa aproximadamente:
- GPT-6.1 Sol: US$ 1,68
- Claude Sonnet 5.5: US$ 0,85
Preço de tabela não basta: o consumo de tokens e a taxa de aprovação por tarefa definem o custo efetivo.
O que cada fornecedor afirma — e contra qual modelo
| OpenAI sobre GPT-6.1 Sol | Anthropic sobre Claude Sonnet 5.5 | |
|---|---|---|
| Comparado com | GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1 | Sonnet 5, Opus 5.5, GPT-6 Sol |
| Inclui o outro modelo | Não | Não; GPT-6.1 Sol ainda não existia |
| Manchete | “Inteligência próxima à Astra” por um quinto do preço padrão de tokens da Astra | Mais de 30% mais rápido que Sonnet 5, com até 30% menos custo por tarefa |
| Quem realizou os testes | OpenAI; resultados de concorrentes vieram de relatórios públicos, conforme nota de rodapé | Anthropic, Cognition, Cursor, Artificial Analysis e Surge AI, dependendo do benchmark |
A postagem de lançamento do GPT-6.1 Sol apresenta os seguintes resultados:
- AutomationBench 1.0.6, esforço médio: +2,2 pontos percentuais sobre o Opus 5.5 por aproximadamente um terço do custo, além de +4,8 pp sobre o GPT-6 Sol.
- Terminal-Bench Science 0.1, esforço máximo: US$ 5,47 por tarefa, contra US$ 23,21 do Opus 5.5. O GPT-6 Astra ainda tem pontuação superior, com 68,1%.
- OSWorld 2.0 offline, esforço máximo: +7 pp sobre o GPT-6 Sol por menos da metade do custo.
A postagem de lançamento do Sonnet 5.5 inclui o GPT-6 Sol como referência:
-
FrontierCode 1.1, executado pela Cognition: Sonnet 5.5 alcança 52,1% em
xhighe 46,2% emmax, contra 49,3% do GPT-6 Sol. Em esforço alto, a Anthropic afirma que o Sonnet 5.5 iguala a melhor pontuação do GPT-6 Sol por cerca de um quinto do custo. - GDPval-AA v2.1 e AA-Briefcase v1.1, executados pela Artificial Analysis: 1844 contra 1487 e 1811 contra 1483, respectivamente.
A análise dos benchmarks do Sonnet 5.5 cobre o restante da tabela publicada pela Anthropic.
Por que não fazer uma comparação indireta?
É tentador usar o Opus 5.5 como ponte, porque ambos os fornecedores citam AutomationBench e Terminal-Bench Science. Mas os ambientes e configurações não são equivalentes:
- A OpenAI relata AutomationBench 1.0.6 com esforço médio no próprio ambiente.
- A tabela do cartão de sistema da Anthropic executa Claude com esforço máximo.
- A Anthropic informa Sonnet 5.5 em 59,9% no Terminal-Bench Science, mas a OpenAI não publica uma pontuação bruta equivalente para GPT-6.1 Sol.
- A OpenAI usou OSWorld 2.0 offline; a Anthropic usou OSWorld 2.1.
A comparação GPT-6 Sol vs Claude Opus 5.5 encontrou a mesma limitação: benchmarks com nomes semelhantes não são necessariamente comparáveis.
O que terceiros mediram no GPT-6 Sol, não no 6.1
As comparações independentes disponíveis ainda emparelham Sonnet 5.5 com o GPT-6 Sol anterior. A mais abrangente é da Artificial Analysis, cujo Intelligence Index v4.3.2 agrega 10 avaliações.
| Esforço | Índice Sonnet 5.5 | Sonnet 5.5: custo por tarefa | Índice GPT-6 Sol | GPT-6 Sol: custo por tarefa |
|---|---|---|---|---|
| Médio | 41 | US$ 0,59 | 40 | US$ 0,25 |
| Alto | 47 | US$ 1,08 | 43 | US$ 0,38 |
| Xhigh | 52 | US$ 2,74 | 44 | US$ 0,52 |
| Máximo | 56 | US$ 7,60 | 48 | US$ 1,05 |
No esforço máximo, a mesma página mede:
- Sonnet 5.5: 138 tokens de saída por segundo
- GPT-6 Sol: 76 tokens de saída por segundo
O Sonnet 5.5 teve pontuação mais alta e custo maior por tarefa em todos os níveis exibidos, apesar de os preços por token serem idênticos. A diferença é o número de tokens consumidos durante a execução.
Um exemplo útil: o Sonnet 5.5 em esforço alto registrou índice 47 por US$ 1,08 por tarefa, enquanto o GPT-6 Sol em esforço máximo alcançou 48 por US$ 1,05.
Os próprios gráficos da Anthropic mostram esse trade-off:
- No AA-Briefcase, o GPT-6 Sol custa menos por tarefa em todos os níveis — US$ 0,34 contra US$ 1,64 em médio — enquanto o Sonnet 5.5 pontua mais alto.
- No FrontierCode, Sonnet 5.5 em alto atinge 49,4% por US$ 0,42 por tarefa, contra 49,3% do GPT-6 Sol em máximo por US$ 2,07.
Esses dados se referem ao GPT-6 Sol, não ao GPT-6.1 Sol. A OpenAI afirma que o GPT-6.1 Sol supera o GPT-6 Sol com esforço igual ou menor em vários benchmarks, mas será necessário aguardar medições independentes.
Onde cada modelo tende a ser mais forte
GPT-6.1 Sol
A OpenAI posiciona o GPT-6.1 Sol para codificação complexa, uso de computador e trabalho profissional que exige desempenho próximo ao Astra com menor custo.
Pontos destacados pelo fornecedor:
- Automação agêntica;
- Uso de computador;
- Tarefas científicas;
- Menos erros factuais em esforço baixo;
- Cargas de trabalho com cache intenso abaixo de 272K tokens de entrada;
- Opção de velocidade paga com o nível Fast.
Claude Sonnet 5.5
A Anthropic posiciona o Sonnet 5.5 para tarefas cotidianas bem definidas, correção de bugs e criação ou melhoria de documentos, slides e planilhas.
Pontos destacados pelo fornecedor:
- Codificação agêntica;
- Trabalho de conhecimento;
- Uso de computador;
- 70,6% no Terminal-Bench 4.0 em
max, executado pela Anthropic; - 80,1% parcial no OSWorld 2.1;
- Prompts acima de 272K tokens;
- Disponibilidade em Bedrock, Google Cloud e Microsoft Foundry.
A Anthropic afirma que o Opus 5.5 continua mais forte em trabalhos complexos e abertos. Veja a comparação Sonnet 5.5 vs Opus 5.5.
Controle esforço e variância
Dois detalhes podem invalidar uma comparação rápida:
Os padrões de esforço são diferentes
O GPT-6.1 Sol usamediumcomo padrão; o Sonnet 5.5 usahighcomo padrão na API. Compare pares correspondentes, comomediumvsmediumehighvshigh.Controles de amostragem não devem ser usados como variável principal
O Sonnet 5.5 retorna erro 400 para valores não padrão detemperature,top_poutop_k. A orientação do GPT-6 recomenda diminuirtemperatureetop_pquando o esforço não fornone.
Para medir variância, execute cada tarefa mais de uma vez e registre taxa de aprovação, tokens, latência e custo.
Execute a comparação no Apidog
Use de 20 a 50 tarefas do seu tráfego real. Priorize tarefas com resultado verificável, por exemplo:
- geração de JSON válido;
- classificação com rótulo esperado;
- extração estruturada;
- testes de código;
- validação de campos obrigatórios;
- resolução de tickets com critérios de aceite.
1. Crie o ambiente
No Apidog, crie um ambiente com estes segredos:
OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
Mantenha chaves de API fora das requisições e use variáveis de ambiente.
2. Salve uma requisição para cada fornecedor
As APIs têm formatos diferentes. Consulte a referência de Respostas da OpenAI e a referência de Mensagens da Anthropic. A comparação de formatos de API explica por que essa diferença importa.
OpenAI Responses API
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{
"model": "gpt-6.1-sol",
"reasoning": {
"effort": "{{EFFORT}}"
},
"max_output_tokens": 25000,
"input": "{{prompt}}"
}
Anthropic Messages API
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{
"model": "claude-sonnet-5-5",
"max_tokens": 25000,
"output_config": {
"effort": "{{EFFORT}}"
},
"messages": [
{
"role": "user",
"content": "{{prompt}}"
}
]
}
3. Adicione asserções de resposta e qualidade
Valide primeiro se a API concluiu normalmente. Depois, valide o resultado contra uma coluna expected do seu CSV ou dataset.
| Verificação | OpenAI Responses | Anthropic Messages |
|---|---|---|
| Finalizado normalmente |
$.status igual a completed
|
$.stop_reason igual a end_turn
|
| Resposta presente |
$.output[*].type contém message
|
$.content[*].type contém text
|
| Tokens de saída, incluindo raciocínio | $.usage.output_tokens |
$.usage.output_tokens |
| Leituras de cache | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| Escritas de cache | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
Para resultados estruturados, uma asserção prática pode verificar:
- campo obrigatório presente;
- JSON válido;
- valor igual ao esperado;
- expressão regular;
- tempo máximo de resposta;
- ausência de campos proibidos.
4. Calcule o custo de cada resposta
Use um script pós-processador ou exporte os dados de uso para calcular o custo.
Para a OpenAI:
-
input_tokensinclui tokens em cache e tokens de escrita de cache; - subtraia esses valores antes de aplicar a taxa padrão de US$ 2 por milhão;
- aplique as taxas de cache separadamente;
- aplique a regra de entrada acima de 272K tokens.
Consulte a documentação de cache de prompt da OpenAI.
Para a Anthropic:
-
input_tokensconta apenas os tokens após o último ponto de interrupção do cache; - use
cache_read_input_tokensecache_creation_input_tokenspara calcular leituras e escritas de cache.
Consulte a documentação de cache de prompt da Anthropic.
5. Execute o cenário com o CSV
Adicione ambas as requisições a um cenário de teste. Mantenha os prompts em uma única linha e sem aspas duplas no CSV.
Exemplo de prompts.csv:
prompt,expected
Classifique o sentimento: excelente produto,positivo
Classifique o sentimento: atendimento ruim,negativo
Execute o cenário pela CLI do Apidog:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
Repita a execução para cada nível de esforço relevante:
# GPT-6.1 Sol e Sonnet 5.5 em medium
--env-var "EFFORT=medium"
# GPT-6.1 Sol e Sonnet 5.5 em high
--env-var "EFFORT=high"
6. Compare custo por tarefa aprovada
Use esta fórmula:
custo por tarefa aprovada = gasto total / número de tarefas aprovadas
Registre ao menos estas métricas por modelo e nível de esforço:
| Métrica | Por que medir |
|---|---|
| Taxa de aprovação | Mede qualidade útil |
| Custo total | Mede gasto real |
| Custo por tarefa aprovada | Normaliza qualidade e custo |
| Tokens de entrada e saída | Explica diferenças de custo |
| Uso de cache | Mostra o impacto do prompt reutilizado |
| Latência | Ajuda em fluxos interativos ou síncronos |
| Taxa de erro | Identifica falhas de API ou formato |
Execute pelo menos medium e high em ambos os modelos. O mesmo nome de esforço não representa necessariamente o mesmo nível de raciocínio entre fornecedores.
Para detalhes adicionais, consulte o guia da API GPT-6.1 Sol e como usar a API Claude Sonnet 5.5.
FAQ
O GPT-6.1 Sol é mais barato que o Claude Sonnet 5.5?
O preço de tabela é o mesmo: US$ 2 por 1M tokens de entrada e US$ 10 por 1M tokens de saída. O GPT-6.1 Sol tem leituras de cache mais baratas, enquanto o Sonnet 5.5 é mais barato para entradas acima de 272K tokens. O custo real depende dos tokens usados e da taxa de aprovação por tarefa.
Qual é melhor para codificação?
Não existe benchmark compartilhado entre GPT-6.1 Sol e Claude Sonnet 5.5. A Anthropic relata Sonnet 5.5 acima do GPT-6 Sol no FrontierCode. A OpenAI relata que GPT-6.1 Sol supera a melhor pontuação DeepSWE do GPT-6 Sol em 6,4 pp. Teste ambos no seu repositório, pipeline de CI e tarefas reais.
Qual é mais rápido?
A Artificial Analysis mediu 138 tokens por segundo para Sonnet 5.5 e 76 para GPT-6 Sol, ambos em esforço máximo. Ainda não há números independentes equivalentes para GPT-6.1 Sol.
Algum dos dois é gratuito?
O GPT-6.1 Sol não tem nível gratuito de API. O Sonnet 5.5 está disponível nos aplicativos de chat Claude.ai, mas a API cobra por token. Veja como usar o Claude Sonnet 5.5 gratuitamente.
Escolha executando ambos
Pegue dez tarefas do seu backlog e execute os dois modelos em medium e high. Compare:
- tarefas aprovadas;
- custo total;
- custo por tarefa aprovada;
- latência;
- consumo de tokens;
- comportamento com cache.
Use o Apidog para salvar esse par de requisições como um cenário reutilizável. Assim, você pode repetir o teste quando a Artificial Analysis publicar dados do GPT-6.1 Sol ou quando qualquer fornecedor lançar um novo snapshot.
Top comments (0)