Gemini 4 Argon lidera 13 das 19 linhas de benchmark publicadas pelo Google contra GPT-6 Astra, Claude Opus 5.5 e Claude Fable 5.1. Porém, para implementar hoje, disponibilidade importa mais que pontuação: Astra e Opus 5.5 podem ser comprados agora; Argon está restrito a parceiros do Fairwind Program. Durante o período introdutório, o Argon custa US$ 2 por milhão de tokens de entrada e US$ 10 de saída; depois, US$ 4/US$ 20 — o mesmo preço do Opus 5.5.
Este guia compara preço, limites e benchmarks, explica por que os números não são diretamente equivalentes e mostra como montar uma avaliação com seus próprios prompts no Apidog. Se você ainda não conhece o modelo, comece por o que é Gemini 4 Argon. Para acompanhar a disponibilidade, consulte o guia de data de lançamento do Argon.
Preço e limites lado a lado
Os preços abaixo são por 1 milhão de tokens e foram publicados pelo Google, OpenAI e Anthropic: lançamento do Google, página do GPT-6 Astra e preços da Anthropic.
| Gemini 4 Argon | GPT-6 Astra | Claude Opus 5.5 | Claude Fable 5.1 | |
|---|---|---|---|---|
| Pode usá-lo hoje? | Não, apenas Fairwind | Sim | Sim | Sim |
| ID do modelo API | Não publicado | gpt-6-astra |
claude-opus-5-5 |
claude-fable-5-1 |
| Entrada | US$ 2 introdutório, depois US$ 4 | US$ 10 | US$ 4 | US$ 10 |
| Entrada em cache | US$ 0,10 introdutório, depois US$ 0,20 | US$ 1 | US$ 0,20 | US$ 0,25 |
| Saída | US$ 10 introdutório, depois US$ 20 | US$ 50 | US$ 20 | US$ 50 |
| Saída máxima | 1M, limite declarado pelo Google | 128K | 128K; 300K em Batch, beta | 128K |
| Janela de contexto | Não publicada | 1.050.000; 922K de entrada máxima | 1M | 1M |
| Sobretaxa por prompt longo | Não declarada | Acima de 272K de entrada: 2x em entrada e cache, 1,5x em saída, para toda a solicitação | Nenhuma | Nenhuma |
Pontos práticos para planejamento:
- Após a promoção, Argon e Opus 5.5 têm o mesmo preço de tabela: US$ 4 por entrada e US$ 20 por saída.
- Astra e Fable 5.1 custam 2,5x mais que as taxas padrão do Argon em entrada e saída.
- A vantagem de preço do Argon sobre o Opus 5.5 só existe durante a promoção, cuja data de encerramento não foi divulgada.
- O limite de saída de 1M é uma declaração do Google. A Vals AI lista 262K para a configuração do Argon que avaliou.
Para estimar custo por requisição, consulte preços do Gemini 4 Argon.
Onde cada modelo se destaca na tabela do Google
Antes de usar os resultados para decidir arquitetura, considere a fonte: esta é a tabela do Google. As pontuações do Argon foram reportadas pelo Google; os resultados dos concorrentes vêm principalmente de números dos próprios fornecedores ou de rankings públicos. As configurações de raciocínio também variam.
| Quem lidera | Benchmark | Argon | Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| Argon: trabalho de conhecimento | Vals Index | 68,9% | 63,1% | 65,8% | 67,0% |
| Argon: trabalho de conhecimento | AutomationBench | 51,3% | 41,4% | 31,4% | 42,5% |
| Argon: trabalho de conhecimento | Harvey’s Legal Agent Benchmark | 19,6% | 5,4% | 6,7% | 3,8% |
| Argon: codificação | DeepSWE v1.1 | 77,9% | 74,1% | 67,4% | 74,2% |
| Argon: contexto longo | GraphWalks 256K a 1M, F1 | 84,2% | 71,8% | 65,0% | 66,8% |
| Argon: multimodal | LVBench | 91,7% | 87,5% | 79,7% | 83,7% |
| Argon: multimodal | Chartography | 71,6% | 71,0% | 46,2% | 66,3% |
| Astra | FrontierSWE v2 | 55,0% | 65,5% | 56,3% | 62,3% |
| Astra | Terminal-Bench Science 0.1 | 57,6% | 68,1% | 52,6% | 63,3% |
| Astra | OSWorld-2.0, offline parcial | 69,2% | 72,6% | Não relatado | Não relatado |
| Opus 5.5 | Terminal-bench 4.0 | 57,4% | 58,2% | 57,9% | 66,4% |
| Opus 5.5 | PostTrainBench | 45,3% | 44,3% | 40,2% | 49,3% |
| Empate | CWE-bench v1 | 68,0% | 68,0% | 58,0% | 67,0% |
O Argon também vence diretamente em Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks até 128K e Agent’s Last Exam.
O Fable 5.1 não lidera nenhuma linha da tabela. No CWE-bench v1, o ranking cibernético da DeepMind mostra empate em 68% entre Argon, Astra e Grok 4.7, com Opus 5.5 em 67%.
Na comparação Argon vs. Fable 5.1, Argon pontua mais alto em 15 das 17 linhas em que ambos têm resultados. Fable supera o Argon apenas em:
- FrontierSWE v2: 56,3% vs. 55,0%.
- Terminal-bench 4.0: 57,9% vs. 57,4%.
Consulte os benchmarks do Claude Fable 5.1 e a tabela completa de benchmarks do Gemini 4 Argon.
Três ressalvas antes de confiar em diferenças pequenas
1. Os números dos concorrentes não são execuções do Google
A metodologia do Google informa que os resultados de modelos não-Gemini são obtidos de números auto-relatados pelos provedores, salvo indicação contrária. Parte dos resultados também vem de rankings públicos, como Vals AI, Proximal e Surge.
2. As metodologias não são idênticas
No DeepSWE v1.1, o Google calculou os 77,9% do Argon usando uma metodologia mini-swe-agent. O resultado do Astra vem de um ranking público, enquanto as pontuações da Anthropic vêm de cartões de sistema.
No LVBench, Gemini processou vídeo a 1 quadro por segundo. Astra recebeu 800 quadros, Opus 5.5 recebeu 600 e Fable 5.1 recebeu 300, segundo o Google, devido a limitações de API.
3. O mesmo modelo pode ter resultados diferentes em gráficos diferentes
O resultado de 66,4% do Opus 5.5 no Terminal-bench 4.0 depende de metodologia e configuração de esforço. A Anthropic relata esse valor com esforço xhigh.
A regra prática é simples: não misture valores de fontes, configurações ou metodologias diferentes em uma única tabela de decisão.
O que dizem os avaliadores de terceiros
Rankings independentes reduzem a diferença aparente entre os modelos.
A Artificial Analysis lista Argon em 8º entre 223 configurações, mas contabiliza cada configuração de raciocínio separadamente. Por modelo distinto:
- Argon: 53
- GPT-6 Astra: 53
- Claude Fable 5.1: 53
- Claude Sonnet 5.5: 56
- Claude Opus 5.5: 58 no máximo
A Artificial Analysis também lista a taxa de alucinação do Argon no AA-Omniscience em 15%, contra 51% para Astra em sua configuração máxima.
Na Arena, Argon ocupa o primeiro lugar em Texto com 1525 pontos, marcado como preliminar, com 4.942 votos. Opus 5.5 aparece em quarto. A Vals AI classifica o Argon em primeiro entre 41 modelos no Vals Index, sendo o primeiro modelo Gemini a liderar o índice.
Também há relatos de limitações práticas. A Bloomberg relatou que alguns funcionários com acesso consideraram o Argon abaixo das expectativas em determinadas tarefas de codificação e design front-end. O Google contestou essa caracterização.
Qual modelo escolher para rotear
Não existe um único melhor modelo de fronteira para todas as cargas de trabalho. Use benchmarks como hipótese inicial e valide com seus prompts.
| Tarefa | Roteie hoje | Quando Argon for lançado |
|---|---|---|
| Agentes jurídicos, financeiros e de escritório | Opus 5.5, 67,0% no Vals Index | Teste Argon; ele lidera as quatro linhas de trabalho de conhecimento |
| Agentes de codificação com uso intenso de terminal | Opus 5.5, 66,4% no Terminal-bench 4.0 | Opus 5.5 ainda lidera |
| Engenharia de software agêntica | Astra, 65,5% no FrontierSWE v2, ou Opus 5.5 | Argon lidera DeepSWE, mas fica atrás em FrontierSWE; teste ambos |
| Agentes de uso de computador e GUI | Astra, 72,6% no OSWorld-2.0 | Astra lidera OSWorld; Argon lidera Agent’s Last Exam |
| Prompts com mais de 256K tokens | Opus 5.5, sem sobretaxa, ou Astra, com sobretaxa acima de 272K | Argon, 84,2% no GraphWalks de 256K a 1M |
| Vídeo e gráficos | Astra, 87,5% no LVBench | Argon, 91,7%, considerando a ressalva sobre a contagem de quadros |
| Engenharia científica e ML | Astra no Terminal-Bench Science; Opus 5.5 no PostTrainBench | Teste Argon para LABBench 2 e RiemannBench |
| Respostas únicas acima de 128K tokens | Opus 5.5 em Batch, 300K em beta | Argon, até 1M segundo o limite declarado pelo Google |
| Alto volume e sensível a custo | Opus 5.5, US$ 4/US$ 20 | Argon a US$ 2/US$ 10 durante a promoção |
Se custo for mais importante que a pontuação máxima, veja a comparação GPT-6 Sol vs. Claude Opus 5.5.
Compare os modelos com seus próprios prompts
Benchmarks de fornecedores não mostram como um modelo lida com seu repositório, ferramentas, formato de saída ou regras de negócio. Monte uma avaliação reproduzível no Apidog.
1. Crie três requisições
Adicione requisições separadas para:
- GPT-6 Astra;
- Claude Opus 5.5;
- Gemini usando uma variável de modelo.
Para a requisição Gemini, use:
{{GEMINI_MODEL}}
Enquanto o Google não publicar o ID do Argon, defina:
gemini-3.8-flash
Consulte o guia da API GPT-6 Astra e o que é Claude Opus 5.5 para os formatos de requisição de cada fornecedor.
2. Centralize variáveis de ambiente
Armazene as chaves de API como variáveis de ambiente:
OPENAI_API_KEY
ANTHROPIC_API_KEY
GEMINI_API_KEY
GEMINI_MODEL
Coloque o prompt em uma variável compartilhada, por exemplo:
{{TEST_PROMPT}}
Assim, todos os modelos recebem exatamente a mesma entrada.
3. Adicione asserções mínimas
Em cada requisição, valide:
- status HTTP
200; - resposta não vazia;
- tokens de saída abaixo do limite esperado;
- custo estimado abaixo do orçamento.
Uma estrutura de critérios pode ser:
status == 200
response.content não está vazio
output_tokens <= OUTPUT_TOKEN_LIMIT
estimated_cost <= REQUEST_BUDGET
4. Execute como cenário de teste
Execute as três requisições em sequência e compare no relatório:
- resposta final;
- latência;
- tokens de entrada e saída;
- custo estimado;
- falhas de formato ou de ferramentas.
Calcule custo por solicitação
Para 20.000 tokens de entrada e 4.000 tokens de saída:
Astra:
20.000 × US$ 10 / 1M + 4.000 × US$ 50 / 1M
= US$ 0,20 + US$ 0,20
= US$ 0,40
Opus 5.5:
20.000 × US$ 4 / 1M + 4.000 × US$ 20 / 1M
= US$ 0,08 + US$ 0,08
= US$ 0,16
Argon, preço introdutório:
20.000 × US$ 2 / 1M + 4.000 × US$ 10 / 1M
= US$ 0,04 + US$ 0,04
= US$ 0,08
Argon, preço padrão:
20.000 × US$ 4 / 1M + 4.000 × US$ 20 / 1M
= US$ 0,08 + US$ 0,08
= US$ 0,16
Preço por token não é custo por tarefa. A Artificial Analysis mediu cerca de 62K tokens de saída por tarefa para o Argon, contra aproximadamente 27K para Astra em esforço máximo. Portanto, registre os tokens de saída nas tarefas reais da sua aplicação.
Quando o Argon estiver disponível, altere apenas a variável:
GEMINI_MODEL=<id-publicado-do-argon>
Em seguida, execute o mesmo cenário para obter uma comparação direta com prompts idênticos.
Perguntas frequentes
Gemini 4 Argon é melhor que GPT-6 Astra?
Na Artificial Analysis, ambos empatam em 53. Na tabela do Google, Argon vence a maioria das linhas, mas Astra lidera FrontierSWE v2, Terminal-Bench Science 0.1 e OSWorld-2.0. Astra também é o modelo disponível para uso hoje.
Gemini 4 Argon vs. Claude Opus 5.5: qual é melhor?
A tabela do Google favorece Argon na maioria das linhas. Opus 5.5 vence Terminal-bench 4.0 e PostTrainBench e lidera a Artificial Analysis por 58 a 53. Nas taxas padrão, Argon e Opus 5.5 têm o mesmo preço.
Gemini 4 Argon é mais barato que Claude Opus 5.5?
Durante a introdução, sim: US$ 2/US$ 10 contra US$ 4/US$ 20. Após esse período, os preços de tabela são iguais. O Google não divulgou quando a promoção termina.
Qual modelo tem o maior limite de saída?
Argon tem um limite declarado de 1M de tokens, embora a Vals AI liste 262K para a configuração avaliada. Astra, Opus 5.5 e Fable 5.1 limitam a saída síncrona a 128K. Veja o guia de 1M de tokens de saída para implicações no cliente.
Posso usar Gemini 4 Argon hoje?
Apenas por meio do Fairwind Program do Google, voltado a um conjunto de parceiros verificados de defesa cibernética. Clientes de API pagos e assinantes do Google AI Ultra são os próximos previstos, mas não há data definida.
Escolha pela carga de trabalho e teste antes de padronizar
Argon parece mais forte em trabalho de conhecimento, contexto longo e benchmarks multimodais. Astra lidera FrontierSWE, Terminal-Bench Science e OSWorld. Opus 5.5 lidera trabalho de terminal e engenharia de ML, além de ter o mesmo preço que Argon terá após o período introdutório.
Implemente hoje com os modelos disponíveis, mantenha o ID Gemini em uma variável e execute novamente o mesmo cenário quando Argon for liberado. Para montar a comparação de três requisições em um único projeto, baixe o Apidog.
Top comments (0)