O Gemini 3.8 Flash está disponível hoje: um modelo estável com nível gratuito, preço de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída até 31/12/2026; depois, US$ 1,50 e US$ 7,50. O limite de saída é de 64K tokens. O Gemini 4 Argon ainda não está disponível publicamente. A publicação de lançamento do Google informa US$ 2 por entrada e US$ 10 por saída durante um período introdutório sem data de término especificada; depois, US$ 4 e US$ 20. O Google afirma que o limite de saída do Argon é de 1M de tokens e que ele está disponível hoje apenas para participantes do Fairwind Program. Se você precisa lançar neste trimestre, implemente com Flash e deixe o Argon a uma mudança de configuração de distância.
Este post compara especificações, benchmarks compartilhados nas publicações de lançamento, avaliações cibernéticas e o custo de uma chamada idêntica. Em seguida, propõe uma regra de decisão e uma configuração prática para alternar modelos. Para contexto, veja o que é Gemini 4 Argon e o que é Gemini 3.8 Flash.
Lado a lado: o que você pode chamar hoje
| Gemini 3.8 Flash | Gemini 4 Argon | |
|---|---|---|
| Disponibilidade | Estável na API Gemini, AI Studio, Antigravity e Gemini Enterprise | Subconjunto de parceiros do Fairwind Program, como modelo gerenciado no Gemini Enterprise |
| ID do modelo | gemini-3.8-flash |
Não publicado |
| Preço por 1M de tokens (entrada / saída) | US$ 0,75 / US$ 3,75 até 31/12/2026; depois US$ 1,50 / US$ 7,50 | US$ 2 / US$ 10 introdutório; depois US$ 4 / US$ 20 |
| Entrada em cache por 1M | US$ 0,075; depois US$ 0,15 | US$ 0,10 introdutório; depois US$ 0,20 |
| Limite de saída | 65.536 tokens | 1M de tokens, segundo o Google |
| Janela de entrada | 1.048.576 tokens | Não publicado |
| Níveis de pensamento |
low, medium (padrão), high; minimal retorna HTTP 400 |
Não documentado |
| Nível gratuito da API | Sim, com limite de taxa | Nenhum anunciado |
| Acesso do consumidor | Aplicativo Gemini no AI Pro e Ultra; Modo AI na Pesquisa | Ainda não; assinantes AI Ultra estão na primeira onda, sem data |
Alguns detalhes exigem cautela:
- O Google não publicou a janela de entrada do Argon, embora sua avaliação de contexto longo tenha usado prompts de até 1M de tokens.
- O Google afirma que o Argon tem limite de saída de 1M de tokens. Já a Vals AI lista um máximo de 262K para a configuração que testou.
- As avaliações do Argon usaram “as configurações de pensamento mais altas”. Isso sugere um nível alto, mas o Google não documentou nomes, valores aceitos ou padrão.
- Os níveis do Flash estão nos documentos de pensamento do Google e no guia de níveis de pensamento do 3.8 Flash.
O nível gratuito do Flash tem limite de taxa, e o Google informa que os dados desse nível são usados para melhorar seus produtos. Não há uma opção gratuita anunciada para o Argon; consulte o explicador de acesso gratuito ao Argon para alternativas disponíveis hoje.
Benchmarks compartilhados nas duas publicações
As tabelas de lançamento dos dois modelos compartilham duas linhas em texto. São números reportados pelo Google, e a metodologia do Argon atribui ambas as avaliações à Vals AI.
| Benchmark | Gemini 3.8 Flash | Gemini 4 Argon |
|---|---|---|
| Vals Finance Agent v2 | 61,4% | 65,4% |
| Harvey Legal Agent Benchmark | 10,0% | 19,6% |
Interprete a diferença como direcional, não como teste controlado: as tabelas foram publicadas com um mês de diferença e contra conjuntos diferentes de concorrentes.
Ainda assim, há dois sinais práticos:
- No benchmark financeiro, o Argon abre 4 pontos: 65,4% contra 61,4%.
- No benchmark jurídico, o Argon quase dobra a pontuação: 19,6% contra 10,0%.
A maior parte das métricas publicadas para o Argon não tem equivalência textual para o 3.8 Flash. Por exemplo, a tabela do Flash incluiu HLE-Verified, enquanto a do Argon não. A pontuação DeepSWE do Flash apareceu apenas em imagens de cartão do modelo.
Na Arena’s Text leaderboard, um ranking de terceiros, o Argon (Alto) aparece em #1 em votos preliminares, enquanto o Gemini 3.8 Flash (Alto) aparece em #11. Consulte o detalhamento dos benchmarks do Argon para a tabela completa de 19 linhas.
Cibernético: Argon vs. 3.8 Flash Cyber
A página cibernética da DeepMind compara o Argon ao Gemini 3.8 Flash Cyber, uma variante do Flash com acesso restrito via Fairwind.
| Avaliação cibernética | Gemini 4 Argon | Gemini 3.8 Flash Cyber |
|---|---|---|
| Descoberta de vulnerabilidade no mundo real | 85,8% | 71,0% |
| Wiz Penetration Test Benchmark | 70,9% | 58,2% |
Esses números não mudam sua decisão de implementação se você não participa do Fairwind:
- O Gemini 3.8 Flash Cyber é GA apenas por lista de permissões na Plataforma de Agentes Gemini Enterprise.
- O Argon é exclusivo do Fairwind.
- Para construir hoje, use o Gemini 3.8 Flash geral.
Custo da mesma chamada em ambos
Considere uma chamada com:
- 100.000 tokens de entrada;
- 8.000 tokens de saída;
- tokens de pensamento incluídos nos 8.000 tokens de saída.
Os modelos Gemini atuais, incluindo o 3.8 Flash, cobram tokens de pensamento como saída. O Google não detalhou o comportamento de cobrança do Argon; os cálculos abaixo assumem que ele segue o padrão atual.
| Modelo e período | Custo de entrada | Custo de saída | Total por chamada |
|---|---|---|---|
| 3.8 Flash, introdutório | 0,1M × US$ 0,75 = US$ 0,075 | 0,008M × US$ 3,75 = US$ 0,030 | US$ 0,105 |
| 3.8 Flash, a partir de 01/01/2027 | 0,1M × US$ 1,50 = US$ 0,150 | 0,008M × US$ 7,50 = US$ 0,060 | US$ 0,210 |
| Argon, introdutório | 0,1M × US$ 2 = US$ 0,200 | 0,008M × US$ 10 = US$ 0,080 | US$ 0,280 |
| Argon, padrão | 0,1M × US$ 4 = US$ 0,400 | 0,008M × US$ 20 = US$ 0,160 | US$ 0,560 |
As taxas por token do Argon são 8/3, ou aproximadamente 2,67 vezes as do Flash, tanto no período introdutório quanto no preço padrão.
Com 1.000 chamadas desse perfil por dia:
- Flash introdutório: US$ 105/dia
- Argon introdutório: US$ 280/dia
Essa proporção pode mudar por três motivos:
A contagem de tokens será diferente. O mesmo prompt pode produzir volumes distintos de saída e pensamento em cada modelo. As avaliações do Argon usaram a configuração de pensamento mais alta, e o Google informa que níveis maiores no Flash podem consumir mais tokens.
-
Saídas longas alteram a arquitetura. Uma resposta de 200.000 tokens não cabe no limite de 65.536 tokens do Flash e exigiria múltiplas chamadas. Pelo limite declarado do Argon, ela caberia em uma única resposta:
- 0,2M × US$ 10 = US$ 2,00 no preço introdutório;
- 0,2M × US$ 20 = US$ 4,00 no preço padrão.
Apenas uma data de encerramento é conhecida. O preço introdutório do Flash termina em 31/12/2026. O Google não informou quando o preço introdutório do Argon termina.
O Flash também oferece Batch com 50% de desconto — US$ 0,375 para entrada e US$ 1,875 para saída até 31 de dezembro — conforme a página de preços da API Gemini. O Google não publicou preços de Batch para o Argon.
Para mais detalhes, veja o guia de preços do Argon e o guia de preços do 3.8 Flash.
Você deve esperar pelo Argon ou lançar no Flash?
Lance no 3.8 Flash agora quando
- Você tem orçamento limitado. O Flash custa 3/8 do Argon por token, e Batch reduz esse custo pela metade.
- Você tem alto volume. Classificação, extração, roteamento e chat em escala acumulam custos rapidamente a US$ 10 por 1M de tokens de saída.
- Você precisa lançar hoje. O Flash tem ID estável, nível gratuito para prototipagem e calendário de preços publicado.
- Suas respostas cabem em 65.536 tokens. A maioria das cargas de trabalho de API se encaixa nesse limite.
Planeje o Argon quando
- O trabalho exige horizonte longo. O Google descreve o Argon como construído para sustentar raciocínio profundo em fluxos de trabalho complexos e de longo horizonte.
- Você precisa de saídas acima de 64K. Reescritas completas de módulos, relatórios extensos e grandes migrações são candidatos ao limite declarado de 1M de tokens.
- Você executa agentes jurídicos ou financeiros. São as duas linhas compartilhadas pelas tabelas de lançamento, e o Argon lidera nas duas.
- Você participa do Fairwind. O Argon é o modelo priorizado pelo programa.
A estratégia mais segura não é escolher apenas um modelo: direcione a maior parte do tráfego para o Flash e envie o hard tail — os casos mais difíceis e complexos — para o Argon quando ele estiver disponível para você.
Uma solicitação salva, dois modelos
Não fixe o modelo no código. Guarde-o em uma variável de ambiente, execute suas chamadas reais no Flash e altere apenas a variável quando o ID oficial do Argon for publicado.
O Google ainda não publicou o ID do modelo Argon. Não tente adivinhá-lo.
MODEL="${GEMINI_MODEL:-gemini-3.8-flash}"
curl -s -X POST \
"https://generativelanguage.googleapis.com/v1beta/models/${MODEL}:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [
{
"parts": [
{
"text": "Summarize this contract clause in 3 bullets."
}
]
}
],
"generationConfig": {
"thinkingConfig": {
"thinkingLevel": "medium"
},
"maxOutputTokens": 8192
}
}'
Checklist de implementação
- Defina
GEMINI_API_KEYeGEMINI_MODELno ambiente. - Use
gemini-3.8-flashcomo valor inicial deGEMINI_MODEL. - Salve uma solicitação real, representativa do tráfego da sua aplicação.
- Valide:
- status HTTP
200; - campos que sua aplicação consome;
- estrutura esperada da resposta;
- teto de custo usando
usageMetadata.thoughtsTokenCount.
- status HTTP
- Defina
maxOutputTokensexplicitamente para evitar que uma resposta longa consuma todo o orçamento. - Execute a mesma solicitação de forma recorrente e guarde os resultados como linha de base.
Toda resposta de generateContent termina com usageMetadata. No Apidog, salve a chave e o modelo em um ambiente, crie asserções para o contrato da resposta e registre o uso de tokens em cenários de teste.
Há duas ressalvas para o lançamento do Argon:
- O Google informa que “todos os novos modelos” serão lançados na API Interactions, mas não confirmou se o Argon suportará
generateContent. - Os níveis de pensamento do Argon não estão documentados. Portanto,
mediumpode não ser um valor válido ou equivalente.
Por isso, mantenha também uma versão da solicitação usando Interactions:
POST https://generativelanguage.googleapis.com/v1beta/interactions
Nessa API, use generation_config.thinking_level. Quando o Argon estiver disponível, altere a variável do modelo, execute as duas versões e compare saídas, latência e usageMetadata lado a lado.
FAQ
O Gemini 4 Argon é melhor que o Gemini 3.8 Flash?
Nas duas linhas compartilhadas pelas tabelas de lançamento, sim:
- Vals Finance Agent v2: 65,4% vs. 61,4%
- Harvey Legal Agent Benchmark: 19,6% vs. 10,0%
Mas ele custa aproximadamente 2,67 vezes mais por token e ainda não está disponível para chamada pública.
Devo esperar pelo Gemini 4 Argon?
Não se você precisa lançar agora. O Google não informou uma data pública de lançamento, apenas que pretende disponibilizá-lo o mais rápido possível, começando por clientes de API pagantes e assinantes AI Ultra.
Gemini 3.8 Flash ou Argon para um projeto novo?
Comece com o 3.8 Flash e mantenha o nome do modelo em uma variável. Migre para o Argon apenas os prompts que realmente precisam de saídas muito longas ou de maior profundidade em fluxos jurídicos e financeiros.
Existe uma maneira gratuita de usar o Argon?
Não. O Google não anunciou nível gratuito. Consulte o explicador de acesso gratuito ao Argon para modelos Gemini gratuitos que você pode usar hoje.
O Argon substitui o Gemini 3.8 Flash?
O Google não disse isso. O Argon é descrito como o novo modelo de fronteira, enquanto o Flash permanece como a opção disponível para implementação geral e alto volume.
Próximo passo
Configure a solicitação hoje, execute-a no Gemini 3.8 Flash e salve o relatório de saída, latência e uso de tokens. Quando o Argon for lançado, você poderá decidir em minutos se a diferença de qualidade justifica o custo no seu tráfego.
Baixe o Apidog para criar e manter essa comparação.
Top comments (0)