<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Lucas</title>
    <description>The latest articles on DEV Community by Lucas (@lucas_ferreira).</description>
    <link>https://dev.to/lucas_ferreira</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3821523%2F8a141e03-a0f4-42d4-b4f6-38a3247d8baf.png</url>
      <title>DEV Community: Lucas</title>
      <link>https://dev.to/lucas_ferreira</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/lucas_ferreira"/>
    <language>en</language>
    <item>
      <title>Gemini 4 Argon vs Gemini 3.8 Flash: Esperar ou Usar Agora?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 13:30:00 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/gemini-4-argon-vs-gemini-38-flash-esperar-ou-usar-agora-2epb</link>
      <guid>https://dev.to/lucas_ferreira/gemini-4-argon-vs-gemini-38-flash-esperar-ou-usar-agora-2epb</guid>
      <description>&lt;p&gt;O Gemini 3.8 Flash está disponível hoje: um modelo estável com nível gratuito, preço de US$ 0,75 por 1M de tokens de entrada e US$ 3,75 por 1M de tokens de saída até 31/12/2026; depois, US$ 1,50 e US$ 7,50. O limite de saída é de 64K tokens. O Gemini 4 Argon ainda não está disponível publicamente. A &lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/" rel="noopener noreferrer"&gt;publicação de lançamento&lt;/a&gt; do Google informa US$ 2 por entrada e US$ 10 por saída durante um período introdutório sem data de término especificada; depois, US$ 4 e US$ 20. O Google afirma que o limite de saída do Argon é de 1M de tokens e que ele está disponível hoje apenas para participantes do Fairwind Program. Se você precisa lançar neste trimestre, implemente com Flash e deixe o Argon a uma mudança de configuração de distância.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Este post compara especificações, benchmarks compartilhados nas publicações de lançamento, avaliações cibernéticas e o custo de uma chamada idêntica. Em seguida, propõe uma regra de decisão e uma configuração prática para alternar modelos. Para contexto, veja &lt;a href="https://apidog.com/pt/blog/what-is-gemini-4-argon?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Gemini 4 Argon&lt;/a&gt; e &lt;a href="https://apidog.com/pt/blog/what-is-gemini-3-8-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Gemini 3.8 Flash&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lado a lado: o que você pode chamar hoje
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Gemini 3.8 Flash&lt;/th&gt;
&lt;th&gt;Gemini 4 Argon&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Disponibilidade&lt;/td&gt;
&lt;td&gt;Estável na API Gemini, AI Studio, Antigravity e Gemini Enterprise&lt;/td&gt;
&lt;td&gt;Subconjunto de parceiros do Fairwind Program, como modelo gerenciado no Gemini Enterprise&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ID do modelo&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gemini-3.8-flash&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço por 1M de tokens (entrada / saída)&lt;/td&gt;
&lt;td&gt;US$ 0,75 / US$ 3,75 até 31/12/2026; depois US$ 1,50 / US$ 7,50&lt;/td&gt;
&lt;td&gt;US$ 2 / US$ 10 introdutório; depois US$ 4 / US$ 20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada em cache por 1M&lt;/td&gt;
&lt;td&gt;US$ 0,075; depois US$ 0,15&lt;/td&gt;
&lt;td&gt;US$ 0,10 introdutório; depois US$ 0,20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limite de saída&lt;/td&gt;
&lt;td&gt;65.536 tokens&lt;/td&gt;
&lt;td&gt;1M de tokens, segundo o Google&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Janela de entrada&lt;/td&gt;
&lt;td&gt;1.048.576 tokens&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Níveis de pensamento&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;low&lt;/code&gt;, &lt;code&gt;medium&lt;/code&gt; (padrão), &lt;code&gt;high&lt;/code&gt;; &lt;code&gt;minimal&lt;/code&gt; retorna HTTP 400&lt;/td&gt;
&lt;td&gt;Não documentado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nível gratuito da API&lt;/td&gt;
&lt;td&gt;Sim, com limite de taxa&lt;/td&gt;
&lt;td&gt;Nenhum anunciado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Acesso do consumidor&lt;/td&gt;
&lt;td&gt;Aplicativo Gemini no AI Pro e Ultra; Modo AI na Pesquisa&lt;/td&gt;
&lt;td&gt;Ainda não; assinantes AI Ultra estão na primeira onda, sem data&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Alguns detalhes exigem cautela:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O Google não publicou a janela de entrada do Argon, embora sua avaliação de contexto longo tenha usado prompts de até 1M de tokens.&lt;/li&gt;
&lt;li&gt;O Google afirma que o Argon tem limite de saída de 1M de tokens. Já a Vals AI lista um máximo de 262K para a configuração que testou.&lt;/li&gt;
&lt;li&gt;As avaliações do Argon usaram “as configurações de pensamento mais altas”. Isso sugere um nível alto, mas o Google não documentou nomes, valores aceitos ou padrão.&lt;/li&gt;
&lt;li&gt;Os níveis do Flash estão nos &lt;a href="https://ai.google.dev/gemini-api/docs/thinking" rel="noopener noreferrer"&gt;documentos de pensamento do Google&lt;/a&gt; e no &lt;a href="https://apidog.com/pt/blog/gemini-3-8-flash-thinking-levels?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de níveis de pensamento do 3.8 Flash&lt;/a&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O nível gratuito do Flash tem limite de taxa, e o Google informa que os dados desse nível são usados para melhorar seus produtos. Não há uma opção gratuita anunciada para o Argon; consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;explicador de acesso gratuito ao Argon&lt;/a&gt; para alternativas disponíveis hoje.&lt;/p&gt;

&lt;h2&gt;
  
  
  Benchmarks compartilhados nas duas publicações
&lt;/h2&gt;

&lt;p&gt;As tabelas de lançamento dos dois modelos compartilham duas linhas em texto. São números reportados pelo Google, e a metodologia do Argon atribui ambas as avaliações à Vals AI.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Gemini 3.8 Flash&lt;/th&gt;
&lt;th&gt;Gemini 4 Argon&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Vals Finance Agent v2&lt;/td&gt;
&lt;td&gt;61,4%&lt;/td&gt;
&lt;td&gt;65,4%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Harvey Legal Agent Benchmark&lt;/td&gt;
&lt;td&gt;10,0%&lt;/td&gt;
&lt;td&gt;19,6%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Interprete a diferença como direcional, não como teste controlado: as tabelas foram publicadas com um mês de diferença e contra conjuntos diferentes de concorrentes.&lt;/p&gt;

&lt;p&gt;Ainda assim, há dois sinais práticos:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;No benchmark financeiro, o Argon abre 4 pontos: 65,4% contra 61,4%.&lt;/li&gt;
&lt;li&gt;No benchmark jurídico, o Argon quase dobra a pontuação: 19,6% contra 10,0%.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A maior parte das métricas publicadas para o Argon não tem equivalência textual para o 3.8 Flash. Por exemplo, a tabela do Flash incluiu HLE-Verified, enquanto a do Argon não. A pontuação DeepSWE do Flash apareceu apenas em imagens de cartão do modelo.&lt;/p&gt;

&lt;p&gt;Na Arena’s Text leaderboard, um ranking de terceiros, o Argon (Alto) aparece em #1 em votos preliminares, enquanto o Gemini 3.8 Flash (Alto) aparece em #11. Consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-benchmarks?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;detalhamento dos benchmarks do Argon&lt;/a&gt; para a tabela completa de 19 linhas.&lt;/p&gt;

&lt;h2&gt;
  
  
  Cibernético: Argon vs. 3.8 Flash Cyber
&lt;/h2&gt;

&lt;p&gt;A &lt;a href="https://deepmind.google/models/gemini/cyber/" rel="noopener noreferrer"&gt;página cibernética da DeepMind&lt;/a&gt; compara o Argon ao Gemini 3.8 Flash Cyber, uma variante do Flash com acesso restrito via Fairwind.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Avaliação cibernética&lt;/th&gt;
&lt;th&gt;Gemini 4 Argon&lt;/th&gt;
&lt;th&gt;Gemini 3.8 Flash Cyber&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Descoberta de vulnerabilidade no mundo real&lt;/td&gt;
&lt;td&gt;85,8%&lt;/td&gt;
&lt;td&gt;71,0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Wiz Penetration Test Benchmark&lt;/td&gt;
&lt;td&gt;70,9%&lt;/td&gt;
&lt;td&gt;58,2%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Esses números não mudam sua decisão de implementação se você não participa do Fairwind:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O Gemini 3.8 Flash Cyber é GA apenas por lista de permissões na Plataforma de Agentes Gemini Enterprise.&lt;/li&gt;
&lt;li&gt;O Argon é exclusivo do Fairwind.&lt;/li&gt;
&lt;li&gt;Para construir hoje, use o Gemini 3.8 Flash geral.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Custo da mesma chamada em ambos
&lt;/h2&gt;

&lt;p&gt;Considere uma chamada com:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;100.000 tokens de entrada;&lt;/li&gt;
&lt;li&gt;8.000 tokens de saída;&lt;/li&gt;
&lt;li&gt;tokens de pensamento incluídos nos 8.000 tokens de saída.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Os modelos Gemini atuais, incluindo o 3.8 Flash, cobram tokens de pensamento como saída. O Google não detalhou o comportamento de cobrança do Argon; os cálculos abaixo assumem que ele segue o padrão atual.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Modelo e período&lt;/th&gt;
&lt;th&gt;Custo de entrada&lt;/th&gt;
&lt;th&gt;Custo de saída&lt;/th&gt;
&lt;th&gt;Total por chamada&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;3.8 Flash, introdutório&lt;/td&gt;
&lt;td&gt;0,1M × US$ 0,75 = US$ 0,075&lt;/td&gt;
&lt;td&gt;0,008M × US$ 3,75 = US$ 0,030&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;US$ 0,105&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;3.8 Flash, a partir de 01/01/2027&lt;/td&gt;
&lt;td&gt;0,1M × US$ 1,50 = US$ 0,150&lt;/td&gt;
&lt;td&gt;0,008M × US$ 7,50 = US$ 0,060&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;US$ 0,210&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon, introdutório&lt;/td&gt;
&lt;td&gt;0,1M × US$ 2 = US$ 0,200&lt;/td&gt;
&lt;td&gt;0,008M × US$ 10 = US$ 0,080&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;US$ 0,280&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon, padrão&lt;/td&gt;
&lt;td&gt;0,1M × US$ 4 = US$ 0,400&lt;/td&gt;
&lt;td&gt;0,008M × US$ 20 = US$ 0,160&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;US$ 0,560&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;As taxas por token do Argon são &lt;code&gt;8/3&lt;/code&gt;, ou aproximadamente &lt;strong&gt;2,67 vezes&lt;/strong&gt; as do Flash, tanto no período introdutório quanto no preço padrão.&lt;/p&gt;

&lt;p&gt;Com 1.000 chamadas desse perfil por dia:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Flash introdutório: &lt;strong&gt;US$ 105/dia&lt;/strong&gt;
&lt;/li&gt;
&lt;li&gt;Argon introdutório: &lt;strong&gt;US$ 280/dia&lt;/strong&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Essa proporção pode mudar por três motivos:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;A contagem de tokens será diferente.&lt;/strong&gt; O mesmo prompt pode produzir volumes distintos de saída e pensamento em cada modelo. As avaliações do Argon usaram a configuração de pensamento mais alta, e o Google informa que níveis maiores no Flash podem consumir mais tokens.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Saídas longas alteram a arquitetura.&lt;/strong&gt; Uma resposta de 200.000 tokens não cabe no limite de 65.536 tokens do Flash e exigiria múltiplas chamadas. Pelo limite declarado do Argon, ela caberia em uma única resposta:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;0,2M × US$ 10 = &lt;strong&gt;US$ 2,00&lt;/strong&gt; no preço introdutório;&lt;/li&gt;
&lt;li&gt;0,2M × US$ 20 = &lt;strong&gt;US$ 4,00&lt;/strong&gt; no preço padrão.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Apenas uma data de encerramento é conhecida.&lt;/strong&gt; O preço introdutório do Flash termina em 31/12/2026. O Google não informou quando o preço introdutório do Argon termina.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O Flash também oferece Batch com 50% de desconto — US$ 0,375 para entrada e US$ 1,875 para saída até 31 de dezembro — conforme a &lt;a href="https://ai.google.dev/gemini-api/docs/pricing" rel="noopener noreferrer"&gt;página de preços da API Gemini&lt;/a&gt;. O Google não publicou preços de Batch para o Argon.&lt;/p&gt;

&lt;p&gt;Para mais detalhes, veja o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de preços do Argon&lt;/a&gt; e o &lt;a href="https://apidog.com/pt/blog/gemini-3-8-flash-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de preços do 3.8 Flash&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Você deve esperar pelo Argon ou lançar no Flash?
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Lance no 3.8 Flash agora quando
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Você tem orçamento limitado.&lt;/strong&gt; O Flash custa 3/8 do Argon por token, e Batch reduz esse custo pela metade.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Você tem alto volume.&lt;/strong&gt; Classificação, extração, roteamento e chat em escala acumulam custos rapidamente a US$ 10 por 1M de tokens de saída.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Você precisa lançar hoje.&lt;/strong&gt; O Flash tem ID estável, nível gratuito para prototipagem e calendário de preços publicado.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Suas respostas cabem em 65.536 tokens.&lt;/strong&gt; A maioria das cargas de trabalho de API se encaixa nesse limite.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Planeje o Argon quando
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;O trabalho exige horizonte longo.&lt;/strong&gt; O Google descreve o Argon como construído para sustentar raciocínio profundo em fluxos de trabalho complexos e de longo horizonte.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Você precisa de saídas acima de 64K.&lt;/strong&gt; Reescritas completas de módulos, relatórios extensos e grandes migrações são candidatos ao limite declarado de 1M de tokens.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Você executa agentes jurídicos ou financeiros.&lt;/strong&gt; São as duas linhas compartilhadas pelas tabelas de lançamento, e o Argon lidera nas duas.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Você participa do Fairwind.&lt;/strong&gt; O Argon é o modelo priorizado pelo programa.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A estratégia mais segura não é escolher apenas um modelo: direcione a maior parte do tráfego para o Flash e envie o &lt;em&gt;hard tail&lt;/em&gt; — os casos mais difíceis e complexos — para o Argon quando ele estiver disponível para você.&lt;/p&gt;

&lt;h2&gt;
  
  
  Uma solicitação salva, dois modelos
&lt;/h2&gt;

&lt;p&gt;Não fixe o modelo no código. Guarde-o em uma variável de ambiente, execute suas chamadas reais no Flash e altere apenas a variável quando o ID oficial do Argon for publicado.&lt;/p&gt;

&lt;blockquote&gt;
&lt;p&gt;O Google ainda não publicou o ID do modelo Argon. Não tente adivinhá-lo.&lt;br&gt;
&lt;/p&gt;
&lt;/blockquote&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nv"&gt;MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="k"&gt;${&lt;/span&gt;&lt;span class="nv"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="k"&gt;:-&lt;/span&gt;&lt;span class="nv"&gt;gemini&lt;/span&gt;&lt;span class="p"&gt;-3.8-flash&lt;/span&gt;&lt;span class="k"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;

curl &lt;span class="nt"&gt;-s&lt;/span&gt; &lt;span class="nt"&gt;-X&lt;/span&gt; POST &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="s2"&gt;"https://generativelanguage.googleapis.com/v1beta/models/&lt;/span&gt;&lt;span class="k"&gt;${&lt;/span&gt;&lt;span class="nv"&gt;MODEL&lt;/span&gt;&lt;span class="k"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;:generateContent"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"x-goog-api-key: &lt;/span&gt;&lt;span class="nv"&gt;$GEMINI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "contents": [
      {
        "parts": [
          {
            "text": "Summarize this contract clause in 3 bullets."
          }
        ]
      }
    ],
    "generationConfig": {
      "thinkingConfig": {
        "thinkingLevel": "medium"
      },
      "maxOutputTokens": 8192
    }
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Checklist de implementação
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;Defina &lt;code&gt;GEMINI_API_KEY&lt;/code&gt; e &lt;code&gt;GEMINI_MODEL&lt;/code&gt; no ambiente.&lt;/li&gt;
&lt;li&gt;Use &lt;code&gt;gemini-3.8-flash&lt;/code&gt; como valor inicial de &lt;code&gt;GEMINI_MODEL&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Salve uma solicitação real, representativa do tráfego da sua aplicação.&lt;/li&gt;
&lt;li&gt;Valide:

&lt;ul&gt;
&lt;li&gt;status HTTP &lt;code&gt;200&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;campos que sua aplicação consome;&lt;/li&gt;
&lt;li&gt;estrutura esperada da resposta;&lt;/li&gt;
&lt;li&gt;teto de custo usando &lt;code&gt;usageMetadata.thoughtsTokenCount&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Defina &lt;code&gt;maxOutputTokens&lt;/code&gt; explicitamente para evitar que uma resposta longa consuma todo o orçamento.&lt;/li&gt;
&lt;li&gt;Execute a mesma solicitação de forma recorrente e guarde os resultados como linha de base.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Toda resposta de &lt;code&gt;generateContent&lt;/code&gt; termina com &lt;code&gt;usageMetadata&lt;/code&gt;. No &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, salve a chave e o modelo em um ambiente, crie asserções para o contrato da resposta e registre o uso de tokens em cenários de teste.&lt;/p&gt;

&lt;p&gt;Há duas ressalvas para o lançamento do Argon:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O Google informa que “todos os novos modelos” serão lançados na API Interactions, mas não confirmou se o Argon suportará &lt;code&gt;generateContent&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Os níveis de pensamento do Argon não estão documentados. Portanto, &lt;code&gt;medium&lt;/code&gt; pode não ser um valor válido ou equivalente.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Por isso, mantenha também uma versão da solicitação usando Interactions:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;POST https://generativelanguage.googleapis.com/v1beta/interactions
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Nessa API, use &lt;code&gt;generation_config.thinking_level&lt;/code&gt;. Quando o Argon estiver disponível, altere a variável do modelo, execute as duas versões e compare saídas, latência e &lt;code&gt;usageMetadata&lt;/code&gt; lado a lado.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  O Gemini 4 Argon é melhor que o Gemini 3.8 Flash?
&lt;/h3&gt;

&lt;p&gt;Nas duas linhas compartilhadas pelas tabelas de lançamento, sim:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Vals Finance Agent v2: &lt;strong&gt;65,4% vs. 61,4%&lt;/strong&gt;
&lt;/li&gt;
&lt;li&gt;Harvey Legal Agent Benchmark: &lt;strong&gt;19,6% vs. 10,0%&lt;/strong&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Mas ele custa aproximadamente 2,67 vezes mais por token e ainda não está disponível para chamada pública.&lt;/p&gt;

&lt;h3&gt;
  
  
  Devo esperar pelo Gemini 4 Argon?
&lt;/h3&gt;

&lt;p&gt;Não se você precisa lançar agora. O Google não informou uma data pública de lançamento, apenas que pretende disponibilizá-lo o mais rápido possível, começando por clientes de API pagantes e assinantes AI Ultra.&lt;/p&gt;

&lt;h3&gt;
  
  
  Gemini 3.8 Flash ou Argon para um projeto novo?
&lt;/h3&gt;

&lt;p&gt;Comece com o 3.8 Flash e mantenha o nome do modelo em uma variável. Migre para o Argon apenas os prompts que realmente precisam de saídas muito longas ou de maior profundidade em fluxos jurídicos e financeiros.&lt;/p&gt;

&lt;h3&gt;
  
  
  Existe uma maneira gratuita de usar o Argon?
&lt;/h3&gt;

&lt;p&gt;Não. O Google não anunciou nível gratuito. Consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;explicador de acesso gratuito ao Argon&lt;/a&gt; para modelos Gemini gratuitos que você pode usar hoje.&lt;/p&gt;

&lt;h3&gt;
  
  
  O Argon substitui o Gemini 3.8 Flash?
&lt;/h3&gt;

&lt;p&gt;O Google não disse isso. O Argon é descrito como o novo modelo de fronteira, enquanto o Flash permanece como a opção disponível para implementação geral e alto volume.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;p&gt;Configure a solicitação hoje, execute-a no Gemini 3.8 Flash e salve o relatório de saída, latência e uso de tokens. Quando o Argon for lançado, você poderá decidir em minutos se a diferença de qualidade justifica o custo no seu tráfego.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; para criar e manter essa comparação.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>gemini</category>
      <category>google</category>
      <category>llm</category>
    </item>
    <item>
      <title>Gemini 4 Argon x GPT-6 Astra x Claude Opus 5.5</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 13:28:48 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/gemini-4-argon-x-gpt-6-astra-x-claude-opus-55-3dg3</link>
      <guid>https://dev.to/lucas_ferreira/gemini-4-argon-x-gpt-6-astra-x-claude-opus-55-3dg3</guid>
      <description>&lt;p&gt;Gemini 4 Argon lidera 13 das 19 linhas de benchmark publicadas pelo Google contra GPT-6 Astra, Claude Opus 5.5 e Claude Fable 5.1. Porém, para implementar hoje, disponibilidade importa mais que pontuação: Astra e Opus 5.5 podem ser comprados agora; Argon está restrito a parceiros do Fairwind Program. Durante o período introdutório, o Argon custa US$ 2 por milhão de tokens de entrada e US$ 10 de saída; depois, US$ 4/US$ 20 — o mesmo preço do Opus 5.5.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Este guia compara preço, limites e benchmarks, explica por que os números não são diretamente equivalentes e mostra como montar uma avaliação com seus próprios prompts no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Se você ainda não conhece o modelo, comece por &lt;a href="https://apidog.com/pt/blog/what-is-gemini-4-argon?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Gemini 4 Argon&lt;/a&gt;. Para acompanhar a disponibilidade, consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-release-date?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de data de lançamento do Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preço e limites lado a lado
&lt;/h2&gt;

&lt;p&gt;Os preços abaixo são por 1 milhão de tokens e foram publicados pelo Google, OpenAI e Anthropic: &lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-4-argon/" rel="noopener noreferrer"&gt;lançamento do Google&lt;/a&gt;, &lt;a href="https://developers.openai.com/api/docs/models/gpt-6-astra" rel="noopener noreferrer"&gt;página do GPT-6 Astra&lt;/a&gt; e &lt;a href="https://platform.claude.com/docs/en/about-claude/pricing" rel="noopener noreferrer"&gt;preços da Anthropic&lt;/a&gt;.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Gemini 4 Argon&lt;/th&gt;
&lt;th&gt;GPT-6 Astra&lt;/th&gt;
&lt;th&gt;Claude Opus 5.5&lt;/th&gt;
&lt;th&gt;Claude Fable 5.1&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Pode usá-lo hoje?&lt;/td&gt;
&lt;td&gt;Não, apenas Fairwind&lt;/td&gt;
&lt;td&gt;Sim&lt;/td&gt;
&lt;td&gt;Sim&lt;/td&gt;
&lt;td&gt;Sim&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ID do modelo API&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gpt-6-astra&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;claude-opus-5-5&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;claude-fable-5-1&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada&lt;/td&gt;
&lt;td&gt;US$ 2 introdutório, depois US$ 4&lt;/td&gt;
&lt;td&gt;US$ 10&lt;/td&gt;
&lt;td&gt;US$ 4&lt;/td&gt;
&lt;td&gt;US$ 10&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada em cache&lt;/td&gt;
&lt;td&gt;US$ 0,10 introdutório, depois US$ 0,20&lt;/td&gt;
&lt;td&gt;US$ 1&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;td&gt;US$ 0,25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Saída&lt;/td&gt;
&lt;td&gt;US$ 10 introdutório, depois US$ 20&lt;/td&gt;
&lt;td&gt;US$ 50&lt;/td&gt;
&lt;td&gt;US$ 20&lt;/td&gt;
&lt;td&gt;US$ 50&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Saída máxima&lt;/td&gt;
&lt;td&gt;1M, limite declarado pelo Google&lt;/td&gt;
&lt;td&gt;128K&lt;/td&gt;
&lt;td&gt;128K; 300K em Batch, beta&lt;/td&gt;
&lt;td&gt;128K&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Janela de contexto&lt;/td&gt;
&lt;td&gt;Não publicada&lt;/td&gt;
&lt;td&gt;1.050.000; 922K de entrada máxima&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Sobretaxa por prompt longo&lt;/td&gt;
&lt;td&gt;Não declarada&lt;/td&gt;
&lt;td&gt;Acima de 272K de entrada: 2x em entrada e cache, 1,5x em saída, para toda a solicitação&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Pontos práticos para planejamento:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Após a promoção, Argon e Opus 5.5 têm o mesmo preço de tabela: US$ 4 por entrada e US$ 20 por saída.&lt;/li&gt;
&lt;li&gt;Astra e Fable 5.1 custam 2,5x mais que as taxas padrão do Argon em entrada e saída.&lt;/li&gt;
&lt;li&gt;A vantagem de preço do Argon sobre o Opus 5.5 só existe durante a promoção, cuja data de encerramento não foi divulgada.&lt;/li&gt;
&lt;li&gt;O limite de saída de 1M é uma declaração do Google. A Vals AI lista 262K para a configuração do Argon que avaliou.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para estimar custo por requisição, consulte &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;preços do Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Onde cada modelo se destaca na tabela do Google
&lt;/h2&gt;

&lt;p&gt;Antes de usar os resultados para decidir arquitetura, considere a fonte: esta é a tabela do Google. As pontuações do Argon foram reportadas pelo Google; os resultados dos concorrentes vêm principalmente de números dos próprios fornecedores ou de rankings públicos. As configurações de raciocínio também variam.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Quem lidera&lt;/th&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Argon&lt;/th&gt;
&lt;th&gt;Astra&lt;/th&gt;
&lt;th&gt;Fable 5.1&lt;/th&gt;
&lt;th&gt;Opus 5.5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Argon: trabalho de conhecimento&lt;/td&gt;
&lt;td&gt;Vals Index&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68,9%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;63,1%&lt;/td&gt;
&lt;td&gt;65,8%&lt;/td&gt;
&lt;td&gt;67,0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: trabalho de conhecimento&lt;/td&gt;
&lt;td&gt;AutomationBench&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;51,3%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;41,4%&lt;/td&gt;
&lt;td&gt;31,4%&lt;/td&gt;
&lt;td&gt;42,5%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: trabalho de conhecimento&lt;/td&gt;
&lt;td&gt;Harvey’s Legal Agent Benchmark&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;19,6%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;5,4%&lt;/td&gt;
&lt;td&gt;6,7%&lt;/td&gt;
&lt;td&gt;3,8%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: codificação&lt;/td&gt;
&lt;td&gt;DeepSWE v1.1&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;77,9%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;74,1%&lt;/td&gt;
&lt;td&gt;67,4%&lt;/td&gt;
&lt;td&gt;74,2%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: contexto longo&lt;/td&gt;
&lt;td&gt;GraphWalks 256K a 1M, F1&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;84,2%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;71,8%&lt;/td&gt;
&lt;td&gt;65,0%&lt;/td&gt;
&lt;td&gt;66,8%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: multimodal&lt;/td&gt;
&lt;td&gt;LVBench&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;91,7%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;87,5%&lt;/td&gt;
&lt;td&gt;79,7%&lt;/td&gt;
&lt;td&gt;83,7%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Argon: multimodal&lt;/td&gt;
&lt;td&gt;Chartography&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;71,6%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;71,0%&lt;/td&gt;
&lt;td&gt;46,2%&lt;/td&gt;
&lt;td&gt;66,3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Astra&lt;/td&gt;
&lt;td&gt;FrontierSWE v2&lt;/td&gt;
&lt;td&gt;55,0%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;65,5%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;56,3%&lt;/td&gt;
&lt;td&gt;62,3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Astra&lt;/td&gt;
&lt;td&gt;Terminal-Bench Science 0.1&lt;/td&gt;
&lt;td&gt;57,6%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68,1%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;52,6%&lt;/td&gt;
&lt;td&gt;63,3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Astra&lt;/td&gt;
&lt;td&gt;OSWorld-2.0, offline parcial&lt;/td&gt;
&lt;td&gt;69,2%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;72,6%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Não relatado&lt;/td&gt;
&lt;td&gt;Não relatado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Opus 5.5&lt;/td&gt;
&lt;td&gt;Terminal-bench 4.0&lt;/td&gt;
&lt;td&gt;57,4%&lt;/td&gt;
&lt;td&gt;58,2%&lt;/td&gt;
&lt;td&gt;57,9%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;66,4%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Opus 5.5&lt;/td&gt;
&lt;td&gt;PostTrainBench&lt;/td&gt;
&lt;td&gt;45,3%&lt;/td&gt;
&lt;td&gt;44,3%&lt;/td&gt;
&lt;td&gt;40,2%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;49,3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Empate&lt;/td&gt;
&lt;td&gt;CWE-bench v1&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68,0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68,0%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;58,0%&lt;/td&gt;
&lt;td&gt;67,0%&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;O Argon também vence diretamente em Vals Finance Agent v2, Vibe Code Bench, LABBench 2, RiemannBench, GraphWalks até 128K e Agent’s Last Exam.&lt;/p&gt;

&lt;p&gt;O Fable 5.1 não lidera nenhuma linha da tabela. No CWE-bench v1, o &lt;a href="https://deepmind.google/models/gemini/cyber/" rel="noopener noreferrer"&gt;ranking cibernético da DeepMind&lt;/a&gt; mostra empate em 68% entre Argon, Astra e Grok 4.7, com Opus 5.5 em 67%.&lt;/p&gt;

&lt;p&gt;Na comparação Argon vs. Fable 5.1, Argon pontua mais alto em 15 das 17 linhas em que ambos têm resultados. Fable supera o Argon apenas em:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;FrontierSWE v2: 56,3% vs. 55,0%.&lt;/li&gt;
&lt;li&gt;Terminal-bench 4.0: 57,9% vs. 57,4%.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Consulte os &lt;a href="https://apidog.com/pt/blog/claude-fable-5-1-benchmarks?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;benchmarks do Claude Fable 5.1&lt;/a&gt; e a tabela completa de &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-benchmarks?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;benchmarks do Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Três ressalvas antes de confiar em diferenças pequenas
&lt;/h2&gt;

&lt;h3&gt;
  
  
  1. Os números dos concorrentes não são execuções do Google
&lt;/h3&gt;

&lt;p&gt;A &lt;a href="https://deepmind.google/models/evals-methodology/gemini-4-argon" rel="noopener noreferrer"&gt;metodologia do Google&lt;/a&gt; informa que os resultados de modelos não-Gemini são obtidos de números auto-relatados pelos provedores, salvo indicação contrária. Parte dos resultados também vem de rankings públicos, como Vals AI, Proximal e Surge.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. As metodologias não são idênticas
&lt;/h3&gt;

&lt;p&gt;No DeepSWE v1.1, o Google calculou os 77,9% do Argon usando uma metodologia &lt;code&gt;mini-swe-agent&lt;/code&gt;. O resultado do Astra vem de um ranking público, enquanto as pontuações da Anthropic vêm de cartões de sistema.&lt;/p&gt;

&lt;p&gt;No LVBench, Gemini processou vídeo a 1 quadro por segundo. Astra recebeu 800 quadros, Opus 5.5 recebeu 600 e Fable 5.1 recebeu 300, segundo o Google, devido a limitações de API.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. O mesmo modelo pode ter resultados diferentes em gráficos diferentes
&lt;/h3&gt;

&lt;p&gt;O resultado de 66,4% do Opus 5.5 no Terminal-bench 4.0 depende de metodologia e configuração de esforço. A &lt;a href="https://www.anthropic.com/news/claude-opus-5-5" rel="noopener noreferrer"&gt;Anthropic relata&lt;/a&gt; esse valor com esforço &lt;code&gt;xhigh&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;A regra prática é simples: não misture valores de fontes, configurações ou metodologias diferentes em uma única tabela de decisão.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que dizem os avaliadores de terceiros
&lt;/h2&gt;

&lt;p&gt;Rankings independentes reduzem a diferença aparente entre os modelos.&lt;/p&gt;

&lt;p&gt;A &lt;a href="https://artificialanalysis.ai/leaderboards/models" rel="noopener noreferrer"&gt;Artificial Analysis&lt;/a&gt; lista Argon em 8º entre 223 configurações, mas contabiliza cada configuração de raciocínio separadamente. Por modelo distinto:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Argon: 53&lt;/li&gt;
&lt;li&gt;GPT-6 Astra: 53&lt;/li&gt;
&lt;li&gt;Claude Fable 5.1: 53&lt;/li&gt;
&lt;li&gt;Claude Sonnet 5.5: 56&lt;/li&gt;
&lt;li&gt;Claude Opus 5.5: 58 no máximo&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A Artificial Analysis também lista a taxa de alucinação do Argon no AA-Omniscience em 15%, contra 51% para Astra em sua configuração máxima.&lt;/p&gt;

&lt;p&gt;Na &lt;a href="https://arena.ai/leaderboard/text" rel="noopener noreferrer"&gt;Arena&lt;/a&gt;, Argon ocupa o primeiro lugar em Texto com 1525 pontos, marcado como preliminar, com 4.942 votos. Opus 5.5 aparece em quarto. A Vals AI classifica o Argon em primeiro entre 41 modelos no Vals Index, sendo o primeiro modelo Gemini a liderar o índice.&lt;/p&gt;

&lt;p&gt;Também há relatos de limitações práticas. A &lt;a href="https://www.bloomberg.com/news/articles/2026-09-30/google-grapples-with-employee-skepticism-about-new-gemini-model" rel="noopener noreferrer"&gt;Bloomberg relatou&lt;/a&gt; que alguns funcionários com acesso consideraram o Argon abaixo das expectativas em determinadas tarefas de codificação e design front-end. O Google contestou essa caracterização.&lt;/p&gt;

&lt;h2&gt;
  
  
  Qual modelo escolher para rotear
&lt;/h2&gt;

&lt;p&gt;Não existe um único melhor modelo de fronteira para todas as cargas de trabalho. Use benchmarks como hipótese inicial e valide com seus prompts.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Tarefa&lt;/th&gt;
&lt;th&gt;Roteie hoje&lt;/th&gt;
&lt;th&gt;Quando Argon for lançado&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Agentes jurídicos, financeiros e de escritório&lt;/td&gt;
&lt;td&gt;Opus 5.5, 67,0% no Vals Index&lt;/td&gt;
&lt;td&gt;Teste Argon; ele lidera as quatro linhas de trabalho de conhecimento&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Agentes de codificação com uso intenso de terminal&lt;/td&gt;
&lt;td&gt;Opus 5.5, 66,4% no Terminal-bench 4.0&lt;/td&gt;
&lt;td&gt;Opus 5.5 ainda lidera&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Engenharia de software agêntica&lt;/td&gt;
&lt;td&gt;Astra, 65,5% no FrontierSWE v2, ou Opus 5.5&lt;/td&gt;
&lt;td&gt;Argon lidera DeepSWE, mas fica atrás em FrontierSWE; teste ambos&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Agentes de uso de computador e GUI&lt;/td&gt;
&lt;td&gt;Astra, 72,6% no OSWorld-2.0&lt;/td&gt;
&lt;td&gt;Astra lidera OSWorld; Argon lidera Agent’s Last Exam&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Prompts com mais de 256K tokens&lt;/td&gt;
&lt;td&gt;Opus 5.5, sem sobretaxa, ou Astra, com sobretaxa acima de 272K&lt;/td&gt;
&lt;td&gt;Argon, 84,2% no GraphWalks de 256K a 1M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Vídeo e gráficos&lt;/td&gt;
&lt;td&gt;Astra, 87,5% no LVBench&lt;/td&gt;
&lt;td&gt;Argon, 91,7%, considerando a ressalva sobre a contagem de quadros&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Engenharia científica e ML&lt;/td&gt;
&lt;td&gt;Astra no Terminal-Bench Science; Opus 5.5 no PostTrainBench&lt;/td&gt;
&lt;td&gt;Teste Argon para LABBench 2 e RiemannBench&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Respostas únicas acima de 128K tokens&lt;/td&gt;
&lt;td&gt;Opus 5.5 em Batch, 300K em beta&lt;/td&gt;
&lt;td&gt;Argon, até 1M segundo o limite declarado pelo Google&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Alto volume e sensível a custo&lt;/td&gt;
&lt;td&gt;Opus 5.5, US$ 4/US$ 20&lt;/td&gt;
&lt;td&gt;Argon a US$ 2/US$ 10 durante a promoção&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Se custo for mais importante que a pontuação máxima, veja a comparação &lt;a href="https://apidog.com/pt/blog/gpt-6-sol-vs-claude-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GPT-6 Sol vs. Claude Opus 5.5&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Compare os modelos com seus próprios prompts
&lt;/h2&gt;

&lt;p&gt;Benchmarks de fornecedores não mostram como um modelo lida com seu repositório, ferramentas, formato de saída ou regras de negócio. Monte uma avaliação reproduzível no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  1. Crie três requisições
&lt;/h3&gt;

&lt;p&gt;Adicione requisições separadas para:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;GPT-6 Astra;&lt;/li&gt;
&lt;li&gt;Claude Opus 5.5;&lt;/li&gt;
&lt;li&gt;Gemini usando uma variável de modelo.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para a requisição Gemini, use:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;{{GEMINI_MODEL}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Enquanto o Google não publicar o ID do Argon, defina:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;gemini-3.8-flash
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Consulte o &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API GPT-6 Astra&lt;/a&gt; e &lt;a href="https://apidog.com/pt/blog/what-is-claude-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Claude Opus 5.5&lt;/a&gt; para os formatos de requisição de cada fornecedor.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. Centralize variáveis de ambiente
&lt;/h3&gt;

&lt;p&gt;Armazene as chaves de API como variáveis de ambiente:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;OPENAI_API_KEY
ANTHROPIC_API_KEY
GEMINI_API_KEY
GEMINI_MODEL
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Coloque o prompt em uma variável compartilhada, por exemplo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;{{TEST_PROMPT}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Assim, todos os modelos recebem exatamente a mesma entrada.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. Adicione asserções mínimas
&lt;/h3&gt;

&lt;p&gt;Em cada requisição, valide:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;status HTTP &lt;code&gt;200&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;resposta não vazia;&lt;/li&gt;
&lt;li&gt;tokens de saída abaixo do limite esperado;&lt;/li&gt;
&lt;li&gt;custo estimado abaixo do orçamento.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Uma estrutura de critérios pode ser:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;status == 200
response.content não está vazio
output_tokens &amp;lt;= OUTPUT_TOKEN_LIMIT
estimated_cost &amp;lt;= REQUEST_BUDGET
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  4. Execute como cenário de teste
&lt;/h3&gt;

&lt;p&gt;Execute as três requisições em sequência e compare no relatório:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;resposta final;&lt;/li&gt;
&lt;li&gt;latência;&lt;/li&gt;
&lt;li&gt;tokens de entrada e saída;&lt;/li&gt;
&lt;li&gt;custo estimado;&lt;/li&gt;
&lt;li&gt;falhas de formato ou de ferramentas.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Calcule custo por solicitação
&lt;/h2&gt;

&lt;p&gt;Para 20.000 tokens de entrada e 4.000 tokens de saída:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Astra:
20.000 × US$ 10 / 1M + 4.000 × US$ 50 / 1M
= US$ 0,20 + US$ 0,20
= US$ 0,40
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;





&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Opus 5.5:
20.000 × US$ 4 / 1M + 4.000 × US$ 20 / 1M
= US$ 0,08 + US$ 0,08
= US$ 0,16
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;





&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Argon, preço introdutório:
20.000 × US$ 2 / 1M + 4.000 × US$ 10 / 1M
= US$ 0,04 + US$ 0,04
= US$ 0,08
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;





&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Argon, preço padrão:
20.000 × US$ 4 / 1M + 4.000 × US$ 20 / 1M
= US$ 0,08 + US$ 0,08
= US$ 0,16
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Preço por token não é custo por tarefa. A Artificial Analysis mediu cerca de 62K tokens de saída por tarefa para o Argon, contra aproximadamente 27K para Astra em esforço máximo. Portanto, registre os tokens de saída nas tarefas reais da sua aplicação.&lt;/p&gt;

&lt;p&gt;Quando o Argon estiver disponível, altere apenas a variável:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;GEMINI_MODEL=&amp;lt;id-publicado-do-argon&amp;gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Em seguida, execute o mesmo cenário para obter uma comparação direta com prompts idênticos.&lt;/p&gt;

&lt;h2&gt;
  
  
  Perguntas frequentes
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Gemini 4 Argon é melhor que GPT-6 Astra?
&lt;/h3&gt;

&lt;p&gt;Na Artificial Analysis, ambos empatam em 53. Na tabela do Google, Argon vence a maioria das linhas, mas Astra lidera FrontierSWE v2, Terminal-Bench Science 0.1 e OSWorld-2.0. Astra também é o modelo disponível para uso hoje.&lt;/p&gt;

&lt;h3&gt;
  
  
  Gemini 4 Argon vs. Claude Opus 5.5: qual é melhor?
&lt;/h3&gt;

&lt;p&gt;A tabela do Google favorece Argon na maioria das linhas. Opus 5.5 vence Terminal-bench 4.0 e PostTrainBench e lidera a Artificial Analysis por 58 a 53. Nas taxas padrão, Argon e Opus 5.5 têm o mesmo preço.&lt;/p&gt;

&lt;h3&gt;
  
  
  Gemini 4 Argon é mais barato que Claude Opus 5.5?
&lt;/h3&gt;

&lt;p&gt;Durante a introdução, sim: US$ 2/US$ 10 contra US$ 4/US$ 20. Após esse período, os preços de tabela são iguais. O Google não divulgou quando a promoção termina.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual modelo tem o maior limite de saída?
&lt;/h3&gt;

&lt;p&gt;Argon tem um limite declarado de 1M de tokens, embora a Vals AI liste 262K para a configuração avaliada. Astra, Opus 5.5 e Fable 5.1 limitam a saída síncrona a 128K. Veja o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-1m-output-tokens?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de 1M de tokens de saída&lt;/a&gt; para implicações no cliente.&lt;/p&gt;

&lt;h3&gt;
  
  
  Posso usar Gemini 4 Argon hoje?
&lt;/h3&gt;

&lt;p&gt;Apenas por meio do Fairwind Program do Google, voltado a um conjunto de parceiros verificados de defesa cibernética. Clientes de API pagos e assinantes do Google AI Ultra são os próximos previstos, mas não há data definida.&lt;/p&gt;

&lt;h2&gt;
  
  
  Escolha pela carga de trabalho e teste antes de padronizar
&lt;/h2&gt;

&lt;p&gt;Argon parece mais forte em trabalho de conhecimento, contexto longo e benchmarks multimodais. Astra lidera FrontierSWE, Terminal-Bench Science e OSWorld. Opus 5.5 lidera trabalho de terminal e engenharia de ML, além de ter o mesmo preço que Argon terá após o período introdutório.&lt;/p&gt;

&lt;p&gt;Implemente hoje com os modelos disponíveis, mantenha o ID Gemini em uma variável e execute novamente o mesmo cenário quando Argon for liberado. Para montar a comparação de três requisições em um único projeto, &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;baixe o Apidog&lt;/a&gt;.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Gemini 4 Argon, 1M de Tokens de Saída: O Que Uma Resposta Milionária Faz na Sua Pilha de APIs</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:59:12 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/gemini-4-argon-1m-de-tokens-de-saida-o-que-uma-resposta-milionaria-faz-na-sua-pilha-de-apis-14ee</link>
      <guid>https://dev.to/lucas_ferreira/gemini-4-argon-1m-de-tokens-de-saida-o-que-uma-resposta-milionaria-faz-na-sua-pilha-de-apis-14ee</guid>
      <description>&lt;p&gt;O número principal do Gemini 4 Argon — 1 milhão de tokens — é o limite de &lt;strong&gt;saída&lt;/strong&gt;, não a janela de contexto. Segundo o Google, uma única resposta do Argon pode atingir 1 milhão de tokens, cerca de 16 vezes o limite anterior de 64K. A janela de entrada do Argon ainda não foi publicada. Também não há um endpoint público para chamar: hoje, o Argon está disponível apenas para participantes do Fairwind Program, com clientes pagantes da API previstos para quando o Google abrir o acesso. Consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-release-date?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de data de lançamento e acesso&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Uma resposta desse tamanho quebra premissas comuns em integrações de API: a chamada pode durar minutos, o corpo não cabe com segurança na memória e o custo por requisição deixa de ser pequeno e previsível. Neste guia, você vai preparar sua aplicação para respostas longas: calcular custos, usar streaming, configurar timeouts, limitar saída, armazenar resultados e testar o fluxo no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Para uma visão geral do modelo, consulte &lt;a href="https://apidog.com/pt/blog/what-is-gemini-4-argon?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é o Gemini 4 Argon&lt;/a&gt;; para formatos de solicitação, veja o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  1M de tokens de saída não é uma janela de contexto de 1M
&lt;/h2&gt;

&lt;p&gt;Algumas páginas descrevem os 1M de tokens como janela de contexto ou como uma “janela de contexto 16 vezes maior”. Isso não corresponde ao que o Google publicou.&lt;/p&gt;

&lt;p&gt;A &lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/" rel="noopener noreferrer"&gt;publicação de lançamento&lt;/a&gt; afirma que o Argon expandiu “o limite de tokens de saída do modelo para um recorde da indústria de 1M de tokens”. A comparação com 64K corresponde ao limite de saída de 65.536 tokens do Gemini 3.1 Pro Preview.&lt;/p&gt;

&lt;p&gt;A entrada é uma especificação separada e ainda não foi divulgada. A &lt;a href="https://deepmind.google/models/evals-methodology/gemini-4-argon" rel="noopener noreferrer"&gt;metodologia de avaliação&lt;/a&gt; cita testes com prompts entre 256K e 1M de tokens, mas isso é um cenário de benchmark, não uma garantia de produto.&lt;/p&gt;

&lt;p&gt;Há também uma ressalva prática para a saída: a &lt;a href="https://www.vals.ai/models/google_gemini-4-argon" rel="noopener noreferrer"&gt;Vals AI&lt;/a&gt; lista uma saída máxima de 262K para a configuração do Argon que testou. O Google declara um limite de modelo de 1M, enquanto um avaliador externo observou um limite menor no endpoint utilizado.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Modelo&lt;/th&gt;
&lt;th&gt;Saída máxima por resposta&lt;/th&gt;
&lt;th&gt;Janela de entrada ou contexto&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Gemini 4 Argon&lt;/td&gt;
&lt;td&gt;1M (limite declarado pelo Google)&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gemini 3.1 Pro Preview&lt;/td&gt;
&lt;td&gt;65.536&lt;/td&gt;
&lt;td&gt;1.048.576&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gemini 3.8 Flash&lt;/td&gt;
&lt;td&gt;65.536&lt;/td&gt;
&lt;td&gt;1.048.576&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPT-6 Astra&lt;/td&gt;
&lt;td&gt;128.000&lt;/td&gt;
&lt;td&gt;1.050.000 (922K entrada máxima)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Claude Opus 5.5&lt;/td&gt;
&lt;td&gt;128K (300K no Batch com um cabeçalho beta)&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Os concorrentes listados limitam a saída síncrona a 128K. Portanto, o limite declarado de 1M do Argon é cerca de oito vezes maior. A justificativa do Google é permitir que o modelo gere centenas de milhares de tokens em uma única trajetória para resolver problemas complexos em uma passagem.&lt;/p&gt;

&lt;p&gt;Para comparar arquiteturas de tarefas longas, veja as &lt;a href="https://apidog.com/pt/blog/claude-opus-5-5-18-hour-tasks-api-design?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;tarefas de 18 horas do Claude Opus 5.5&lt;/a&gt; e o &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API GPT-6 Astra&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage-3.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage-3.png" alt="" width="800" height="802"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  Quanto custa uma resposta com limite máximo
&lt;/h2&gt;

&lt;p&gt;Comece pelo pior caso: a saída custa US$ 10 por 1M de tokens durante o período de introdução e US$ 20 depois.&lt;/p&gt;

&lt;p&gt;Para uma saída de 1 milhão de tokens:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Introdução:&lt;/strong&gt; &lt;code&gt;1.000.000 × US$ 10 / 1M = US$ 10,00&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Preço padrão:&lt;/strong&gt; &lt;code&gt;1.000.000 × US$ 20 / 1M = US$ 20,00&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A entrada é cobrada separadamente. Um prompt de 200.000 tokens adiciona:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Introdução:&lt;/strong&gt; &lt;code&gt;200.000 × US$ 2 / 1M = US$ 0,40&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Preço padrão:&lt;/strong&gt; &lt;code&gt;US$ 0,80&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Assim, uma chamada máxima com esse prompt pode custar:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Cenário&lt;/th&gt;
&lt;th&gt;Saída&lt;/th&gt;
&lt;th&gt;Entrada&lt;/th&gt;
&lt;th&gt;Total&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Taxa de introdução&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;td&gt;US$ 0,40&lt;/td&gt;
&lt;td&gt;US$ 10,40&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Taxa padrão&lt;/td&gt;
&lt;td&gt;US$ 20,00&lt;/td&gt;
&lt;td&gt;US$ 0,80&lt;/td&gt;
&lt;td&gt;US$ 20,80&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Um job noturno com 100 chamadas desse porte custaria US$ 1.040 nas taxas de introdução.&lt;/p&gt;

&lt;p&gt;Os tokens de pensamento tornam a estimativa menos óbvia. Nos modelos Gemini atuais, eles são cobrados como saída. O Google ainda não informou se o Argon segue a mesma regra ou se o pensamento conta para o limite de 1M. Em ambos os casos, uma resposta visível curta pode gerar uma cobrança de saída relevante.&lt;/p&gt;

&lt;p&gt;Para cenários adicionais, incluindo entrada em cache com 95% de desconto, consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de preços do Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Por que o streaming é obrigatório
&lt;/h2&gt;

&lt;p&gt;Sem streaming, o cliente não recebe bytes até que toda a geração termine. Para respostas com centenas de milhares de tokens, isso cria uma conexão silenciosa longa. Qualquer timeout de inatividade no cliente, proxy, gateway ou balanceador pode encerrar a chamada antes do primeiro byte.&lt;/p&gt;

&lt;p&gt;Use streaming.&lt;/p&gt;

&lt;p&gt;No &lt;code&gt;generateContent&lt;/code&gt;, altere o método para:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;:streamGenerateContent?alt=sse
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O Google envia eventos Server-Sent Events (SSE), com candidatos parciais em cada evento. Processe cada evento assim que ele chegar e grave o conteúdo incrementalmente. Não acumule toda a resposta em memória.&lt;/p&gt;

&lt;p&gt;O exemplo abaixo usa o Gemini 3.8 Flash como substituto, já que o Google ainda não publicou o ID do modelo Argon. Consulte também o &lt;a href="https://apidog.com/pt/blog/how-to-use-gemini-3-8-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Gemini 3.8 Flash&lt;/a&gt;.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;

&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;requests&lt;/span&gt;

&lt;span class="n"&gt;MODEL&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;environ&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gemini-3.8-flash&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;URL&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://generativelanguage.googleapis.com/v1beta/models/&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
    &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;MODEL&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="s"&gt;:streamGenerateContent?alt=sse&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="n"&gt;body&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;contents&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parts&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Write a test plan for every endpoint in a payments API.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;
                &lt;span class="p"&gt;}&lt;/span&gt;
            &lt;span class="p"&gt;]&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;generationConfig&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;maxOutputTokens&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;60000&lt;/span&gt;
    &lt;span class="p"&gt;},&lt;/span&gt;
&lt;span class="p"&gt;}&lt;/span&gt;

&lt;span class="n"&gt;usage&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="bp"&gt;None&lt;/span&gt;

&lt;span class="nf"&gt;with &lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;requests&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;post&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
        &lt;span class="n"&gt;URL&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;body&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="n"&gt;timeout&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;10&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;120&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt;
        &lt;span class="n"&gt;headers&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;x-goog-api-key&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;environ&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;GEMINI_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]},&lt;/span&gt;
    &lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;response.txt&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;a&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;encoding&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;raise_for_status&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;line&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;iter_lines&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;decode_unicode&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;line&lt;/span&gt; &lt;span class="ow"&gt;or&lt;/span&gt; &lt;span class="ow"&gt;not&lt;/span&gt; &lt;span class="n"&gt;line&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;startswith&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data:&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
            &lt;span class="k"&gt;continue&lt;/span&gt;

        &lt;span class="n"&gt;event&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;loads&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;line&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;:])&lt;/span&gt;

        &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;candidate&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;candidates&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;[]):&lt;/span&gt;
            &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;part&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;candidate&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;{}).&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parts&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;[]):&lt;/span&gt;
                &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;write&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;part&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;""&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;

        &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;flush&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
        &lt;span class="n"&gt;usage&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;usageMetadata&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Neste exemplo:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;timeout=(10, 120)&lt;/code&gt; define 10 segundos para conexão e 120 segundos para leitura.&lt;/li&gt;
&lt;li&gt;Em &lt;code&gt;requests&lt;/code&gt;, o timeout de leitura é o maior intervalo permitido &lt;strong&gt;entre bytes&lt;/strong&gt;, não a duração total da requisição.&lt;/li&gt;
&lt;li&gt;Se o servidor continuar emitindo eventos, o stream pode permanecer aberto pelo tempo necessário.&lt;/li&gt;
&lt;li&gt;Cada fragmento é persistido no disco assim que chega.&lt;/li&gt;
&lt;li&gt;No Gemini 3.8 Flash, o último evento pode incluir o &lt;code&gt;usageMetadata&lt;/code&gt; final para auditoria e cobrança.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Timeouts em cada salto
&lt;/h2&gt;

&lt;p&gt;Seu cliente HTTP é apenas um dos componentes do caminho. Um stream longo pode atravessar proxy reverso, gateway de API, balanceador de carga e execução sem servidor. Qualquer um deles pode interromper a resposta.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Salto&lt;/th&gt;
&lt;th&gt;O que verificar&lt;/th&gt;
&lt;th&gt;Sintoma quando está errado&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Cliente HTTP&lt;/td&gt;
&lt;td&gt;Timeout de leitura ou inatividade, além de timeout total da solicitação&lt;/td&gt;
&lt;td&gt;Exceções no meio do stream apenas em respostas longas&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Proxy reverso&lt;/td&gt;
&lt;td&gt;Timeout de leitura e buffer de resposta para &lt;code&gt;text/event-stream&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Eventos chegam em rajadas ou o stream é interrompido&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Gateway de API&lt;/td&gt;
&lt;td&gt;Duração máxima da solicitação&lt;/td&gt;
&lt;td&gt;Falhas no mesmo tempo decorrido em todas as execuções&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Balanceador de carga&lt;/td&gt;
&lt;td&gt;Timeout de inatividade&lt;/td&gt;
&lt;td&gt;Queda durante pausas longas antes do primeiro evento&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Função sem servidor&lt;/td&gt;
&lt;td&gt;Tempo máximo de execução&lt;/td&gt;
&lt;td&gt;A função termina enquanto o modelo ainda está escrevendo&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Procure por cortes consistentes. Se respostas longas falham sempre após o mesmo tempo, provavelmente existe um limite rígido em algum salto. Streaming não resolve um limite absoluto de duração: nesse caso, mova o trabalho para um processo assíncrono.&lt;/p&gt;

&lt;h2&gt;
  
  
  Execute trabalhos longos em segundo plano
&lt;/h2&gt;

&lt;p&gt;Para os trabalhos mais longos, não mantenha uma conexão HTTP ativa esperando a resposta completa.&lt;/p&gt;

&lt;p&gt;A &lt;a href="https://ai.google.dev/gemini-api/docs/interactions" rel="noopener noreferrer"&gt;API de Interações&lt;/a&gt; suporta execução em segundo plano para tarefas de longa duração usando:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;background=true
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Execuções em segundo plano dependem de interações armazenadas. A documentação informa que &lt;code&gt;store=false&lt;/code&gt; é incompatível com execução em segundo plano. Portanto, mantenha o armazenamento ativado para essas solicitações.&lt;/p&gt;

&lt;p&gt;Fluxo recomendado:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Crie a interação com &lt;code&gt;background=true&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Armazene o identificador retornado.&lt;/li&gt;
&lt;li&gt;Consulte o estado e recupere o resultado conforme a documentação do Google.&lt;/li&gt;
&lt;li&gt;Não presuma endpoints ou formatos de polling.&lt;/li&gt;
&lt;li&gt;Grave uso, status e resultado em armazenamento durável.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Como o Google informa que novos modelos são lançados na API de Interações, planeje trabalhos longos do Argon nesse fluxo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Limite a saída intencionalmente
&lt;/h2&gt;

&lt;p&gt;O limite de 1M é um teto, não uma meta.&lt;/p&gt;

&lt;p&gt;No &lt;code&gt;generateContent&lt;/code&gt;, use &lt;code&gt;generationConfig.maxOutputTokens&lt;/code&gt; para definir o máximo permitido por resposta:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"generationConfig"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"maxOutputTokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;60000&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;No Gemini 3.8 Flash, o pensamento conta para esse limite. Em um teste limitado a 2.000 tokens, foram retornados 1.340 tokens de pensamento e 656 tokens visíveis.&lt;/p&gt;

&lt;p&gt;Para a API de Interações, confirme o campo equivalente na documentação do Google antes de depender dele.&lt;/p&gt;

&lt;p&gt;Defina o limite a partir do custo máximo que você aceita por chamada:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Limite de saída&lt;/th&gt;
&lt;th&gt;Custo máximo de saída no preço padrão (US$ 20/1M)&lt;/th&gt;
&lt;th&gt;Introdução (US$ 10/1M)&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;64.000&lt;/td&gt;
&lt;td&gt;US$ 1,28&lt;/td&gt;
&lt;td&gt;US$ 0,64&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;128.000&lt;/td&gt;
&lt;td&gt;US$ 2,56&lt;/td&gt;
&lt;td&gt;US$ 1,28&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;500.000&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;td&gt;US$ 5,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;1.000.000&lt;/td&gt;
&lt;td&gt;US$ 20,00&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Uma resposta que atinge o limite pode estar incompleta. Verifique o &lt;code&gt;finishReason&lt;/code&gt; no evento final:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;MAX_TOKENS
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Quando esse valor aparecer:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Marque o resultado como truncado.&lt;/li&gt;
&lt;li&gt;Salve o ponto de continuação, se aplicável.&lt;/li&gt;
&lt;li&gt;Continue em uma nova chamada ou aumente o limite apenas para esse job.&lt;/li&gt;
&lt;li&gt;Evite repetir toda a geração sem necessidade.&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  Armazene e analise grandes saídas sem buffer
&lt;/h2&gt;

&lt;p&gt;Um milhão de tokens representa vários megabytes de texto. Evite que uma única resposta esgote a memória do worker.&lt;/p&gt;

&lt;p&gt;Use estas práticas:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Grave fragmentos à medida que chegam em arquivo, armazenamento de objeto ou upload multipart.&lt;/li&gt;
&lt;li&gt;Não monte uma string gigante em memória antes de persistir o resultado.&lt;/li&gt;
&lt;li&gt;Preserve o arquivo parcial se a conexão cair. Uma nova tentativa cega pode regenerar e cobrar a mesma saída.&lt;/li&gt;
&lt;li&gt;Quando precisar de estrutura, solicite JSON Lines para processar uma linha por vez.&lt;/li&gt;
&lt;li&gt;Registre &lt;code&gt;usageMetadata&lt;/code&gt;, tamanho em bytes, identificador da requisição e status, em vez de registrar corpos completos.&lt;/li&gt;
&lt;li&gt;Verifique limites de tamanho em colunas de banco, mensagens de fila e payloads de webhooks antes de aceitar respostas de 800K tokens.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Um padrão simples para persistência incremental é:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;output.txt&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;a&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;encoding&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;chunk&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;stream&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;write&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;chunk&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="n"&gt;output&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;flush&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Para JSON Lines, processe sem carregar o documento inteiro:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;

&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="nf"&gt;open&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;result.jsonl&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;encoding&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;utf-8&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;source&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;line&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;source&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="n"&gt;record&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;loads&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;line&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="nf"&gt;process&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;record&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Teste no Apidog antes que o acesso seja liberado
&lt;/h2&gt;

&lt;p&gt;Você pode validar a arquitetura antes de receber acesso ao Argon. &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; e execute três verificações.&lt;/p&gt;

&lt;h3&gt;
  
  
  1. Observe o stream
&lt;/h3&gt;

&lt;p&gt;Envie uma requisição de streaming ao Gemini 3.8 Flash usando &lt;code&gt;GEMINI_API_KEY&lt;/code&gt; e &lt;code&gt;GEMINI_MODEL&lt;/code&gt; como variáveis de ambiente.&lt;/p&gt;

&lt;p&gt;O Apidog processa respostas &lt;code&gt;text/event-stream&lt;/code&gt; e exibe os eventos em uma linha do tempo à medida que chegam. Use isso para verificar:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;tamanho dos fragmentos;&lt;/li&gt;
&lt;li&gt;intervalos entre eventos;&lt;/li&gt;
&lt;li&gt;comportamento do proxy;&lt;/li&gt;
&lt;li&gt;chegada do &lt;code&gt;usageMetadata&lt;/code&gt; final;&lt;/li&gt;
&lt;li&gt;existência de buffering inesperado.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  2. Transmita uma resposta falsa muito mais longa
&lt;/h3&gt;

&lt;p&gt;O Gemini 3.8 Flash limita a saída a 65.536 tokens. Para testar timeouts, parsers e buffers além desse limite, execute um mock SSE local no mesmo formato de evento.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="c1"&gt;# long_stream_mock.py
# SSE no formato Gemini para testes de parser e timeout com dados falsos.
&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;json&lt;/span&gt;
&lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;time&lt;/span&gt;
&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;http.server&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;BaseHTTPRequestHandler&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;ThreadingHTTPServer&lt;/span&gt;

&lt;span class="n"&gt;EVENTS&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mi"&gt;20000&lt;/span&gt;
&lt;span class="n"&gt;DELAY&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="mf"&gt;0.005&lt;/span&gt;
&lt;span class="n"&gt;CHUNK&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;lorem ipsum &lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;40&lt;/span&gt;


&lt;span class="k"&gt;class&lt;/span&gt; &lt;span class="nc"&gt;Handler&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;BaseHTTPRequestHandler&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
    &lt;span class="k"&gt;def&lt;/span&gt; &lt;span class="nf"&gt;do_POST&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
        &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;rfile&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;read&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nf"&gt;int&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;headers&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Content-Length&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;)))&lt;/span&gt;

        &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;send_response&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;200&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;send_header&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Content-Type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text/event-stream&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
        &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;end_headers&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

        &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="nf"&gt;range&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;EVENTS&lt;/span&gt;&lt;span class="p"&gt;):&lt;/span&gt;
            &lt;span class="n"&gt;event&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;candidates&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                    &lt;span class="p"&gt;{&lt;/span&gt;
                        &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parts&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
                                &lt;span class="p"&gt;{&lt;/span&gt;
                                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;text&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="n"&gt;CHUNK&lt;/span&gt;
                                &lt;span class="p"&gt;}&lt;/span&gt;
                            &lt;span class="p"&gt;]&lt;/span&gt;
                        &lt;span class="p"&gt;}&lt;/span&gt;
                    &lt;span class="p"&gt;}&lt;/span&gt;
                &lt;span class="p"&gt;]&lt;/span&gt;
            &lt;span class="p"&gt;}&lt;/span&gt;

            &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;i&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="n"&gt;EVENTS&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
                &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;usageMetadata&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;promptTokenCount&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;1200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;candidatesTokenCount&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;950000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;thoughtsTokenCount&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;40000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;totalTokenCount&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;991200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                &lt;span class="p"&gt;}&lt;/span&gt;

            &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;wfile&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;write&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
                &lt;span class="sa"&gt;f&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;data: &lt;/span&gt;&lt;span class="si"&gt;{&lt;/span&gt;&lt;span class="n"&gt;json&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;dumps&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;&lt;span class="si"&gt;}&lt;/span&gt;&lt;span class="se"&gt;\n\n&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;encode&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
            &lt;span class="p"&gt;)&lt;/span&gt;
            &lt;span class="n"&gt;self&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;wfile&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;flush&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
            &lt;span class="n"&gt;time&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;sleep&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;DELAY&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;


&lt;span class="nc"&gt;ThreadingHTTPServer&lt;/span&gt;&lt;span class="p"&gt;((&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;127.0.0.1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="mi"&gt;8787&lt;/span&gt;&lt;span class="p"&gt;),&lt;/span&gt; &lt;span class="n"&gt;Handler&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;serve_forever&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Execute o servidor:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;python long_stream_mock.py
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Depois, configure a URL base de um ambiente &lt;code&gt;mock&lt;/code&gt; para:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;http://127.0.0.1:8787
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Envie a mesma requisição de streaming pelo ambiente mock.&lt;/p&gt;

&lt;p&gt;Esse stream leva cerca de dois minutos — 128 segundos no teste citado — e transmite 9,6 milhões de caracteres. É suficiente para revelar:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;parser que acumula resposta inteira em memória;&lt;/li&gt;
&lt;li&gt;proxy que retém eventos antes de encaminhá-los;&lt;/li&gt;
&lt;li&gt;timeout curto de cliente;&lt;/li&gt;
&lt;li&gt;timeout de gateway;&lt;/li&gt;
&lt;li&gt;buffer inadequado para SSE.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  3. Afirme as contagens de tokens
&lt;/h3&gt;

&lt;p&gt;Em uma solicitação &lt;code&gt;generateContent&lt;/code&gt; sem streaming, valide o &lt;code&gt;usageMetadata&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;A regra de custo deve considerar:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;candidatesTokenCount + thoughtsTokenCount &amp;lt;= seu_limite
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Também valide que o custo calculado permanece abaixo do teto definido para o job.&lt;/p&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Argon&lt;/a&gt; inclui um script de cálculo de custo pronto para uso.&lt;/p&gt;

&lt;h2&gt;
  
  
  Perguntas frequentes
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;1M é a janela de contexto do Gemini 4 Argon?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Não. 1M é o limite de saída por resposta, acima de 64K. O Google não publicou a janela de entrada do Argon.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Quanto custa uma resposta Argon de 1M de tokens?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
US$ 10 de saída nas taxas de introdução e US$ 20 no preço padrão, além da entrada. Consulte os &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;preços do Gemini 4 Argon&lt;/a&gt; para mais cenários.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Posso gerar uma resposta de 1M de tokens hoje?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Não, exceto se sua organização estiver na coorte Fairwind com acesso ao Argon. Gemini 3.8 Flash e Gemini 3.1 Pro Preview limitam a saída a 65.536 tokens. A Vals AI lista 262K como saída máxima para a configuração do Argon que testou.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Preciso fazer streaming de respostas longas do Argon?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
O Google não publicou orientações específicas de streaming para o Argon. Porém, uma chamada sem streaming que demora minutos fica exposta a todos os timeouts de inatividade da sua infraestrutura. Use streaming ou execução em segundo plano na API de Interações.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Como o limite de saída do Argon se compara ao GPT-6 Astra e ao Claude Opus 5.5?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ambos limitam a saída síncrona a 128K. A Anthropic permite 300K no Batch com um cabeçalho beta. Os 1M declarados do Argon são cerca de oito vezes maiores.&lt;/p&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Seu próximo passo
&lt;/h2&gt;

&lt;p&gt;Adicione streaming e um limite explícito de saída ao seu cliente Gemini agora, usando o Gemini 3.8 Flash. Em seguida, execute o cliente contra o mock de stream longo até que nenhum componente da sua pilha interrompa a resposta.&lt;/p&gt;

&lt;p&gt;Quando o ID do Argon for publicado:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;atualize &lt;code&gt;GEMINI_MODEL&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;execute os mesmos testes;&lt;/li&gt;
&lt;li&gt;revise limites de custo;&lt;/li&gt;
&lt;li&gt;valide &lt;code&gt;finishReason&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;acompanhe o stream no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/li&gt;
&lt;/ol&gt;

</description>
    </item>
    <item>
      <title>O que é Gemini 4 Argon?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:57:44 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/o-que-e-gemini-4-argon-1nh7</link>
      <guid>https://dev.to/lucas_ferreira/o-que-e-gemini-4-argon-1nh7</guid>
      <description>&lt;p&gt;O Gemini 4 Argon é o novo modelo de fronteira do Google, anunciado em 30 de setembro de 2026. Hoje, ele está disponível apenas para um grupo selecionado de parceiros de defesa cibernética do Fairwind Program. O preço introdutório é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída; depois, passa para US$ 4 e US$ 20. O modelo também aumenta o limite de saída para 1 milhão de tokens por resposta. Ainda não há API pública, ID de modelo publicado ou data de lançamento geral.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Este guia separa o que o Google confirmou do que ainda não foi publicado, mostra onde o Argon se encaixa na linha Gemini e explica como preparar sua integração para trocar de modelo quando o acesso chegar. Se você está escolhendo um modelo agora, leia a &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-vs-gpt-6-astra-vs-claude-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;comparação Gemini 4 Argon vs GPT-6 Astra vs Claude Opus 5.5&lt;/a&gt;. Se você testa APIs de modelos no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, a seção prática mostra como deixar a migração pronta com a alteração de uma única variável.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que o Google confirmou versus o que não confirmou
&lt;/h2&gt;

&lt;p&gt;A cobertura inicial do Argon mistura informações oficiais com estimativas de terceiros. A tabela abaixo usa como fonte a &lt;a href="https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/" rel="noopener noreferrer"&gt;publicação de lançamento&lt;/a&gt; e a &lt;a href="https://deepmind.google/models/evals-methodology/gemini-4-argon" rel="noopener noreferrer"&gt;metodologia de avaliação&lt;/a&gt; do Google.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Item&lt;/th&gt;
&lt;th&gt;Status&lt;/th&gt;
&lt;th&gt;O que sabemos&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Anúncio&lt;/td&gt;
&lt;td&gt;Confirmado&lt;/td&gt;
&lt;td&gt;30 de setembro de 2026, por Koray Kavukcuoglu, do Google DeepMind&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Acesso hoje&lt;/td&gt;
&lt;td&gt;Confirmado&lt;/td&gt;
&lt;td&gt;Um conjunto de parceiros do Fairwind Program&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Próximos na fila&lt;/td&gt;
&lt;td&gt;Confirmado, sem data&lt;/td&gt;
&lt;td&gt;Clientes de API pagantes e assinantes do Google AI Ultra&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço&lt;/td&gt;
&lt;td&gt;Confirmado&lt;/td&gt;
&lt;td&gt;US$ 2/US$ 10 na introdução; depois US$ 4/US$ 20 por 1 milhão de tokens; entrada em cache com 95% de desconto&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limite de saída&lt;/td&gt;
&lt;td&gt;Confirmado&lt;/td&gt;
&lt;td&gt;1 milhão de tokens, acima dos 64 mil anteriores&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Benchmarks&lt;/td&gt;
&lt;td&gt;Confirmado, relatado pelo Google&lt;/td&gt;
&lt;td&gt;Uma tabela com 19 linhas e um PDF de metodologia&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ID do modelo&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;Strings encontradas online são placeholders de terceiros&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Janela de contexto de entrada&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;A avaliação de contexto longo usou prompts de até 1 milhão de tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Corte de conhecimento&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;Nada informado pelo Google&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Duração do período introdutório&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;Nenhuma data para a mudança para US$ 4/US$ 20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limites de taxa e camada gratuita&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;Nada informado pelo Google&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Data de lançamento&lt;/td&gt;
&lt;td&gt;Não publicado&lt;/td&gt;
&lt;td&gt;“Assim que possível”&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;&lt;strong&gt;Regra prática:&lt;/strong&gt; não codifique uma string de modelo, janela de contexto ou limite de velocidade baseada em sites de terceiros. Use somente valores publicados na documentação oficial do Google ou retornados pelo endpoint que você recebeu.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que é o Gemini 4 Argon e onde ele se encaixa
&lt;/h2&gt;

&lt;p&gt;O Argon é o único modelo Gemini 4 anunciado até agora e passa a ser o topo da linha do Google. A empresa o descreve como um modelo criado para sustentar raciocínio profundo em fluxos de trabalho complexos e de longo horizonte.&lt;/p&gt;

&lt;p&gt;Segundo o Google, o foco inclui:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;engenharia de software;&lt;/li&gt;
&lt;li&gt;trabalho de conhecimento empresarial, como jurídico e financeiro;&lt;/li&gt;
&lt;li&gt;defesa cibernética.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Um porta-voz do Google também disse à Reuters que o Argon é maior do que a geração anterior de modelos “Pro”.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage.png" alt="" width="800" height="802"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Até agora, o principal modelo Gemini disponível por API era o &lt;code&gt;gemini-3.1-pro-preview&lt;/code&gt;, ainda em visualização:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Recurso&lt;/th&gt;
&lt;th&gt;Gemini 3.1 Pro Preview&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Entrada&lt;/td&gt;
&lt;td&gt;1.048.576 tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Saída&lt;/td&gt;
&lt;td&gt;65.536 tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço de entrada&lt;/td&gt;
&lt;td&gt;US$ 2 por milhão, para prompts de até 200K&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço de saída&lt;/td&gt;
&lt;td&gt;US$ 12 por milhão, para prompts de até 200K&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;O preço introdutório de saída do Argon, de US$ 10 por milhão, é menor que os US$ 12 do 3.1 Pro Preview nesse cenário. Porém, o Google ainda não informou se o Argon terá uma tabela específica para prompts longos ou se outros modelos Gemini 4 serão lançados.&lt;/p&gt;

&lt;p&gt;O Google afirma já usar o Argon internamente para codificação, pesquisa e escrita. Também relata que agentes Argon liberaram mais de 300 TiB de memória da frota e que o modelo participa da migração de código C e C++ para Rust. Parte dessas reescritas, incluindo mais de 800 mil linhas para o kernel Fuchsia Zircon, permanece sob auditoria antes da produção.&lt;/p&gt;

&lt;h2&gt;
  
  
  Quem pode usar o Gemini 4 Argon hoje
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Hoje: um subconjunto de parceiros Fairwind
&lt;/h3&gt;

&lt;p&gt;O Fairwind é o programa de acesso limitado do Google para defesa cibernética, com mais de 650 parceiros. Porém, apenas “um conjunto de parceiros do Fairwind Program” recebe acesso ao Argon, diretamente ou dentro do CodeMender, o agente de segurança de código do Google.&lt;/p&gt;

&lt;p&gt;Quando acessado diretamente como modelo gerenciado no Gemini Enterprise, o Argon oferece suporte a retenção zero de dados.&lt;/p&gt;

&lt;p&gt;Para participar, os parceiros precisam se comprometer com requisitos como:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;MFA resistente a phishing;&lt;/li&gt;
&lt;li&gt;acesso restrito a equipes internas de segurança, resposta a incidentes ou testes de penetração;&lt;/li&gt;
&lt;li&gt;rastreamento de uso por funcionário.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Governos, operadores de infraestrutura crítica e plataformas de tecnologia central podem se inscrever na &lt;a href="https://deepmind.google/fairwind-program/" rel="noopener noreferrer"&gt;página do Fairwind Program&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Em seguida: clientes de API pagantes e assinantes do Google AI Ultra
&lt;/h3&gt;

&lt;p&gt;O Google informou que primeiro coletará feedback dos testadores iniciais enquanto ajusta salvaguardas. A empresa também participa do processo voluntário de acesso pré-lançamento do governo dos Estados Unidos.&lt;/p&gt;

&lt;p&gt;A seção de lançamento usa o título “Em breve”, sem uma data definida. Acompanhe as atualizações no &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-release-date?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de data de lançamento e acesso&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Ainda não: demais desenvolvedores
&lt;/h3&gt;

&lt;p&gt;Em 1º de outubro, o Argon não aparecia em:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;a href="https://ai.google.dev/gemini-api/docs/models" rel="noopener noreferrer"&gt;lista de modelos da API Gemini&lt;/a&gt;;&lt;/li&gt;
&lt;li&gt;página de preços do Google;&lt;/li&gt;
&lt;li&gt;aplicativo Gemini;&lt;/li&gt;
&lt;li&gt;Antigravity;&lt;/li&gt;
&lt;li&gt;OpenRouter.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Um plano Google AI Ultra, a partir de US$ 99,99 por mês nos Estados Unidos, é uma assinatura de consumidor, não uma chave de API. O Google também não informou qual nível do Ultra receberá o Argon primeiro.&lt;/p&gt;

&lt;p&gt;Não há rota gratuita anunciada. Veja alternativas no artigo &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;O Gemini 4 Argon é gratuito?&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preços do Gemini 4 Argon
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Tipo de token&lt;/th&gt;
&lt;th&gt;Introdução, por 1 milhão&lt;/th&gt;
&lt;th&gt;Após a introdução, por 1 milhão&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Entrada&lt;/td&gt;
&lt;td&gt;US$ 2,00&lt;/td&gt;
&lt;td&gt;US$ 4,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada em cache, com 95% de desconto&lt;/td&gt;
&lt;td&gt;US$ 0,10&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Saída&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;td&gt;US$ 20,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Uma resposta completa de 1 milhão de tokens, apenas saída&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;td&gt;US$ 20,00&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;O Google não informou a duração do período introdutório.&lt;/p&gt;

&lt;p&gt;Nas taxas padrão, o Argon custa o mesmo que o Claude Opus 5.5. Nas taxas introdutórias, iguala os preços citados para GPT-6.1 Sol e Claude Sonnet 5.5. Os valores de cache são calculados a partir da regra de desconto de 95% divulgada pelo Google.&lt;/p&gt;

&lt;p&gt;Para estimar custos por volume de requisições, consulte &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-pricing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Preços do Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Como planejar para o limite de saída de 1 milhão
&lt;/h2&gt;

&lt;p&gt;O Google afirma que expandiu o limite de saída para 1 milhão de tokens, acima dos 64 mil tokens anteriores. Isso permite trajetórias de geração muito maiores em uma única resposta.&lt;/p&gt;

&lt;p&gt;Mas não trate esse valor como janela de contexto.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;1 milhão é limite de saída&lt;/strong&gt;, não a especificação da entrada.&lt;/li&gt;
&lt;li&gt;O Google ainda não publicou a janela de contexto de entrada do Argon.&lt;/li&gt;
&lt;li&gt;A avaliação de contexto longo usou prompts de até 1 milhão de tokens, mas isso não equivale a uma especificação oficial do produto.&lt;/li&gt;
&lt;li&gt;A &lt;a href="https://www.vals.ai/models/google_gemini-4-argon" rel="noopener noreferrer"&gt;Vals AI&lt;/a&gt; lista um máximo de saída de 262 mil tokens na configuração que avaliou.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Ao integrar o modelo, use o limite retornado pelo endpoint e proteja sua aplicação contra respostas excessivamente longas:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Defina um orçamento máximo de tokens de saída por tarefa.&lt;/li&gt;
&lt;li&gt;Use streaming para tarefas com geração extensa.&lt;/li&gt;
&lt;li&gt;Configure timeouts compatíveis com respostas longas.&lt;/li&gt;
&lt;li&gt;Registre tokens de saída e tokens de pensamento.&lt;/li&gt;
&lt;li&gt;Faça o teste falhar se a resposta ultrapassar seu orçamento.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-1m-output-tokens?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia para os 1 milhão de tokens de saída do Argon&lt;/a&gt; cobre timeouts, streaming e limites de custo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Benchmarks do Gemini 4 Argon
&lt;/h2&gt;

&lt;p&gt;Todos os números abaixo vêm da tabela divulgada pelo Google. As pontuações do Argon são reportadas pelo próprio Google, incluindo resultados auto-computados e dados de placares como Vals AI. As pontuações dos concorrentes vêm principalmente dos fornecedores ou de placares públicos, e as ferramentas de teste diferem entre si.&lt;/p&gt;

&lt;p&gt;Na recontagem da tabela, o Argon lidera 13 das 19 linhas, empata em uma e fica atrás em cinco.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Benchmark&lt;/th&gt;
&lt;th&gt;Gemini 4 Argon&lt;/th&gt;
&lt;th&gt;GPT-6 Astra&lt;/th&gt;
&lt;th&gt;Claude Fable 5.1&lt;/th&gt;
&lt;th&gt;Claude Opus 5.5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Vals Index&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;68,9%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;63,1%&lt;/td&gt;
&lt;td&gt;65,8%&lt;/td&gt;
&lt;td&gt;67,0%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;DeepSWE v1.1&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;77,9%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;74,1%&lt;/td&gt;
&lt;td&gt;67,4%&lt;/td&gt;
&lt;td&gt;74,2%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GraphWalks 256K a 1M, F1&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;84,2%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;71,8%&lt;/td&gt;
&lt;td&gt;65,0%&lt;/td&gt;
&lt;td&gt;66,8%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;FrontierSWE v2&lt;/td&gt;
&lt;td&gt;55,0%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;65,5%&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;56,3%&lt;/td&gt;
&lt;td&gt;62,3%&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Terminal-bench 4.0&lt;/td&gt;
&lt;td&gt;57,4%&lt;/td&gt;
&lt;td&gt;58,2%&lt;/td&gt;
&lt;td&gt;57,9%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;66,4%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;PostTrainBench&lt;/td&gt;
&lt;td&gt;45,3%&lt;/td&gt;
&lt;td&gt;44,3%&lt;/td&gt;
&lt;td&gt;40,2%&lt;/td&gt;
&lt;td&gt;&lt;strong&gt;49,3%&lt;/strong&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;As cinco linhas em que o Argon fica atrás são:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;FrontierSWE v2;&lt;/li&gt;
&lt;li&gt;Terminal-Bench Science 0.1;&lt;/li&gt;
&lt;li&gt;OSWorld-2.0;&lt;/li&gt;
&lt;li&gt;Terminal-bench 4.0;&lt;/li&gt;
&lt;li&gt;PostTrainBench.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Avaliações de terceiros também colocam o Argon na fronteira, mas sem uma liderança universal. A &lt;a href="https://artificialanalysis.ai/models/gemini-4-argon" rel="noopener noreferrer"&gt;Artificial Analysis&lt;/a&gt; atribui 53 pontos ao modelo em seu Intelligence Index, empatado com GPT-6 Astra e Claude Fable 5.1 e abaixo de Claude Opus 5.5, com 58, e Claude Sonnet 5.5, com 56. Já a Vals classifica o Argon em primeiro entre 41 modelos no Vals Index.&lt;/p&gt;

&lt;p&gt;Confira as 19 linhas e as notas metodológicas no artigo &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-benchmarks?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Benchmarks do Gemini 4 Argon&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage-1.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fassets.apidog.com%2Fblog-next%2F2026%2F10%2Fimage-1.png" alt="" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  Defesa cibernética: o que foi divulgado
&lt;/h2&gt;

&lt;p&gt;O Google afirma que o Argon pode encontrar, validar e corrigir vulnerabilidades críticas de software de forma autônoma. Para defensores confiáveis e equipes internas, a empresa diz que lançará o Argon sem proteções cibernéticas para permitir o uso completo de suas capacidades de defesa cibernética.&lt;/p&gt;

&lt;p&gt;Na &lt;a href="https://deepmind.google/models/gemini/cyber/" rel="noopener noreferrer"&gt;página de cibernética&lt;/a&gt; do DeepMind, o Argon:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;marca 85,8% em descoberta de vulnerabilidades no mundo real;&lt;/li&gt;
&lt;li&gt;supera os 71,0% do Gemini 3.8 Flash Cyber nesse teste;&lt;/li&gt;
&lt;li&gt;empata com Grok 4.7 e GPT-6 Astra em 68% no CWE-bench v1;&lt;/li&gt;
&lt;li&gt;registra 0,7% em taxa de sucesso de ataque indireto de injeção de prompt Gray Swan em &lt;code&gt;k=15&lt;/code&gt;, a menor taxa exibida no gráfico.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para avaliar o impacto em integrações existentes, leia &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-cyber-defense?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que o lançamento cibernético do Argon significa para as APIs que você executa&lt;/a&gt; e o guia sobre seu predecessor, &lt;a href="https://apidog.com/pt/blog/what-is-gemini-3-8-flash-cyber?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Gemini 3.8 Flash Cyber&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que fazer agora como desenvolvedor
&lt;/h2&gt;

&lt;p&gt;Você ainda não pode chamar o Argon por uma API pública. A abordagem prática é construir com um modelo disponível e deixar o nome do modelo configurável.&lt;/p&gt;

&lt;p&gt;O &lt;code&gt;gemini-3.8-flash&lt;/code&gt; é o substituto indicado no momento:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;estável;&lt;/li&gt;
&lt;li&gt;1.048.576 tokens de entrada;&lt;/li&gt;
&lt;li&gt;65.536 tokens de saída;&lt;/li&gt;
&lt;li&gt;camada gratuita;&lt;/li&gt;
&lt;li&gt;US$ 0,75 por milhão de tokens de entrada;&lt;/li&gt;
&lt;li&gt;US$ 3,75 por milhão de tokens de saída até 31 de dezembro de 2026.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A &lt;a href="https://ai.google.dev/gemini-api/docs/interactions" rel="noopener noreferrer"&gt;documentação da API Interactions&lt;/a&gt; afirma que todos os novos modelos, recursos multimodais, ferramentas e recursos agentivos serão lançados nessa API. Portanto, use-a desde já.&lt;/p&gt;

&lt;h3&gt;
  
  
  1. Mantenha o modelo em uma variável de ambiente
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"gemini-3.8-flash"&lt;/span&gt;
&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;GEMINI_API_KEY&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"sua-chave"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Evite fixar o modelo diretamente no código:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# Evite isto&lt;/span&gt;
&lt;span class="nv"&gt;MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"gemini-3.8-flash"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Prefira uma configuração com fallback:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nv"&gt;MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="k"&gt;${&lt;/span&gt;&lt;span class="nv"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="k"&gt;:-&lt;/span&gt;&lt;span class="nv"&gt;gemini&lt;/span&gt;&lt;span class="p"&gt;-3.8-flash&lt;/span&gt;&lt;span class="k"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  2. Faça chamadas pela API Interactions
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nv"&gt;MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="k"&gt;${&lt;/span&gt;&lt;span class="nv"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="k"&gt;:-&lt;/span&gt;&lt;span class="nv"&gt;gemini&lt;/span&gt;&lt;span class="p"&gt;-3.8-flash&lt;/span&gt;&lt;span class="k"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;

curl &lt;span class="nt"&gt;-s&lt;/span&gt; &lt;span class="s2"&gt;"https://generativelanguage.googleapis.com/v1beta/interactions"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"x-goog-api-key: &lt;/span&gt;&lt;span class="nv"&gt;$GEMINI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "'&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$MODEL&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="s1"&gt;'",
    "input": "List the breaking changes in this OpenAPI diff.",
    "generation_config": {
      "thinking_level": "medium"
    }
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Quando o Google publicar o ID oficial do Argon e liberar seu acesso, a troca deve ser apenas:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;GEMINI_MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"ID_OFICIAL_PUBLICADO_DO_ARGON"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Não use identificadores encontrados em avaliações de terceiros: o Google ainda não publicou um ID oficial.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. Adicione limites de custo e tokens aos testes
&lt;/h3&gt;

&lt;p&gt;No &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, salve a chamada com &lt;code&gt;GEMINI_API_KEY&lt;/code&gt; e &lt;code&gt;GEMINI_MODEL&lt;/code&gt; como variáveis de ambiente.&lt;/p&gt;

&lt;p&gt;Em seguida:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;execute a requisição usando &lt;code&gt;gemini-3.8-flash&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;registre a resposta como linha de base;&lt;/li&gt;
&lt;li&gt;valide o objeto &lt;code&gt;usage&lt;/code&gt; retornado;&lt;/li&gt;
&lt;li&gt;some &lt;code&gt;total_output_tokens&lt;/code&gt; e &lt;code&gt;total_thought_tokens&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;faça o teste falhar se o total ultrapassar seu orçamento.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Isso é importante porque os tokens de pensamento são cobrados como saída. Uma validação lógica é:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;total_output_tokens + total_thought_tokens &amp;lt;= OUTPUT_TOKEN_BUDGET
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Quando o Argon aparecer na lista de modelos, execute a mesma coleção novamente e compare:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;conteúdo da resposta;&lt;/li&gt;
&lt;li&gt;latência;&lt;/li&gt;
&lt;li&gt;tokens de saída;&lt;/li&gt;
&lt;li&gt;tokens de pensamento;&lt;/li&gt;
&lt;li&gt;custo estimado;&lt;/li&gt;
&lt;li&gt;comportamento de streaming;&lt;/li&gt;
&lt;li&gt;compatibilidade com ferramentas e formatos de saída.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para detalhes de payloads e formatos, consulte o &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Gemini 4 Argon&lt;/a&gt;. Para decidir se vale esperar, leia &lt;a href="https://apidog.com/pt/blog/gemini-4-argon-vs-gemini-3-8-flash?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Argon vs Gemini 3.8 Flash&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Posso usar o Gemini 4 Argon na API Gemini?
&lt;/h3&gt;

&lt;p&gt;Ainda não. Apenas um conjunto de parceiros Fairwind possui acesso, e a lista pública de modelos não inclui o Argon.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual é o ID do modelo Gemini 4 Argon?
&lt;/h3&gt;

&lt;p&gt;O Google não publicou um ID. Strings em circulação, incluindo identificadores usados por avaliadores, são placeholders de terceiros e não devem ser codificadas fixamente.&lt;/p&gt;

&lt;h3&gt;
  
  
  Quando o Gemini 4 Argon será lançado para desenvolvedores?
&lt;/h3&gt;

&lt;p&gt;O Google não forneceu uma data. Clientes de API pagantes e assinantes do Google AI Ultra virão primeiro, “assim que possível”.&lt;/p&gt;

&lt;h3&gt;
  
  
  O Gemini 4 Argon é melhor que o GPT-6 Astra e o Claude Opus 5.5?
&lt;/h3&gt;

&lt;p&gt;Ele lidera a maioria das linhas na tabela divulgada pelo Google. Porém, empata com o GPT-6 Astra na Artificial Analysis e fica atrás do Claude Opus 5.5 nessa avaliação. Para comparar os concorrentes, veja &lt;a href="https://apidog.com/pt/blog/what-is-claude-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Claude Opus 5.5&lt;/a&gt; e o &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API GPT-6 Astra&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  O Gemini 4 Argon tem uma janela de contexto de 1 milhão de tokens?
&lt;/h3&gt;

&lt;p&gt;O Google não informou isso. O valor de 1 milhão é o limite de saída. A avaliação de contexto longo usou prompts de até 1 milhão de tokens, mas isso não é uma especificação publicada.&lt;/p&gt;

&lt;h2&gt;
  
  
  Prepare sua integração antes da abertura do Argon
&lt;/h2&gt;

&lt;p&gt;O Gemini 4 Argon foi anunciado, teve preços e benchmarks divulgados, mas ainda não está disponível para chamadas públicas.&lt;/p&gt;

&lt;p&gt;Até o lançamento:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;construa sobre o Gemini 3.8 Flash;&lt;/li&gt;
&lt;li&gt;mantenha o modelo em uma variável de ambiente;&lt;/li&gt;
&lt;li&gt;use a API Interactions;&lt;/li&gt;
&lt;li&gt;registre uma linha de base de qualidade, latência e custo;&lt;/li&gt;
&lt;li&gt;valide tokens de saída e pensamento em cada requisição;&lt;/li&gt;
&lt;li&gt;troque apenas &lt;code&gt;GEMINI_MODEL&lt;/code&gt; quando o ID oficial estiver disponível.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Comece com o &lt;a href="https://apidog.com/pt/blog/how-to-use-gemini-3-8-flash-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Gemini 3.8 Flash&lt;/a&gt; e deixe sua requisição, ambiente e testes preparados. Para configurar essa linha de base, &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;baixe o Apidog&lt;/a&gt; e crie sua coleção hoje.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Login com ChatGPT para Desenvolvedores: Fluxo OAuth, Uso do Plano e Implicações na Fatura da API</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:54:16 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/login-com-chatgpt-para-desenvolvedores-fluxo-oauth-uso-do-plano-e-implicacoes-na-fatura-da-api-56o1</link>
      <guid>https://dev.to/lucas_ferreira/login-com-chatgpt-para-desenvolvedores-fluxo-oauth-uso-do-plano-e-implicacoes-na-fatura-da-api-56o1</guid>
      <description>&lt;p&gt;O &lt;strong&gt;Sign in with ChatGPT&lt;/strong&gt; é o login OAuth 2.0 e OpenID Connect da OpenAI, disponível para usuários do ChatGPT em todo o mundo. Seu aplicativo recebe um ID de conta estável, além de nome, e-mail e foto de perfil. Desde o DevDay em 29 de setembro de 2026, usuários Plus e Pro também podem autorizar aplicativos participantes a executar solicitações de IA usando o plano ChatGPT deles, em vez da sua chave de API, dentro de um limite semanal definido por aplicativo. Seu aplicativo nunca recebe as conversas, memórias ou a chave de API do usuário.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Essa segunda opção muda a forma como sua aplicação lida com custos e limites de uso. Este guia mostra como implementar o fluxo, decidir quando usar o plano do usuário em vez da sua chave, explicar os limites na interface e testar os cenários de sucesso e falha no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Para o restante do evento, consulte o &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;resumo do DevDay 2026&lt;/a&gt;. Se a diferença entre identidade e autorização não estiver clara, leia primeiro &lt;a href="https://apidog.com/pt/blog/oauth-vs-openid?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;OAuth vs OpenID&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Login com ChatGPT em um relance
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Item&lt;/th&gt;
&lt;th&gt;O que a OpenAI documenta&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Escopos de identidade&lt;/td&gt;
&lt;td&gt;&lt;code&gt;openid profile email&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Escopos de uso do plano (fluxo de código aberto)&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;offline_access resource.invoke chatgpt.tokens.use.direct&lt;/code&gt;, com &lt;code&gt;resource=https://api.openai.com/v1&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Seu aplicativo recebe&lt;/td&gt;
&lt;td&gt;Um token de ID; com uso do plano, um token de acesso e um token de atualização&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Elegibilidade para uso do plano&lt;/td&gt;
&lt;td&gt;Plus e Pro, em aplicativos participantes&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Onde o uso é contabilizado&lt;/td&gt;
&lt;td&gt;O uso de ChatGPT Work e Codex do plano&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Controle por aplicativo&lt;/td&gt;
&lt;td&gt;Limite semanal como uma parte do uso semanal total; créditos após o limite estão desativados por padrão&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tokens de uso do plano&lt;/td&gt;
&lt;td&gt;Token de acesso 1 hora; token de atualização 30 dias, substituído a cada atualização&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Acesso do desenvolvedor&lt;/td&gt;
&lt;td&gt;Aplicativos comerciais: teste limitado via formulário de interesse. Aplicativos de código aberto: autoatendimento&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Fontes: &lt;a href="https://developers.openai.com/siwc" rel="noopener noreferrer"&gt;documentação do Sign in with ChatGPT&lt;/a&gt;, &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source/token-reference" rel="noopener noreferrer"&gt;referência de tokens&lt;/a&gt; e o artigo de ajuda da OpenAI sobre &lt;a href="https://help.openai.com/en/articles/20001542-using-your-chatgpt-plan-in-other-apps-and-sites" rel="noopener noreferrer"&gt;como usar seu plano ChatGPT em outros aplicativos&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que seu aplicativo recebe — e o que ele não recebe
&lt;/h2&gt;

&lt;p&gt;A identidade é o comportamento padrão. Um cliente que solicita &lt;code&gt;openid profile email&lt;/code&gt; recebe um token de ID. Conforme o &lt;a href="https://developers.openai.com/siwc/website" rel="noopener noreferrer"&gt;guia para sites&lt;/a&gt;:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;profile&lt;/code&gt; pode incluir reivindicações como nome e foto de perfil.&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;email&lt;/code&gt; pode incluir e-mail e status de verificação.&lt;/li&gt;
&lt;li&gt;Os escopos de identidade &lt;strong&gt;não&lt;/strong&gt; concedem acesso a conversas do ChatGPT nem a recursos da API OpenAI.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Use o &lt;code&gt;sub&lt;/code&gt; validado, combinado com o emissor e o ID do cliente, como identificador da conta local. Não use o e-mail como chave de vínculo de conta. A OpenAI alerta que uma correspondência de e-mail isolada não prova propriedade; para contas existentes, peça que o usuário confirme o vínculo.&lt;/p&gt;

&lt;p&gt;O uso do plano é uma autorização independente. Quando o usuário concede os escopos adicionais, a resposta de token inclui um token de acesso para solicitações elegíveis à API de Respostas.&lt;/p&gt;

&lt;p&gt;Para um cliente que usa apenas identidade:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Artefato necessário: id_token
Artefato não necessário: access_token
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Como implementar o fluxo OAuth
&lt;/h2&gt;

&lt;p&gt;O fluxo para sites é o padrão &lt;a href="https://apidog.com/pt/blog/oauth-2-flows?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Authorization Code grant com PKCE&lt;/a&gt;, combinado com OIDC.&lt;/p&gt;

&lt;p&gt;Primeiro, carregue a configuração de descoberta:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://auth.openai.com/.well-known/openid-configuration
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;A documentação lista estes endpoints de produção:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Emissor:                  https://auth.openai.com
Endpoint de autorização:  https://auth.openai.com/api/accounts/authorize
Endpoint de token:        https://auth.openai.com/api/accounts/oauth/token
URI JWKS:                 https://auth.openai.com/.well-known/jwks.json
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Passo a passo
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;Gere no backend um &lt;code&gt;state&lt;/code&gt; novo, um &lt;code&gt;nonce&lt;/code&gt; e um verificador PKCE.&lt;/li&gt;
&lt;li&gt;Gere o desafio PKCE usando &lt;code&gt;S256&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Redirecione o navegador para o endpoint de autorização.&lt;/li&gt;
&lt;li&gt;Envie o ID do cliente, a URI de redirecionamento exata, os escopos, &lt;code&gt;state&lt;/code&gt;, &lt;code&gt;nonce&lt;/code&gt; e o desafio PKCE.&lt;/li&gt;
&lt;li&gt;Receba o código de autorização no callback.&lt;/li&gt;
&lt;li&gt;Valide o &lt;code&gt;state&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Troque o código por tokens usando o verificador PKCE.&lt;/li&gt;
&lt;li&gt;Valide o token de ID: assinatura, emissor, audiência, expiração e &lt;code&gt;nonce&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Crie, encontre ou vincule a conta local.&lt;/li&gt;
&lt;li&gt;Emita a sessão da sua própria aplicação.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Clientes públicos não enviam segredo de cliente.&lt;/p&gt;

&lt;p&gt;Um cliente confidencial que usa &lt;code&gt;client_secret_basic&lt;/code&gt; deve enviar o segredo somente no cabeçalho HTTP Basic.&lt;/p&gt;

&lt;h3&gt;
  
  
  Fluxo para ferramentas de código aberto
&lt;/h3&gt;

&lt;p&gt;Ferramentas de código aberto usam um registro diferente. O &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source/sign-in" rel="noopener noreferrer"&gt;guia de login de código aberto&lt;/a&gt; começa com:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;client_id=dynamic_agent_client
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Inclua também:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;agent_name_hint&lt;/code&gt;: o nome do seu aplicativo.&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;ext_agent_host_id&lt;/code&gt;: um identificador persistente por host.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Após o callback, salve e reutilize o ID de cliente emitido, como &lt;code&gt;oaiapp_...&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Nesse fluxo:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O redirecionamento usa uma URI de loopback em &lt;code&gt;127.0.0.1&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Não há segredo de cliente.&lt;/li&gt;
&lt;li&gt;O ID de cliente emitido deve ser persistido para os próximos logins.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Como o uso do plano aparece para o usuário
&lt;/h2&gt;

&lt;p&gt;Sua interface e documentação de suporte devem deixar estes pontos explícitos:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Solicitações elegíveis consomem o plano do usuário.&lt;/strong&gt; O uso é contabilizado no uso de ChatGPT Work e Codex do plano Plus ou Pro.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Cada aplicativo tem um limite semanal.&lt;/strong&gt; O usuário define uma porcentagem do uso semanal total. O exemplo da documentação varia de 10% a 100%.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;O limite não reserva capacidade.&lt;/strong&gt; Se o usuário consumir o plano intensamente em outro aplicativo, o limite disponível pode acabar antes.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Créditos são opcionais.&lt;/strong&gt; O uso de créditos após os limites fica desativado por padrão e exige que o limite do aplicativo esteja em 100%.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;O Plus tem uma janela compartilhada de cinco horas.&lt;/strong&gt; Segundo a &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source/profiles-and-sessions" rel="noopener noreferrer"&gt;página de contas e sessões&lt;/a&gt;, ela cobre todos os aplicativos que usam o plano. Isso não se aplica ao Pro.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Desconectar interrompe o uso futuro.&lt;/strong&gt; O consumo anterior não é revertido. A OpenAI não notifica seu aplicativo; você detecta a desconexão quando uma chamada ou atualização de token falha.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Os usuários gerenciam esses controles em Configurações do ChatGPT, Uso:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;chatgpt.com/settings/usage
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;As &lt;a href="https://developers.openai.com/siwc/ui-ux-guidelines" rel="noopener noreferrer"&gt;diretrizes de UI da OpenAI&lt;/a&gt; pedem um link com o texto &lt;strong&gt;Gerenciar uso&lt;/strong&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Quem pode integrar e como obter um ID de cliente
&lt;/h2&gt;

&lt;p&gt;O &lt;a href="https://openai.com/index/devday-2026-recap/" rel="noopener noreferrer"&gt;resumo do DevDay&lt;/a&gt; da OpenAI cita 16 parceiros de uso de plano, incluindo Devin da Cognition, Notion, Vercel, T3, OpenClaw e Dactyl. O &lt;a href="https://thenewstack.io/sign-in-with-chatgpt/" rel="noopener noreferrer"&gt;The New Stack&lt;/a&gt; também lista Amp, Warp, Kilo Code e OpenCode, com Lovable marcado como em breve. Se você executa &lt;a href="https://apidog.com/pt/blog/openclaw-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;OpenClaw&lt;/a&gt;, ele aparece nas duas listas.&lt;/p&gt;

&lt;p&gt;Conforme relatado pelo The New Stack, Sam Altman afirmou no palco: “agora você não precisa cobrir os custos de token deles para colocá-los em funcionamento.”&lt;/p&gt;

&lt;p&gt;O caminho depende do tipo de aplicação:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Aplicativos comerciais ou hospedados:&lt;/strong&gt; o login está em teste limitado. Solicite um ID de cliente pelo &lt;a href="https://developers.openai.com/siwc/request-client-id" rel="noopener noreferrer"&gt;formulário de interesse da OpenAI&lt;/a&gt;, tanto para identidade quanto para uso do plano.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ferramentas de código aberto hospedadas localmente:&lt;/strong&gt; o uso do plano está disponível para parceiros de código aberto pelo fluxo de autoatendimento.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  O que muda na sua fatura da API
&lt;/h2&gt;

&lt;p&gt;Com sua própria chave de API, você paga por token e recupera esse custo por meio do seu preço. Com o plano ChatGPT do usuário, o custo do modelo passa para a assinatura dele.&lt;/p&gt;

&lt;p&gt;Isso reduz a dependência da sua margem em relação ao volume de uso de IA, mas também reduz seu controle sobre limites e disponibilidade.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Sua chave de API&lt;/th&gt;
&lt;th&gt;O plano ChatGPT do usuário&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Quem paga&lt;/td&gt;
&lt;td&gt;Você, por token&lt;/td&gt;
&lt;td&gt;O plano do usuário (créditos somente se ele optar por isso)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Quem pode usar&lt;/td&gt;
&lt;td&gt;Todo usuário&lt;/td&gt;
&lt;td&gt;Usuários Plus e Pro que concedem &lt;code&gt;chatgpt.tokens.use.direct&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limites&lt;/td&gt;
&lt;td&gt;Seu nível de limite de taxa&lt;/td&gt;
&lt;td&gt;Uso semanal do plano, o limite por aplicativo, a janela de cinco horas do Plus&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Formato da solicitação&lt;/td&gt;
&lt;td&gt;A API de Respostas completa&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;store: false&lt;/code&gt; e &lt;code&gt;stream: true&lt;/code&gt; são obrigatórios; sem &lt;code&gt;temperature&lt;/code&gt;, &lt;code&gt;max_output_tokens&lt;/code&gt;, pesquisa de arquivo ou Code Interpreter&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Falha típica&lt;/td&gt;
&lt;td&gt;429 quando você excede seu nível&lt;/td&gt;
&lt;td&gt;429 &lt;code&gt;subscription_sharing_usage_limit_exceeded&lt;/code&gt;, ou esse código em um &lt;code&gt;response.failed&lt;/code&gt; no meio do fluxo&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Alternativa&lt;/td&gt;
&lt;td&gt;Sua para projetar&lt;/td&gt;
&lt;td&gt;Nenhuma automática: a OpenAI não troca a cobrança&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;O que mostrar&lt;/td&gt;
&lt;td&gt;Seu próprio uso e preços&lt;/td&gt;
&lt;td&gt;"Usando plano ChatGPT", um link para Gerenciar uso, quais de seus planos o suportam&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;As restrições estão na &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source/preview-limitations" rel="noopener noreferrer"&gt;página de limitações da prévia&lt;/a&gt;: recursos que exigem estado de conversação armazenado ou ferramentas hospedadas não são executados no plano do usuário.&lt;/p&gt;

&lt;p&gt;Um desenho prático é híbrido:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Use o plano ChatGPT para trabalho interativo de usuários Plus e Pro.&lt;/li&gt;
&lt;li&gt;Use sua chave de API para usuários não elegíveis.&lt;/li&gt;
&lt;li&gt;Use sua chave para tarefas em segundo plano, CI e agentes agendados.&lt;/li&gt;
&lt;li&gt;Quando o usuário atingir o limite, exiba &lt;strong&gt;Gerenciar uso&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Se fizer sentido para o seu produto, ofereça seus próprios créditos como alternativa secundária.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Veja também a comparação entre &lt;a href="https://apidog.com/pt/blog/api-key-vs-oauth?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;chave de API vs OAuth&lt;/a&gt; e o guia de &lt;a href="https://apidog.com/pt/blog/ai-agent-oauth-on-behalf-of-user?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;OAuth para agentes de IA&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Como testar login e falhas no Apidog
&lt;/h2&gt;

&lt;p&gt;O Apidog não autentica alguém diretamente no ChatGPT. Ele ajuda a exercitar sua configuração OAuth, trocas de token e tratamento de erros.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; e crie um ambiente para o fluxo.&lt;/p&gt;

&lt;h3&gt;
  
  
  1. Armazene dados do cliente como variáveis
&lt;/h3&gt;

&lt;p&gt;Crie as variáveis:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;SIWC_CLIENT_ID
SIWC_REDIRECT_URI
SIWC_CLIENT_SECRET
ACCESS_TOKEN
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Use &lt;code&gt;SIWC_CLIENT_SECRET&lt;/code&gt; apenas para clientes confidenciais e marque-o como valor sensível.&lt;/p&gt;

&lt;p&gt;Referencie variáveis em requests salvas:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;{{SIWC_CLIENT_ID}}
{{SIWC_REDIRECT_URI}}
{{ACCESS_TOKEN}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Assim, segredos não ficam registrados diretamente nas requisições.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. Execute o Authorization Code com PKCE
&lt;/h3&gt;

&lt;p&gt;Na aba &lt;strong&gt;Auth&lt;/strong&gt; do Apidog:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Selecione OAuth 2.0.&lt;/li&gt;
&lt;li&gt;Escolha &lt;strong&gt;Authorization Code com PKCE&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Informe os endpoints de autorização e token.&lt;/li&gt;
&lt;li&gt;Configure o escopo inicial:
&lt;/li&gt;
&lt;/ol&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;openid profile email
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;ol&gt;
&lt;li&gt;Use uma URL de callback registrada para o seu cliente.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/test-oauth-2-apis-apidog?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de OAuth 2.0 do Apidog&lt;/a&gt; detalha os campos dessa configuração.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. Valide a resposta da troca de token
&lt;/h3&gt;

&lt;p&gt;Salve a troca de token como um &lt;code&gt;POST&lt;/code&gt; próprio para o endpoint de token. Envie código, verificador PKCE, URI de redirecionamento e ID de cliente.&lt;/p&gt;

&lt;p&gt;Adicione um pós-processador para validar a estrutura básica da resposta:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;body&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;();&lt;/span&gt;

&lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;test&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;token exchange returned an ID token&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;()&lt;/span&gt; &lt;span class="o"&gt;=&amp;gt;&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;code&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;eql&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;200&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;body&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;id_token&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;be&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;a&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;string&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;decode&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nf"&gt;require&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;atob&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;part&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;body&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;id_token&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;split&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;.&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)[&lt;/span&gt;&lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="nf"&gt;replace&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sr"&gt;/-/g&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;+&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nf"&gt;replace&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sr"&gt;/_/g&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;/&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;claims&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;JSON&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;parse&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
  &lt;span class="nf"&gt;decode&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;part&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;=&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;repeat&lt;/span&gt;&lt;span class="p"&gt;((&lt;/span&gt;&lt;span class="mi"&gt;4&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;part&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;length&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt; &lt;span class="o"&gt;%&lt;/span&gt; &lt;span class="mi"&gt;4&lt;/span&gt;&lt;span class="p"&gt;))&lt;/span&gt;
&lt;span class="p"&gt;);&lt;/span&gt;

&lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;test&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;ID token claims match this client&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;()&lt;/span&gt; &lt;span class="o"&gt;=&amp;gt;&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;claims&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;iss&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;eql&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;https://auth.openai.com&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;claims&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;aud&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;include&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;environment&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;SIWC_CLIENT_ID&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;));&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;claims&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;sub&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;be&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;a&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;string&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;and&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;not&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;empty&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;claims&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;exp&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;1000&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;be&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;above&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nb"&gt;Date&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;now&lt;/span&gt;&lt;span class="p"&gt;());&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;A validação de assinatura e &lt;code&gt;nonce&lt;/code&gt; continua sendo responsabilidade do backend.&lt;/p&gt;

&lt;p&gt;Em vez de exigir &lt;code&gt;name&lt;/code&gt;, &lt;code&gt;email&lt;/code&gt; e &lt;code&gt;picture&lt;/code&gt;, registre essas reivindicações quando estiverem disponíveis.&lt;/p&gt;

&lt;p&gt;Para uso do plano, valide também o escopo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;test&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;plan usage scope was granted&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="p"&gt;()&lt;/span&gt; &lt;span class="o"&gt;=&amp;gt;&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
  &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;expect&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;body&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;scope&lt;/span&gt;&lt;span class="p"&gt;).&lt;/span&gt;&lt;span class="nx"&gt;to&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;include&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;chatgpt.tokens.use.direct&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  4. Simule os caminhos de falha
&lt;/h3&gt;

&lt;p&gt;Uma conta Plus real não é adequada para testes repetíveis. Use um servidor mock no Apidog para cobrir os cenários abaixo.&lt;/p&gt;

&lt;h4&gt;
  
  
  Uso do plano recusado
&lt;/h4&gt;

&lt;p&gt;Retorne uma resposta de token cujo &lt;code&gt;scope&lt;/code&gt; não inclua:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;chatgpt.tokens.use.direct
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Comportamento esperado:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Manter o login do usuário.&lt;/li&gt;
&lt;li&gt;Oferecer a ativação do uso do plano.&lt;/li&gt;
&lt;li&gt;Ou seguir para outro caminho de faturamento.&lt;/li&gt;
&lt;/ul&gt;

&lt;h4&gt;
  
  
  Limite de uso atingido
&lt;/h4&gt;

&lt;p&gt;Retorne HTTP &lt;code&gt;429&lt;/code&gt; com:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;error.code: subscription_sharing_usage_limit_exceeded
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Teste também o mesmo código dentro de um evento de streaming:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;response.failed
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Comportamento esperado:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Parar solicitações que usam o plano.&lt;/li&gt;
&lt;li&gt;Exibir o link &lt;strong&gt;Gerenciar uso&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Não fazer repetição automática em loop.&lt;/li&gt;
&lt;/ul&gt;

&lt;h4&gt;
  
  
  Usuário não elegível
&lt;/h4&gt;

&lt;p&gt;Retorne:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;403 subscription_sharing_user_not_eligible
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Comportamento esperado:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Não tentar novamente.&lt;/li&gt;
&lt;li&gt;Não reiniciar o OAuth automaticamente.&lt;/li&gt;
&lt;li&gt;Oferecer o caminho alternativo da sua aplicação.&lt;/li&gt;
&lt;/ul&gt;

&lt;h4&gt;
  
  
  Usuário desconectado
&lt;/h4&gt;

&lt;p&gt;Simule uma atualização de token com:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;invalid_grant
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Ou uma chamada com:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;401 subscription_sharing_invalid_user
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Comportamento esperado:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Limpar os tokens locais.&lt;/li&gt;
&lt;li&gt;Encerrar a associação de uso do plano.&lt;/li&gt;
&lt;li&gt;Solicitar login novamente.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Encadeie esses casos em um cenário de teste e execute-o no CI com o Apidog CLI. A &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source/errors-and-recovery" rel="noopener noreferrer"&gt;página de erros e recuperação&lt;/a&gt; lista todos os erros documentados.&lt;/p&gt;

&lt;h3&gt;
  
  
  5. Verifique uma chamada real de streaming
&lt;/h3&gt;

&lt;p&gt;Com um token de plano real, envie uma chamada à API de Respostas usando:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Authorization: Bearer {{ACCESS_TOKEN}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;A solicitação deve usar &lt;code&gt;store: false&lt;/code&gt; e &lt;code&gt;stream: true&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl &lt;span class="nt"&gt;--no-buffer&lt;/span&gt; https://api.openai.com/v1/responses &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="k"&gt;${&lt;/span&gt;&lt;span class="nv"&gt;ACCESS_TOKEN&lt;/span&gt;&lt;span class="k"&gt;}&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gpt-6.1-sol",
    "input": [{"role": "user", "content": "Say exactly: Hello, world!"}],
    "store": false,
    "stream": true
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Considere sucesso somente quando o fluxo terminar com:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;response.completed
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Usuários gratuitos podem fazer login com o ChatGPT?
&lt;/h3&gt;

&lt;p&gt;Sim. O login está disponível globalmente para usuários do ChatGPT. Usar o plano dentro de outro aplicativo exige Plus ou Pro.&lt;/p&gt;

&lt;h3&gt;
  
  
  Meu aplicativo recebe a chave de API OpenAI do usuário?
&lt;/h3&gt;

&lt;p&gt;Não. Seu aplicativo recebe um token de ID e, quando o uso do plano é autorizado, um token de acesso OAuth para solicitações elegíveis à API de Respostas.&lt;/p&gt;

&lt;h3&gt;
  
  
  O que acontece quando o usuário atinge o limite?
&lt;/h3&gt;

&lt;p&gt;As solicitações falham com &lt;code&gt;subscription_sharing_usage_limit_exceeded&lt;/code&gt;, seja como HTTP &lt;code&gt;429&lt;/code&gt; ou como evento &lt;code&gt;response.failed&lt;/code&gt; durante o streaming. Pause o uso do plano e direcione o usuário para &lt;strong&gt;Gerenciar uso&lt;/strong&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Um usuário Plus pode executar o GPT-6.1 Sol em um aplicativo parceiro?
&lt;/h3&gt;

&lt;p&gt;O exemplo da documentação usa &lt;code&gt;gpt-6.1-sol&lt;/code&gt; com um token de plano, mas liste os modelos disponíveis para a conta com esse token antes de oferecer essa opção. Veja mais em &lt;a href="https://apidog.com/pt/blog/gpt-6-1-sol-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o GPT-6.1 Sol é gratuito&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;p&gt;Se você opera um aplicativo comercial, entre na lista de espera e implemente agora os mocks para limite, desconexão e não elegibilidade.&lt;/p&gt;

&lt;p&gt;Trate o uso do plano como uma opção ao lado da sua própria cobrança de API, não como substituição automática. Salve as validações de token e o cenário de falha no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Quando seu ID de cliente chegar, a única variável nova deverá ser o token real.&lt;/p&gt;

</description>
      <category>api</category>
      <category>chatgpt</category>
      <category>openai</category>
      <category>programming</category>
    </item>
    <item>
      <title>Codex pós DevDay 2026: Tarefas na Nuvem, CLI por Voz, Agentes, Revisão de Código e Segurança na Nuvem</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:53:16 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/codex-pos-devday-2026-tarefas-na-nuvem-cli-por-voz-agentes-revisao-de-codigo-e-seguranca-na-15kn</link>
      <guid>https://dev.to/lucas_ferreira/codex-pos-devday-2026-tarefas-na-nuvem-cli-por-voz-agentes-revisao-de-codigo-e-seguranca-na-15kn</guid>
      <description>&lt;p&gt;No OpenAI DevDay 2026, em 29 de setembro, o Codex recebeu quatro atualizações: Codex cloud com ambientes reutilizáveis (Plus, Pro, Business, Healthcare, Edu e Enterprise); uma CLI atualizada com voz, visualização &lt;code&gt;/agents&lt;/code&gt;, edição de prompts, retomar sessões e worktrees (todos os planos); Code Review no aplicativo de desktop do ChatGPT para PRs do GitHub e MRs do GitLab, com revisões automáticas na nuvem (todos os planos); e Codex Security Cloud para verificações agendadas de repositórios e preparação de correções (Pro, Business, Enterprise e Edu). No mesmo dia, a CLI do Codex 0.159.1 tornou o GPT-6.1 Sol o modelo padrão.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Este guia mostra o que cada mudança faz, quais comandos usar e onde estão as lacunas. Para o restante do evento, consulte o &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;hub do DevDay 2026 para desenvolvedores de API&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Há uma lacuna importante para equipes de API: o Codex escreve e revisa código, mas suas revisões não chamam sua API em execução. É aqui que entram os testes de contrato no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. A última seção mostra como incluí-los no CI.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que mudou no Codex no DevDay 2026
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Atualização&lt;/th&gt;
&lt;th&gt;O que faz&lt;/th&gt;
&lt;th&gt;Onde você usa&lt;/th&gt;
&lt;th&gt;Planos&lt;/th&gt;
&lt;th&gt;Status&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Ambientes na nuvem do Codex&lt;/td&gt;
&lt;td&gt;Prepare uma configuração uma vez e reutilize-a em workspaces isolados&lt;/td&gt;
&lt;td&gt;Web, aplicativo de desktop, &lt;code&gt;codex cloud&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Plus, Pro, Business, Healthcare, Edu, Enterprise&lt;/td&gt;
&lt;td&gt;Disponível&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;CLI do Codex atualizada&lt;/td&gt;
&lt;td&gt;Voz, visualização &lt;code&gt;/agents&lt;/code&gt;, edição de prompt, retomar, worktrees&lt;/td&gt;
&lt;td&gt;Terminal&lt;/td&gt;
&lt;td&gt;Todos os planos&lt;/td&gt;
&lt;td&gt;Disponível&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Code Review&lt;/td&gt;
&lt;td&gt;Painel de revisão de PR e MR, revisões automáticas na nuvem&lt;/td&gt;
&lt;td&gt;Aplicativo de desktop do ChatGPT, GitHub, GitLab&lt;/td&gt;
&lt;td&gt;Todos os planos&lt;/td&gt;
&lt;td&gt;GitHub GA; MRs do GitLab em prévia&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Codex Security Cloud&lt;/td&gt;
&lt;td&gt;Verificações agendadas, descobertas deduplicadas, preparação de correções&lt;/td&gt;
&lt;td&gt;Codex cloud, via plugin&lt;/td&gt;
&lt;td&gt;Pro, Business, Enterprise, Edu&lt;/td&gt;
&lt;td&gt;Prévia de pesquisa&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPT-6.1 Sol como padrão&lt;/td&gt;
&lt;td&gt;Modelo padrão no catálogo incluído na CLI&lt;/td&gt;
&lt;td&gt;CLI, Codex e ChatGPT Work&lt;/td&gt;
&lt;td&gt;Plus, Pro, Business, Enterprise, Edu; habilitado por administrador em Enterprise e Edu&lt;/td&gt;
&lt;td&gt;Disponível&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Fontes: &lt;a href="https://openai.com/index/devday-2026-recap/" rel="noopener noreferrer"&gt;resumo do DevDay 2026&lt;/a&gt; da OpenAI, &lt;a href="https://learn.chatgpt.com/docs/whats-new" rel="noopener noreferrer"&gt;página de novidades do Codex&lt;/a&gt; e a documentação do Codex linkada nas seções abaixo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Codex cloud: ambientes reutilizáveis
&lt;/h2&gt;

&lt;p&gt;O Codex cloud executa tarefas de codificação na nuvem para que o trabalho continue enquanto seu computador está parado. A principal mudança do DevDay é o modelo de ambiente.&lt;/p&gt;

&lt;p&gt;Segundo a &lt;a href="https://learn.chatgpt.com/docs/environments/cloud-environments" rel="noopener noreferrer"&gt;documentação de ambientes na nuvem&lt;/a&gt;, um ambiente é uma configuração reutilizável compartilhada pelas tarefas:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;repositórios;&lt;/li&gt;
&lt;li&gt;dependências;&lt;/li&gt;
&lt;li&gt;ferramentas;&lt;/li&gt;
&lt;li&gt;configurações de acesso.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Cada nova tarefa recebe seu próprio workspace isolado, criado a partir da versão publicada do ambiente.&lt;/p&gt;

&lt;h3&gt;
  
  
  Criar um ambiente reutilizável
&lt;/h3&gt;

&lt;ol&gt;
&lt;li&gt;Em uma nova tarefa, selecione &lt;strong&gt;Trabalhar em &amp;gt; Nuvem&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Clique em &lt;strong&gt;Criar ambiente&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Selecione os repositórios GitHub que o Codex deve verificar.&lt;/li&gt;
&lt;li&gt;Permita que o Codex inspecione o projeto, instale dependências e teste o fluxo de trabalho.&lt;/li&gt;
&lt;li&gt;Responda às perguntas sobre configurações que ele não conseguir inferir.&lt;/li&gt;
&lt;li&gt;Revise o relatório gerado.&lt;/li&gt;
&lt;li&gt;Selecione &lt;strong&gt;Publicar&lt;/strong&gt;.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Ao publicar, o Codex registra o que funcionou em dois componentes:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;um script de instalação;&lt;/li&gt;
&lt;li&gt;uma habilidade de inicialização que sobe os serviços e verifica se estão prontos.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Configurações que merecem atenção
&lt;/h3&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Atualização de repositório:&lt;/strong&gt; é executada em segundo plano e mantém caches de dependências. Isso evita reinstalar tudo em cada tarefa.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Acesso à Internet:&lt;/strong&gt; é configurado por ambiente. Você pode usar um preset de gerenciador de pacotes, liberar domínios específicos ou usar acesso irrestrito.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Segredos de rede:&lt;/strong&gt; mantêm credenciais fora do sandbox. O código recebe um placeholder, enquanto um proxy substitui o valor real apenas para destinos HTTPS permitidos.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Se uma tarefa precisar chamar uma API de staging, adicione o host à lista de domínios permitidos e armazene o token como segredo de rede. Não use uma variável de ambiente simples para esse caso.&lt;/p&gt;

&lt;p&gt;No terminal, use &lt;code&gt;codex cloud&lt;/code&gt; para enviar trabalho à nuvem e listar chats recentes:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;codex cloud
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  A CLI do Codex atualizada
&lt;/h2&gt;

&lt;p&gt;Instale a CLI com o script da &lt;a href="https://learn.chatgpt.com/docs/codex/cli" rel="noopener noreferrer"&gt;documentação da CLI do Codex&lt;/a&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl &lt;span class="nt"&gt;-fsSL&lt;/span&gt; https://chatgpt.com/codex/install.sh | sh
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O &lt;a href="https://learn.chatgpt.com/docs/changelog" rel="noopener noreferrer"&gt;changelog do Codex&lt;/a&gt; também lista a instalação via npm:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;npm &lt;span class="nb"&gt;install&lt;/span&gt; &lt;span class="nt"&gt;-g&lt;/span&gt; @openai/codex
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;A versão 0.159.1, lançada em 29 de setembro, adicionou o GPT-6.1 Sol como modelo padrão no catálogo empacotado. A documentação da CLI usa &lt;code&gt;gpt-6.1-sol medium&lt;/code&gt; como exemplo de sessão.&lt;/p&gt;

&lt;p&gt;Segundo a &lt;a href="https://learn.chatgpt.com/docs/models" rel="noopener noreferrer"&gt;página de modelos do Codex&lt;/a&gt;:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Free e Go não estão incluídos no lançamento;&lt;/li&gt;
&lt;li&gt;Enterprise e Edu recebem o modelo apenas depois que um administrador o habilita.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para trocar de modelo durante uma sessão:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;/model
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Ou inicie a CLI com um modelo específico:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;codex &lt;span class="nt"&gt;--model&lt;/span&gt; gpt-6-sol
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Para entender as diferenças em relação ao GPT-6 Sol, incluindo a ausência do esforço &lt;code&gt;none&lt;/code&gt;, consulte &lt;a href="https://apidog.com/pt/blog/what-is-gpt-6-1-sol?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;O que é GPT-6.1 Sol?&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Comandos práticos da CLI
&lt;/h3&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Recurso&lt;/th&gt;
&lt;th&gt;Como usar&lt;/th&gt;
&lt;th&gt;Fonte&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Voz&lt;/td&gt;
&lt;td&gt;Ativada por padrão desde 0.156.0; &lt;code&gt;F8&lt;/code&gt; alterna o recurso e &lt;code&gt;/voice settings&lt;/code&gt; escolhe uma voz&lt;/td&gt;
&lt;td&gt;Changelog&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Visualização &lt;code&gt;/agents&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Mostra uma visão geral dos agentes; permite filtrar tarefas por status e iniciar sessões worktree&lt;/td&gt;
&lt;td&gt;Recapitulação, changelog&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Edição de prompt&lt;/td&gt;
&lt;td&gt;Edite um prompt anterior para reverter o thread àquele ponto&lt;/td&gt;
&lt;td&gt;Changelog&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Retomar&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;codex resume&lt;/code&gt; retorna a um chat salvo&lt;/td&gt;
&lt;td&gt;Docs da CLI&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Worktrees&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;/worktree&lt;/code&gt; executa o chat em um novo worktree Git; &lt;code&gt;/fork&lt;/code&gt; copia o chat para outro chat ou worktree&lt;/td&gt;
&lt;td&gt;Referência de comandos&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Modelo&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;/model&lt;/code&gt; escolhe modelo e esforço de raciocínio&lt;/td&gt;
&lt;td&gt;Docs da CLI&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Revisão local&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;/review&lt;/code&gt; verifica alterações não commitadas, um commit ou um branch base&lt;/td&gt;
&lt;td&gt;Docs da CLI&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;O suporte a worktrees está ativado por padrão desde a versão 0.156.0. Isso permite executar agentes paralelos no mesmo repositório sem que duas tarefas alterem os mesmos arquivos.&lt;/p&gt;

&lt;p&gt;Antes de criar um commit, execute:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;/review
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O comando relata descobertas priorizadas sem modificar sua árvore de trabalho.&lt;/p&gt;

&lt;h2&gt;
  
  
  Code Review: aplicativo de desktop, GitHub e GitLab
&lt;/h2&gt;

&lt;p&gt;O Code Review é um plugin do aplicativo de desktop do ChatGPT. Segundo a &lt;a href="https://learn.chatgpt.com/docs/code-review" rel="noopener noreferrer"&gt;documentação do Code Review&lt;/a&gt;, ele mostra:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;descrição do pull request;&lt;/li&gt;
&lt;li&gt;arquivos alterados;&lt;/li&gt;
&lt;li&gt;comentários;&lt;/li&gt;
&lt;li&gt;verificações do PR.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Use esse painel para investigar problemas antes de aprovar uma alteração.&lt;/p&gt;

&lt;p&gt;A revisão para GitHub está geralmente disponível. O suporte a merge requests do GitLab está em prévia.&lt;/p&gt;

&lt;h3&gt;
  
  
  Configurar revisões automáticas
&lt;/h3&gt;

&lt;p&gt;As revisões automáticas na nuvem exigem:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;o conector ChatGPT Codex;&lt;/li&gt;
&lt;li&gt;permissões para os repositórios.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Os comentários aparecem tanto no GitHub quanto no painel do Code Review. A revisão na nuvem não exige que você crie ou gerencie um ambiente na nuvem.&lt;/p&gt;

&lt;p&gt;Segundo o &lt;a href="https://learn.chatgpt.com/docs/third-party/github" rel="noopener noreferrer"&gt;guia de integração do GitHub&lt;/a&gt;, você também pode acionar uma revisão adicionando este comentário em um PR:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;@codex review
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;No GitHub, o Codex sinaliza apenas problemas P0 e P1.&lt;/p&gt;

&lt;h3&gt;
  
  
  Definir regras de revisão por repositório
&lt;/h3&gt;

&lt;p&gt;Crie uma seção &lt;code&gt;## Code Review Rules&lt;/code&gt; no arquivo &lt;code&gt;AGENTS.md&lt;/code&gt;. Coloque o arquivo o mais próximo possível do código que ele governa.&lt;/p&gt;

&lt;p&gt;Exemplo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight markdown"&gt;&lt;code&gt;&lt;span class="gu"&gt;## Code Review Rules&lt;/span&gt;
&lt;span class="p"&gt;
-&lt;/span&gt; Sinalize mudanças que alterem contratos públicos de API.
&lt;span class="p"&gt;-&lt;/span&gt; Verifique se endpoints autenticados mantêm autorização adequada.
&lt;span class="p"&gt;-&lt;/span&gt; Priorize regressões que possam causar falhas de produção.
&lt;span class="p"&gt;-&lt;/span&gt; Não reporte formatação ou regras já cobertas pelo linter.
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;As regras de revisão não substituem testes, proteções de branch ou aprovações obrigatórias. Deixe verificações mecânicas no CI.&lt;/p&gt;

&lt;p&gt;Para um fluxo completo, consulte &lt;a href="https://apidog.com/pt/blog/codex-code-review?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Codex para revisão de código&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Codex Security Cloud
&lt;/h2&gt;

&lt;p&gt;O Codex Security Cloud escaneia repositórios GitHub conectados ao Codex cloud. O resumo da OpenAI descreve:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;verificações agendadas;&lt;/li&gt;
&lt;li&gt;descobertas deduplicadas;&lt;/li&gt;
&lt;li&gt;preparação de correções na nuvem.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Ele inclui modelos Daybreak Blue sem exigir uma aplicação separada. O artigo &lt;a href="https://apidog.com/pt/blog/openai-daybreak-blue-vs-red?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Daybreak Blue vs Red&lt;/a&gt; explica esses níveis.&lt;/p&gt;

&lt;p&gt;O recurso está em prévia de pesquisa para os planos Pro, Business, Enterprise e Edu.&lt;/p&gt;

&lt;h3&gt;
  
  
  Configurar uma verificação de segurança
&lt;/h3&gt;

&lt;p&gt;Segundo o &lt;a href="https://learn.chatgpt.com/docs/security/setup" rel="noopener noreferrer"&gt;guia de configuração do Security Cloud&lt;/a&gt;:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Instale o plugin Codex Security Cloud no marketplace de plugins do ChatGPT.&lt;/li&gt;
&lt;li&gt;Selecione &lt;strong&gt;Conectar GitHub&lt;/strong&gt; e conceda acesso aos repositórios que deseja escanear.&lt;/li&gt;
&lt;li&gt;Escolha um repositório e um ambiente na nuvem.&lt;/li&gt;
&lt;li&gt;Defina o destino como &lt;strong&gt;Repositório&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Inicie uma verificação.&lt;/li&gt;
&lt;li&gt;Para cobertura contínua, escolha &lt;strong&gt;Commit changes&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Ajuste ambiente, dias de histórico ou estado de pausa em &lt;strong&gt;Monitoring settings&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Em uma descoberta, use &lt;strong&gt;Fix with Codex&lt;/strong&gt; para gerar um patch.&lt;/li&gt;
&lt;li&gt;Use &lt;strong&gt;Create draft pull request&lt;/strong&gt; para abrir o patch para revisão.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Para cobertura por PR, o GitHub também oferece suporte a:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;@codex security review
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Essa é uma revisão mais profunda e específica de segurança, ainda em prévia de pesquisa.&lt;/p&gt;

&lt;h2&gt;
  
  
  Onde o Apidog se encaixa: o Codex revisa código, sua API ainda precisa de um teste
&lt;/h2&gt;

&lt;p&gt;O Code Review lê diffs, descrições, comentários e verificações. Ele não envia requisições para seu serviço em execução.&lt;/p&gt;

&lt;p&gt;Um pull request que renomeia um campo JSON ou altera um código de status pode parecer correto em uma revisão e ainda quebrar clientes em produção. Isso é um problema de contrato e precisa de um teste que chame a API.&lt;/p&gt;

&lt;p&gt;A implementação recomendada é:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Mantenha sua especificação OpenAPI e cenários de teste no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;Faça cada cenário validar códigos de status e esquemas de resposta.&lt;/li&gt;
&lt;li&gt;Execute os cenários com a CLI do Apidog em cada pull request.&lt;/li&gt;
&lt;li&gt;Exiba o resultado como uma verificação do PR.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O Code Review mostra as verificações do pull request. Portanto, um teste de contrato falho aparece ao lado dos comentários do Codex no mesmo painel.&lt;/p&gt;

&lt;p&gt;Leia mais em &lt;a href="https://apidog.com/pt/blog/api-contract-testing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Testes de contrato de API&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Comece com os endpoints críticos
&lt;/h3&gt;

&lt;p&gt;Não tente cobrir toda a API de uma vez. Priorize endpoints dos quais os clientes mais dependem e valide:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;código de status;&lt;/li&gt;
&lt;li&gt;campos obrigatórios;&lt;/li&gt;
&lt;li&gt;tipos dos campos;&lt;/li&gt;
&lt;li&gt;estrutura da resposta.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Por exemplo, se um PR renomear &lt;code&gt;user_id&lt;/code&gt; para &lt;code&gt;userId&lt;/code&gt;, uma validação de esquema pode falhar antes da aprovação do PR. A CLI retorna um código diferente de zero e a verificação fica vermelha no GitHub.&lt;/p&gt;

&lt;p&gt;Essa divisão segue a orientação da OpenAI:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;regras de revisão cobrem comportamentos consequenciais e específicos do repositório;&lt;/li&gt;
&lt;li&gt;CI cobre verificações determinísticas.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Exemplo: testes de contrato com GitHub Actions
&lt;/h3&gt;

&lt;p&gt;Crie um workflow, por exemplo &lt;code&gt;.github/workflows/api-contract-tests.yml&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight yaml"&gt;&lt;code&gt;&lt;span class="na"&gt;name&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;api-contract-tests&lt;/span&gt;

&lt;span class="na"&gt;on&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;pull_request&lt;/span&gt;

&lt;span class="na"&gt;jobs&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt;
  &lt;span class="na"&gt;apidog&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt;
    &lt;span class="na"&gt;runs-on&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;ubuntu-latest&lt;/span&gt;

    &lt;span class="na"&gt;steps&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt;
      &lt;span class="pi"&gt;-&lt;/span&gt; &lt;span class="na"&gt;run&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;npm install -g apidog-cli&lt;/span&gt;

      &lt;span class="pi"&gt;-&lt;/span&gt; &lt;span class="na"&gt;run&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" -r cli,junit&lt;/span&gt;
        &lt;span class="na"&gt;env&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt;
          &lt;span class="na"&gt;APIDOG_ACCESS_TOKEN&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;${{ secrets.APIDOG_ACCESS_TOKEN }}&lt;/span&gt;
          &lt;span class="na"&gt;SCENARIO_ID&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;${{ vars.APIDOG_SCENARIO_ID }}&lt;/span&gt;
          &lt;span class="na"&gt;ENV_ID&lt;/span&gt;&lt;span class="pi"&gt;:&lt;/span&gt; &lt;span class="s"&gt;${{ vars.APIDOG_ENV_ID }}&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O Codex também pode executar o mesmo comando localmente antes de abrir o PR. Assim, ele recebe o erro enquanto ainda tem contexto sobre a alteração.&lt;/p&gt;

&lt;p&gt;Para configurar esse fluxo, consulte &lt;a href="https://apidog.com/pt/blog/apidog-cli-in-codex?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Usando a CLI do Apidog no Codex&lt;/a&gt;. Para conectar tarefa, implementação, PR e validação, leia &lt;a href="https://apidog.com/pt/blog/build-your-own-software-factory-codex?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Construindo uma fábrica de software com o Codex&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;O que o Codex recebeu no DevDay 2026?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Ambientes na nuvem reutilizáveis, uma CLI atualizada com voz, &lt;code&gt;/agents&lt;/code&gt;, edição de prompt, retomar e worktrees, Code Review no aplicativo de desktop com revisões automáticas na nuvem e o Codex Security Cloud em prévia de pesquisa.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Qual é o modelo padrão na CLI do Codex agora?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;GPT-6.1 Sol, desde a CLI 0.159.1 em 29 de setembro. Use &lt;code&gt;/model&lt;/code&gt; para trocar de modelo ou alterar o esforço de raciocínio.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Posso usar o Codex cloud no plano Free?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. O Codex cloud está disponível para Plus, Pro, Business, Healthcare, Edu e Enterprise. A CLI e o Code Review estão em todos os planos. Consulte também o &lt;a href="https://apidog.com/pt/blog/use-codex-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia gratuito do Codex&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O Code Review do Codex testa minha API?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. Ele lê o diff, a descrição, os comentários e as verificações do pull request. Adicione testes de contrato no CI para falhar a verificação quando o comportamento da API mudar.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Quem pode usar o Codex Security Cloud?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Usuários dos planos Pro, Business, Enterprise e Edu, em prévia de pesquisa. Você instala o recurso como plugin e conecta o GitHub.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;ol&gt;
&lt;li&gt;Atualize a CLI do Codex.&lt;/li&gt;
&lt;li&gt;Execute &lt;code&gt;/model&lt;/code&gt; e confirme que está usando &lt;code&gt;gpt-6.1-sol&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Execute &lt;code&gt;/review&lt;/code&gt; no próximo branch.&lt;/li&gt;
&lt;li&gt;
&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt;.&lt;/li&gt;
&lt;li&gt;Transforme um endpoint crítico em um cenário de teste.&lt;/li&gt;
&lt;li&gt;Adicione o workflow de CI para validar cada PR do Codex contra a API em execução, não apenas contra o diff.&lt;/li&gt;
&lt;/ol&gt;

</description>
    </item>
    <item>
      <title>OpenAI Ultrarrápido: 6x Mais Rápido por 6x o Preço. Vale a Pena?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:51:01 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/openai-ultrarrapido-6x-mais-rapido-por-6x-o-preco-vale-a-pena-4jmp</link>
      <guid>https://dev.to/lucas_ferreira/openai-ultrarrapido-6x-mais-rapido-por-6x-o-preco-vale-a-pena-4jmp</guid>
      <description>&lt;p&gt;OpenAI Ultrafast é uma camada de serviço, não um novo modelo. Ao adicionar &lt;code&gt;service_tier: "ultrafast"&lt;/code&gt; a uma solicitação da API de Respostas para &lt;code&gt;gpt-6-astra&lt;/code&gt;, a OpenAI pode gerar tokens até 6x mais rápido na API — e até 8x, ou 300 tokens por segundo, no Codex. O custo é 6x maior que o Standard: US$60 de entrada e US$300 de saída por milhão de tokens, contra US$10 e US$50. O ID do modelo não muda: as respostas ficam mais rápidas, não mais inteligentes. Use essa camada quando uma pessoa ou uma etapa crítica de latência espera por saídas longas; evite-a para jobs em lote ou tarefas em segundo plano.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;A OpenAI disponibilizou o Ultrafast amplamente no GPT-6 Astra no DevDay em 29 de setembro de 2026. Consulte &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;tudo mais do DevDay&lt;/a&gt;. Este guia mostra como habilitar a camada, comparar preços, considerar limites de taxa e calcular o ponto de equilíbrio com seus próprios dados. Para detalhes do modelo, leia o &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API do GPT-6 Astra&lt;/a&gt;. Antes de alterar a produção, meça Standard e Ultrafast no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  OpenAI Ultrafast em resumo
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Item&lt;/th&gt;
&lt;th&gt;Detalhe&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;O que é&lt;/td&gt;
&lt;td&gt;A camada de serviço mais rápida na API da OpenAI&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Parâmetro&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;service_tier: "ultrafast"&lt;/code&gt; em Respostas &lt;code&gt;create&lt;/code&gt; ou em um WebSocket &lt;code&gt;response.create&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Modelos&lt;/td&gt;
&lt;td&gt;GPT-6 Astra hoje; GPT-6.1 Sol “em breve”&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Alegação de velocidade&lt;/td&gt;
&lt;td&gt;Geração de tokens até 6x mais rápida na API; até 8x (300 tokens/s) no Codex&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço (Astra)&lt;/td&gt;
&lt;td&gt;US$60 de entrada, US$6 em cache, US$75 de escrita em cache e US$300 de saída por 1M de tokens&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limites de taxa&lt;/td&gt;
&lt;td&gt;500K TPM (Níveis 1–3), 1M (Nível 4), 5M (Nível 5)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Processamento&lt;/td&gt;
&lt;td&gt;Residência de dados apenas nos EUA e global; sem endpoints na UE ou em outras regiões&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Transporte&lt;/td&gt;
&lt;td&gt;WebSockets são fortemente recomendados&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Planos ChatGPT&lt;/td&gt;
&lt;td&gt;ChatGPT Work e Codex nos planos Pro 500 e Enterprise&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Fontes: &lt;a href="https://developers.openai.com/api/docs/guides/ultrafast-mode" rel="noopener noreferrer"&gt;guia do modo Ultrafast&lt;/a&gt; e &lt;a href="https://developers.openai.com/api/docs/pricing" rel="noopener noreferrer"&gt;página de preços&lt;/a&gt; da OpenAI.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que é o Ultrafast e quem pode usá-lo
&lt;/h2&gt;

&lt;p&gt;O resumo do DevDay da OpenAI define o Ultrafast como sua camada premium de velocidade. Segundo o guia, o GPT-6 Astra Ultrafast está disponível para todos os usuários da API com limites de taxa padrão mais baixos. Organizações com uma equipe de contas da OpenAI podem solicitar limites maiores.&lt;/p&gt;

&lt;p&gt;O guia também lista acesso prévio ao GPT-5.6 Sol por equipes de contas. A OpenAI &lt;a href="https://openai.com/index/previewing-ultrafast/" rel="noopener noreferrer"&gt;apresentou o Ultrafast inicialmente&lt;/a&gt; no GPT-5.6 Sol em 13 de agosto. Já o resumo do DevDay aponta o &lt;a href="https://apidog.com/pt/blog/what-is-gpt-6-1-sol?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GPT-6.1 Sol&lt;/a&gt; como próximo modelo. Nenhum dos dois possui preço Ultrafast publicado.&lt;/p&gt;

&lt;p&gt;No ChatGPT, o Ultrafast Astra é executado no ChatGPT Work e no Codex nos planos Pro 500 e Enterprise. Essa assinatura cobre os aplicativos. Scripts, jobs de CI e agentes criados por você continuam cobrados por token via chave de API.&lt;/p&gt;

&lt;p&gt;Interprete a alegação de desempenho corretamente:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Ela se aplica à &lt;strong&gt;geração de tokens&lt;/strong&gt; e diz &lt;strong&gt;“até”&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;Os &lt;strong&gt;300 tokens por segundo&lt;/strong&gt; são uma referência do Codex.&lt;/li&gt;
&lt;li&gt;A alegação para a API é de &lt;strong&gt;até 6x&lt;/strong&gt;.&lt;/li&gt;
&lt;li&gt;A OpenAI não publica um valor de tempo até o primeiro token (TTFT) para Ultrafast.&lt;/li&gt;
&lt;li&gt;Tokens por segundo não indicam, por si só, quanto tempo o usuário espera pelo primeiro token.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Como ativar &lt;code&gt;service_tier: "ultrafast"&lt;/code&gt;
&lt;/h2&gt;

&lt;p&gt;Em cada solicitação, use &lt;code&gt;gpt-6-astra&lt;/code&gt; como modelo e defina &lt;code&gt;service_tier&lt;/code&gt; como &lt;code&gt;ultrafast&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Via HTTP
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://api.openai.com/v1/responses &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gpt-6-astra",
    "input": "Explain why the sky is blue in one sentence.",
    "service_tier": "ultrafast"
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Via WebSocket
&lt;/h3&gt;

&lt;p&gt;A OpenAI recomenda fortemente WebSockets, especialmente para agentes que executam várias chamadas de ferramentas em rápida sucessão. Em fluxos assim, a sobrecarga de rede por solicitação pode consumir parte do ganho de velocidade.&lt;/p&gt;

&lt;p&gt;O exemplo abaixo transmite duas interações pela mesma conexão:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
&lt;span class="n"&gt;previous_response_id&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="nb"&gt;str&lt;/span&gt; &lt;span class="o"&gt;|&lt;/span&gt; &lt;span class="bp"&gt;None&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="bp"&gt;None&lt;/span&gt;
&lt;span class="n"&gt;prompts&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Explain why the sky is blue in one sentence.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Now explain why sunsets look red.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;]&lt;/span&gt;

&lt;span class="k"&gt;with&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;responses&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;connect&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt; &lt;span class="k"&gt;as&lt;/span&gt; &lt;span class="n"&gt;connection&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
    &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;prompt&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;prompts&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
        &lt;span class="n"&gt;connection&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
            &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gpt-6-astra&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="n"&gt;service_tier&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;ultrafast&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="n"&gt;previous_response_id&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;previous_response_id&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="n"&gt;prompt&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
        &lt;span class="p"&gt;)&lt;/span&gt;

        &lt;span class="k"&gt;for&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="n"&gt;connection&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="k"&gt;if&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nb"&gt;type&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;response.output_text.delta&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
                &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;delta&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;end&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;""&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;flush&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="bp"&gt;True&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
            &lt;span class="k"&gt;elif&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nb"&gt;type&lt;/span&gt; &lt;span class="o"&gt;==&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;response.completed&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
                &lt;span class="n"&gt;previous_response_id&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nb"&gt;id&lt;/span&gt;
                &lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;
                &lt;span class="k"&gt;break&lt;/span&gt;
            &lt;span class="k"&gt;elif&lt;/span&gt; &lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nb"&gt;type&lt;/span&gt; &lt;span class="ow"&gt;in&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;response.failed&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;response.incomplete&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;error&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}:&lt;/span&gt;
                &lt;span class="k"&gt;raise&lt;/span&gt; &lt;span class="nc"&gt;RuntimeError&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;event&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;to_json&lt;/span&gt;&lt;span class="p"&gt;())&lt;/span&gt;
        &lt;span class="k"&gt;else&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;
            &lt;span class="k"&gt;raise&lt;/span&gt; &lt;span class="nc"&gt;RuntimeError&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Connection closed before the response finished.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Instale o SDK e configure sua chave:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;pip &lt;span class="nb"&gt;install&lt;/span&gt; &lt;span class="nt"&gt;--upgrade&lt;/span&gt; &lt;span class="s2"&gt;"openai[realtime]"&lt;/span&gt;
&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;OPENAI_API_KEY&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"sua_chave"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Para limites de conexão e estratégias de reconexão, consulte o &lt;a href="https://apidog.com/pt/blog/openai-websocket-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia do modo WebSocket da OpenAI&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preços: Ultrafast vs. Standard, Fast e Batch
&lt;/h2&gt;

&lt;p&gt;Preços por 1 milhão de tokens para &lt;code&gt;gpt-6-astra&lt;/code&gt; em contexto curto, com até 272K tokens de entrada:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Nível&lt;/th&gt;
&lt;th&gt;Entrada&lt;/th&gt;
&lt;th&gt;Entrada em cache&lt;/th&gt;
&lt;th&gt;Escrita em cache&lt;/th&gt;
&lt;th&gt;Saída&lt;/th&gt;
&lt;th&gt;Vs. Standard&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Standard&lt;/td&gt;
&lt;td&gt;US$10.00&lt;/td&gt;
&lt;td&gt;US$1.00&lt;/td&gt;
&lt;td&gt;US$12.50&lt;/td&gt;
&lt;td&gt;US$50.00&lt;/td&gt;
&lt;td&gt;1x&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Batch ou Flex&lt;/td&gt;
&lt;td&gt;US$5.00&lt;/td&gt;
&lt;td&gt;US$0.50&lt;/td&gt;
&lt;td&gt;US$6.25&lt;/td&gt;
&lt;td&gt;US$25.00&lt;/td&gt;
&lt;td&gt;0.5x&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fast&lt;/td&gt;
&lt;td&gt;US$20.00&lt;/td&gt;
&lt;td&gt;US$2.00&lt;/td&gt;
&lt;td&gt;US$25.00&lt;/td&gt;
&lt;td&gt;US$100.00&lt;/td&gt;
&lt;td&gt;2x&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ultrafast&lt;/td&gt;
&lt;td&gt;US$60.00&lt;/td&gt;
&lt;td&gt;US$6.00&lt;/td&gt;
&lt;td&gt;US$75.00&lt;/td&gt;
&lt;td&gt;US$300.00&lt;/td&gt;
&lt;td&gt;6x&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Acima de 272K tokens de entrada, o Ultrafast passa para:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;US$120 de entrada&lt;/li&gt;
&lt;li&gt;US$12 de entrada em cache&lt;/li&gt;
&lt;li&gt;US$150 de escrita em cache&lt;/li&gt;
&lt;li&gt;US$450 de saída&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O Fast é o antigo processamento Prioritário, renomeado em 30 de julho de 2026.&lt;/p&gt;

&lt;p&gt;Atenção: o multiplicador também afeta tokens de entrada. Prompts longos podem custar 6x mais mesmo quando a aceleração percebida está limitada à geração de saída.&lt;/p&gt;

&lt;h2&gt;
  
  
  Limites de taxa e residência de dados
&lt;/h2&gt;

&lt;p&gt;Os limites padrão do Ultrafast para GPT-6 Astra são:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Nível de uso&lt;/th&gt;
&lt;th&gt;Limite&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Níveis 1–3&lt;/td&gt;
&lt;td&gt;500.000 tokens por minuto&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nível 4&lt;/td&gt;
&lt;td&gt;1.000.000 tokens por minuto&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nível 5&lt;/td&gt;
&lt;td&gt;5.000.000 tokens por minuto&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;O Ultrafast suporta apenas residência de dados nos EUA e processamento global. Se o seu contrato roteia tráfego por um endpoint da UE ou de outra região, o Ultrafast não estará disponível para esse projeto.&lt;/p&gt;

&lt;h2&gt;
  
  
  Quando o Ultrafast se paga: calcule o ponto de equilíbrio
&lt;/h2&gt;

&lt;p&gt;Use os valores abaixo como modelo de cálculo, não como benchmark. A variável de velocidade é apenas um placeholder: suponha que sua medição indique que o Standard Astra transmite 40 tokens de saída por segundo para seu prompt real.&lt;/p&gt;

&lt;p&gt;Substitua essa taxa pela sua medição.&lt;/p&gt;

&lt;h3&gt;
  
  
  Cenário 1: resposta voltada ao usuário
&lt;/h3&gt;

&lt;p&gt;Considere uma solicitação com:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;5.000 tokens de entrada sem cache&lt;/li&gt;
&lt;li&gt;2.000 tokens de saída&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Custo no Standard:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Entrada: &lt;code&gt;5.000 / 1.000.000 × US$10 = US$0.05&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Saída: &lt;code&gt;2.000 / 1.000.000 × US$50 = US$0.10&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Total: &lt;strong&gt;US$0.15&lt;/strong&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Custo no Ultrafast:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Entrada: &lt;code&gt;5.000 / 1.000.000 × US$60 = US$0.30&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Saída: &lt;code&gt;2.000 / 1.000.000 × US$300 = US$0.60&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Total: &lt;strong&gt;US$0.90&lt;/strong&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O custo adicional é &lt;strong&gt;US$0.75&lt;/strong&gt;.&lt;/p&gt;

&lt;p&gt;Se o Standard gera 40 tokens/s:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Tempo Standard = 2.000 / 40 = 50 segundos
Tempo Ultrafast, com 6x = 50 / 6 = 8,3 segundos
Tempo economizado = 41,7 segundos
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Logo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;US$0.75 / 41,7 s = US$0.018 por segundo economizado
US$0.018 × 3.600 = US$64.80 por hora economizada
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Se sua aceleração medida for menor que o máximo, o custo por segundo economizado aumenta:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Aceleração medida&lt;/th&gt;
&lt;th&gt;Segundos economizados (de 50)&lt;/th&gt;
&lt;th&gt;Custo extra por segundo&lt;/th&gt;
&lt;th&gt;Por hora economizada&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;6x&lt;/td&gt;
&lt;td&gt;41.7&lt;/td&gt;
&lt;td&gt;US$0.018&lt;/td&gt;
&lt;td&gt;US$64.80&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;4x&lt;/td&gt;
&lt;td&gt;37.5&lt;/td&gt;
&lt;td&gt;US$0.020&lt;/td&gt;
&lt;td&gt;US$72.00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;2x&lt;/td&gt;
&lt;td&gt;25.0&lt;/td&gt;
&lt;td&gt;US$0.030&lt;/td&gt;
&lt;td&gt;US$108.00&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h3&gt;
  
  
  Cenário 2: loop de agente
&lt;/h3&gt;

&lt;p&gt;Considere 20 etapas. Cada etapa usa:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;20.000 tokens de entrada&lt;/li&gt;
&lt;li&gt;18.000 tokens em cache&lt;/li&gt;
&lt;li&gt;2.000 tokens novos&lt;/li&gt;
&lt;li&gt;500 tokens de saída&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Ignore as taxas de escrita em cache para este exemplo.&lt;/p&gt;

&lt;p&gt;No Standard, o custo por etapa é:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Entrada em cache: 18.000 / 1.000.000 × US$1 = US$0.018
Nova entrada: 2.000 / 1.000.000 × US$10 = US$0.020
Saída: 500 / 1.000.000 × US$50 = US$0.025
Total por etapa = US$0.063
Total por execução = US$1.26
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;No Ultrafast:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Total por execução = US$7.56
Custo adicional = US$6.30
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Para 500 tokens de saída por etapa, em 20 etapas:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Saída total = 10.000 tokens
Tempo Standard = 10.000 / 40 = 250 segundos
Tempo Ultrafast, com 6x = 41,7 segundos
Tempo economizado = aproximadamente 208 segundos
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Resultado:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;US$6.30 / 208 s ≈ US$0.030 por segundo economizado
≈ US$109 por hora economizada
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Esse agente compra segundos a uma taxa pior porque a maior parte da fatura está na entrada. A entrada recebe o preço 6x, mas não recebe o mesmo ganho de velocidade atribuído à geração de saída.&lt;/p&gt;

&lt;p&gt;A decisão prática é simples: uma pessoa, ou uma etapa com valor monetário, está bloqueada por esses segundos? Essa espera vale mais do que aproximadamente US$65 a US$110 por hora?&lt;/p&gt;

&lt;p&gt;Um engenheiro esperando um agente interno de código ou um cliente em um fluxo pago pode justificar esse custo. Um cron job geralmente não.&lt;/p&gt;

&lt;h2&gt;
  
  
  Onde o Ultrafast não compensa
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Ninguém está esperando.&lt;/strong&gt; Avaliações noturnas, preenchimentos e relatórios são candidatos à &lt;a href="https://apidog.com/pt/blog/openai-batch-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API Batch&lt;/a&gt; ou ao Flex, que custam US$5 de entrada e US$25 de saída — um doze avos da taxa do Ultrafast.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Agentes em segundo plano.&lt;/strong&gt; Se o agente executa sem supervisão e apenas informa quando termina, concluir alguns minutos antes raramente muda o resultado.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Saídas curtas.&lt;/strong&gt; Uma classificação de 50 tokens tem pouco tempo de geração para reduzir. Configuração de conexão e TTFT podem dominar, especialmente via HTTP.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Prompts longos.&lt;/strong&gt; Chamadas com grande volume de entrada pagam 6x em tokens não cobertos pela alegação de velocidade. Acima de 272K tokens de entrada, as taxas aumentam para US$120 e US$450.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Processamento regional.&lt;/strong&gt; Não há endpoints na UE.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Chamadas limitadas por TTFT.&lt;/strong&gt; A &lt;a href="https://apidog.com/pt/blog/gpt-6-sol-time-to-first-token-latency?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;análise de latência do GPT-6 Sol&lt;/a&gt; observou que, em execuções longas de raciocínio, grande parte do tempo total pode ocorrer antes do primeiro token visível. Meça se o Ultrafast reduz esse tempo antes de pagar pela camada.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Meça TTFT e tempo total no Apidog antes de mudar
&lt;/h2&gt;

&lt;p&gt;Substitua os placeholders pelos dados do seu workload real.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;Crie um ambiente no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; com &lt;code&gt;OPENAI_API_KEY&lt;/code&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;Crie uma solicitação &lt;code&gt;POST&lt;/code&gt; para:&lt;br&gt;
&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;   https://api.openai.com/v1/responses
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Adicione o cabeçalho:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;   Authorization: Bearer {{OPENAI_API_KEY}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Use este corpo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="w"&gt;   &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"gpt-6-astra"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"input"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"&amp;lt;your real production prompt&amp;gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"service_tier"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"ultrafast"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"stream"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="w"&gt;
   &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;ol&gt;
&lt;li&gt;&lt;p&gt;Duplique a solicitação e remova &lt;code&gt;service_tier&lt;/code&gt; para criar a linha de base Standard. Mantenha o prompt idêntico.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Envie as duas variantes. O Apidog renderiza o stream de eventos server-sent evento por evento. Registre:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Quando chega o primeiro &lt;code&gt;response.output_text.delta&lt;/code&gt;: esse é o TTFT.&lt;/li&gt;
&lt;li&gt;Quando o stream termina: esse é o tempo total.&lt;/li&gt;
&lt;li&gt;O bloco &lt;code&gt;usage&lt;/code&gt; do evento final &lt;code&gt;response.completed&lt;/code&gt;: ele será usado para calcular o custo.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;Execute cada variante pelo menos 10 vezes. Compare mediana e p95, não uma única execução.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;Para loops de agente, teste WebSocket:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Abra uma solicitação WebSocket para &lt;code&gt;wss://api.openai.com/v1/responses&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Use o mesmo cabeçalho de autorização.&lt;/li&gt;
&lt;li&gt;Envie uma mensagem &lt;code&gt;response.create&lt;/code&gt; com os mesmos campos, exceto &lt;code&gt;stream&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Faça uma segunda interação usando &lt;code&gt;previous_response_id&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;A &lt;a href="https://apidog.com/pt/blog/websocket-vs-server-sent-events-real-time-apis?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;comparação entre WebSocket e SSE&lt;/a&gt; explica por que manter a conexão aberta importa em fluxos de múltiplas etapas.&lt;/p&gt;

&lt;p&gt;Calcule:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Segundos economizados =
mediana do tempo total no Standard -
mediana do tempo total no Ultrafast
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Depois, calcule o preço usando os tokens em &lt;code&gt;usage&lt;/code&gt; nas duas tabelas de preço. Divida o custo extra pelos segundos economizados e compare o resultado com o custo da espera no seu produto.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;O que é OpenAI Ultrafast?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
É uma camada de serviço da API de Respostas que gera tokens até 6x mais rápido na API por 6x o preço Standard. Ative-a por solicitação com &lt;code&gt;service_tier: "ultrafast"&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O Ultrafast é um modelo mais inteligente?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Não. Você usa o mesmo ID de modelo, &lt;code&gt;gpt-6-astra&lt;/code&gt;. A camada muda velocidade e preço, não o modelo.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Quanto custa o GPT-6 Astra Ultrafast?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Em contexto curto, custa US$60 de entrada, US$6 de entrada em cache, US$75 de escrita em cache e US$300 de saída por 1 milhão de tokens. No Standard, os valores são US$10, US$1, US$12.50 e US$50.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;De onde vem o número de 300 tokens por segundo?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
É a referência da OpenAI para Ultrafast no Codex, onde a empresa alega até 8x de aceleração. Para a API, a alegação é de até 6x.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O GPT-6.1 Sol suporta Ultrafast?&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
Ainda não. A OpenAI informa que estará disponível em breve. O &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;resumo do DevDay 2026&lt;/a&gt; acompanha o que já está disponível.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;p&gt;Escolha sua solicitação voltada ao usuário mais lenta. Execute-a 10 vezes no Standard e 10 vezes no Ultrafast. Compare a mediana dos segundos economizados com o custo adicional por execução.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; para manter as duas variantes, os tempos e os dados de &lt;code&gt;usage&lt;/code&gt; no mesmo projeto.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>OpenAI Agents API vs Responses API vs Agents SDK vs AgentKit: Qual a melhor opção para desenvolver?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:49:35 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/openai-agents-api-vs-responses-api-vs-agents-sdk-vs-agentkit-qual-a-melhor-opcao-para-desenvolver-1212</link>
      <guid>https://dev.to/lucas_ferreira/openai-agents-api-vs-responses-api-vs-agents-sdk-vs-agentkit-qual-a-melhor-opcao-para-desenvolver-1212</guid>
      <description>&lt;p&gt;Esses quatro nomes atuam em camadas diferentes. A pergunta que os separa é: &lt;strong&gt;quem executa o loop do agente?&lt;/strong&gt; A Responses API é a chamada ao modelo, e o seu código controla o loop. O Agents SDK é uma biblioteca para TypeScript e Python cujo executor roda o loop dentro do seu aplicativo. A Agents API, em beta público desde 10 de setembro de 2026, executa o harness Codex da OpenAI, mantém a sessão e pode gerenciar o sandbox. AgentKit é o pacote lançado em outubro de 2025 com Agent Builder, ChatKit, Connector Registry e Evals; o Agent Builder está programado para ser desativado em 30 de novembro de 2026.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;O DevDay de 29 de setembro adicionou uso de computador à Agents API — veja o &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;resumo do DevDay 2026&lt;/a&gt;. Isso torna a escolha entre essas opções ainda mais relevante.&lt;/p&gt;

&lt;p&gt;Este guia compara loop, computação, estado, custo e maturidade. Também inclui uma tabela de decisão e um caminho de migração de um loop manual com Responses. Para implementar sessões e aprovações, consulte o &lt;a href="https://apidog.com/pt/blog/openai-agents-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da OpenAI Agents API&lt;/a&gt;. Você pode testar qualquer uma dessas superfícies HTTP no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Opções de agentes OpenAI lado a lado
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;Agents API&lt;/th&gt;
&lt;th&gt;Responses API&lt;/th&gt;
&lt;th&gt;Agents SDK&lt;/th&gt;
&lt;th&gt;AgentKit&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;O que é&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Runtime de agente gerenciado no harness Codex&lt;/td&gt;
&lt;td&gt;Endpoint do modelo: &lt;code&gt;POST /v1/responses&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Biblioteca para TypeScript e Python&lt;/td&gt;
&lt;td&gt;Pacote com Agent Builder, ChatKit, Connector Registry e Evals&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Quem executa o loop&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;OpenAI&lt;/td&gt;
&lt;td&gt;Seu código&lt;/td&gt;
&lt;td&gt;Executor do SDK, dentro do aplicativo&lt;/td&gt;
&lt;td&gt;Workflows do Agent Builder, exportados para código SDK ou incorporados com ChatKit&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Onde a computação é executada&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Sandbox hospedado pela OpenAI, seu próprio sandbox ou nenhum&lt;/td&gt;
&lt;td&gt;Seu ambiente, além de ferramentas hospedadas&lt;/td&gt;
&lt;td&gt;Seus provedores de runtime e sandbox&lt;/td&gt;
&lt;td&gt;Não aplicável&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Onde o estado reside&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Sessão OpenAI: configuração, turnos e itens&lt;/td&gt;
&lt;td&gt;Seu histórico, &lt;code&gt;previous_response_id&lt;/code&gt; ou API de Conversas&lt;/td&gt;
&lt;td&gt;Seu armazenamento, sessões SDK ou estado de Responses&lt;/td&gt;
&lt;td&gt;Workflows publicados e versionados&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;O que você paga&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Tokens, ferramentas e contêineres hospedados; sem taxa extra&lt;/td&gt;
&lt;td&gt;Tokens e ferramentas&lt;/td&gt;
&lt;td&gt;Tokens, ferramentas e sua hospedagem&lt;/td&gt;
&lt;td&gt;Uso da API subjacente; sem assinatura separada&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Esforço de integração&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Baixo&lt;/td&gt;
&lt;td&gt;Alto&lt;/td&gt;
&lt;td&gt;Médio&lt;/td&gt;
&lt;td&gt;Não classificado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Status&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Beta público (&lt;code&gt;OpenAI-Beta: agents=v1&lt;/code&gt;)&lt;/td&gt;
&lt;td&gt;Recomendado para novos projetos&lt;/td&gt;
&lt;td&gt;Atual&lt;/td&gt;
&lt;td&gt;Agent Builder e Evals serão desativados em 30 de novembro de 2026; ChatKit permanece&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Controles de dados&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Residência apenas nos EUA; não elegível para ZDR; estado mantido até exclusão&lt;/td&gt;
&lt;td&gt;Elegível para ZDR, com limitações; endpoints regionais&lt;/td&gt;
&lt;td&gt;Depende das APIs chamadas pelo SDK&lt;/td&gt;
&lt;td&gt;Não aplicável&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Fontes: &lt;a href="https://developers.openai.com/api/docs/guides/agents" rel="noopener noreferrer"&gt;comparação de runtimes de agentes&lt;/a&gt;, &lt;a href="https://developers.openai.com/api/docs/guides/agents-api/overview" rel="noopener noreferrer"&gt;visão geral da Agents API&lt;/a&gt; e &lt;a href="https://developers.openai.com/api/docs/deprecations" rel="noopener noreferrer"&gt;página de depreciações&lt;/a&gt; da OpenAI.&lt;/p&gt;

&lt;h2&gt;
  
  
  Quem executa o loop?
&lt;/h2&gt;

&lt;p&gt;Essa é a decisão que determina a maioria das demais escolhas de arquitetura.&lt;/p&gt;

&lt;h3&gt;
  
  
  Responses API: seu código executa o loop
&lt;/h3&gt;

&lt;p&gt;Com a Responses API, você recebe chamadas de função e decide o próximo passo:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Envie um prompt com ferramentas.&lt;/li&gt;
&lt;li&gt;Receba um item &lt;code&gt;function_call&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Execute a função no seu backend.&lt;/li&gt;
&lt;li&gt;Envie &lt;code&gt;function_call_output&lt;/code&gt; usando o mesmo &lt;code&gt;call_id&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Repita até obter uma resposta final.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Ferramentas hospedadas, como pesquisa web, pesquisa de arquivos, interpretador de código e MCP remoto, podem realizar várias ações em uma única solicitação. Mas as suas funções retornam para o seu aplicativo.&lt;/p&gt;

&lt;p&gt;Você também controla:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;quando encerrar o loop;&lt;/li&gt;
&lt;li&gt;como persistir o histórico;&lt;/li&gt;
&lt;li&gt;quando usar &lt;code&gt;previous_response_id&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;quando desativar o armazenamento com &lt;code&gt;store: false&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;quando compactar contexto com &lt;code&gt;context_management&lt;/code&gt; e &lt;code&gt;compact_threshold&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Veja o &lt;a href="https://apidog.com/pt/blog/openai-responses-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da Responses API&lt;/a&gt; e o &lt;a href="https://apidog.com/pt/blog/openai-function-calling?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de chamada de função&lt;/a&gt; para implementar esse fluxo.&lt;/p&gt;

&lt;h3&gt;
  
  
  Agents SDK: o executor roda no seu processo
&lt;/h3&gt;

&lt;p&gt;No Agents SDK, o executor da biblioteca lida com o loop do agente e com transferências. Ainda assim, sua aplicação continua responsável por:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;implantação;&lt;/li&gt;
&lt;li&gt;implementação de ferramentas;&lt;/li&gt;
&lt;li&gt;armazenamento de estado;&lt;/li&gt;
&lt;li&gt;aprovações;&lt;/li&gt;
&lt;li&gt;observabilidade e auditoria.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Com Sandbox Agents, o harness pode permanecer na sua infraestrutura enquanto comandos são executados em um workspace Unix local, Docker ou provedor hospedado. Isso mantém autenticação, logs de auditoria e revisão humana fora do contêiner.&lt;/p&gt;

&lt;h3&gt;
  
  
  Agents API: a OpenAI executa o loop
&lt;/h3&gt;

&lt;p&gt;Na Agents API, a OpenAI opera o harness gerenciado. Ele lida com:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;sessões;&lt;/li&gt;
&lt;li&gt;orquestração;&lt;/li&gt;
&lt;li&gt;compactação de contexto;&lt;/li&gt;
&lt;li&gt;recuperação;&lt;/li&gt;
&lt;li&gt;subagentes;&lt;/li&gt;
&lt;li&gt;pesquisa de ferramentas;&lt;/li&gt;
&lt;li&gt;chamada programática de ferramentas.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Servidores MCP remotos são chamados diretamente pela OpenAI.&lt;/p&gt;

&lt;p&gt;Seu backend ainda precisa atender chamadas de função. Quando a sessão informar uma &lt;code&gt;function_call&lt;/code&gt; em &lt;code&gt;required_actions&lt;/code&gt;, envie um evento &lt;code&gt;agent.session.input.tool_result&lt;/code&gt; com &lt;code&gt;turn_id&lt;/code&gt; e &lt;code&gt;call_id&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Compare as chamadas HTTP
&lt;/h3&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# Responses API: seu código é o dono do loop&lt;/span&gt;
curl https://api.openai.com/v1/responses &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "low"},
    "tools": [{"type": "web_search"}],
    "input": "Summarize the breaking changes in the latest Node.js release."
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;





&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# Agents API: uma sessão durável; OpenAI executa o loop&lt;/span&gt;
curl https://api.openai.com/v1/agents/sessions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"OpenAI-Beta: agents=v1"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "agent": {
      "model": "gpt-6-astra",
      "tools": [{"type": "web_search"}]
    },
    "environment": {"type": "none"},
    "input": "Summarize the breaking changes in the latest Node.js release."
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Os exemplos da documentação da Agents API usam &lt;code&gt;gpt-6-astra&lt;/code&gt;. Eles não especificam se outros modelos são aceitos; valide antes de substituí-lo por &lt;code&gt;gpt-6.1-sol&lt;/code&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Computação, estado e custo
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Computação
&lt;/h3&gt;

&lt;p&gt;A Agents API pode provisionar e administrar um sandbox durante toda a sessão. Configure &lt;code&gt;environment.type&lt;/code&gt; como:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;openai_hosted&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;self_hosted&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;none&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;No Agents SDK, você escolhe e paga pelo provedor de sandbox. Com Responses, o código roda onde você o executa, exceto pelas ferramentas hospedadas.&lt;/p&gt;

&lt;h3&gt;
  
  
  Estado
&lt;/h3&gt;

&lt;p&gt;Uma sessão da Agents API mantém configuração, turnos e itens no lado da OpenAI. Para continuar uma conversa, envie um novo evento para o mesmo ID de sessão.&lt;/p&gt;

&lt;p&gt;Com Responses, você pode:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;encadear chamadas com &lt;code&gt;previous_response_id&lt;/code&gt;; ou&lt;/li&gt;
&lt;li&gt;usar a API de Conversas.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;No SDK, o estado fica no seu armazenamento, nas sessões do SDK ou no estado de Responses.&lt;/p&gt;

&lt;h3&gt;
  
  
  Custo
&lt;/h3&gt;

&lt;p&gt;Os preços de tokens são os mesmos em todas as opções porque elas chamam os mesmos modelos.&lt;/p&gt;

&lt;p&gt;A Agents API não adiciona uma taxa própria, mas contêineres hospedados custam entre &lt;strong&gt;US$ 0,03&lt;/strong&gt; para 1 GB e &lt;strong&gt;US$ 0,48&lt;/strong&gt; para 16 GB por sessão de 20 minutos.&lt;/p&gt;

&lt;p&gt;No SDK, o custo adicional é a infraestrutura que você opera. O AgentKit não tem assinatura separada, conforme explicado no &lt;a href="https://apidog.com/pt/blog/openai-agentkit?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia do AgentKit&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Dados e residência
&lt;/h3&gt;

&lt;p&gt;A Agents API suporta apenas residência de dados nos EUA e não suporta Zero Data Retention (ZDR), inclusive com sandbox auto-hospedado.&lt;/p&gt;

&lt;p&gt;A &lt;a href="https://developers.openai.com/api/docs/guides/your-data" rel="noopener noreferrer"&gt;página de controle de dados&lt;/a&gt; da OpenAI informa que:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;/v1/agents&lt;/code&gt; não é elegível para ZDR;&lt;/li&gt;
&lt;li&gt;o estado é mantido até ser excluído;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;/v1/responses&lt;/code&gt; é elegível para ZDR, com limitações;&lt;/li&gt;
&lt;li&gt;Responses está disponível em endpoints regionais, como &lt;code&gt;eu.api.openai.com&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Se ZDR ou residência de dados na União Europeia for um requisito, a Agents API não atende esse requisito atualmente.&lt;/p&gt;

&lt;h2&gt;
  
  
  AgentKit no final de 2026: o que permanece?
&lt;/h2&gt;

&lt;p&gt;O AgentKit foi lançado em 6 de outubro de 2025 com quatro componentes.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Agent Builder:&lt;/strong&gt; a depreciação foi anunciada em 3 de junho de 2026, com desligamento programado para 30 de novembro de 2026. O &lt;a href="https://developers.openai.com/api/docs/guides/agent-builder/migrate-from-agent-builder" rel="noopener noreferrer"&gt;guia de migração&lt;/a&gt; permite exportar um workflow como código do Agents SDK ou recriá-lo como um ChatGPT Workspace Agent em Business, Enterprise ou Edu.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Evals:&lt;/strong&gt; avaliações existentes se tornam somente leitura em 31 de outubro de 2026. O painel e a API serão desativados em 30 de novembro de 2026.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;ChatKit:&lt;/strong&gt; permanece disponível para chat incorporado.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Connector Registry:&lt;/strong&gt; painel administrativo para conectores e servidores MCP nos produtos OpenAI.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para um caminho code-first e durável, use o Agents SDK, como detalhado no &lt;a href="https://apidog.com/pt/blog/openai-agentkit?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia do AgentKit&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Qual opção escolher?
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Escolha&lt;/th&gt;
&lt;th&gt;Use quando&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Agents API&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;A tarefa dura minutos, precisa de arquivos, comandos ou navegador, e você não quer operar loop, sandbox ou armazenamento de sessão. Residência nos EUA e um cabeçalho beta são aceitáveis.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Responses API&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Você quer controlar cada turno, precisa de ZDR ou residência fora dos EUA, faz chamadas únicas ou já possui um loop funcional.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Agents SDK&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Seu aplicativo tipado deve controlar ferramentas, armazenamento, aprovações e transferências, com o loop rodando na sua infraestrutura.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;ChatKit&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Você precisa incorporar uma interface de chat no produto.&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;strong&gt;Agent Builder&lt;/strong&gt;&lt;/td&gt;
&lt;td&gt;Não inicie novos projetos aqui. Exporte workflows existentes antes de 30 de novembro de 2026.&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Na AWS, o &lt;a href="https://aws.amazon.com/bedrock/managed-agents-openai/" rel="noopener noreferrer"&gt;Bedrock Managed Agents, desenvolvido pela OpenAI&lt;/a&gt;, oferece capacidades centrais da Agents API para execução nativa na AWS.&lt;/p&gt;

&lt;p&gt;Para configurar MCP em qualquer caminho code-first, consulte &lt;a href="https://apidog.com/pt/blog/mcp-servers-openai-agents?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;servidores MCP com agentes OpenAI&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Migrando de um loop Responses para a Agents API
&lt;/h2&gt;

&lt;p&gt;Se você já implementou um loop com Responses e quer que a OpenAI o execute, siga esta sequência.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Mapeie os componentes&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Instruções, modelo e ferramentas vão para &lt;code&gt;agent&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Seu contêiner passa a ser &lt;code&gt;environment&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Seu armazenamento de conversa passa a ser um ID de sessão.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Mova servidores MCP remotos para &lt;code&gt;agent.tools&lt;/code&gt;&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Armazene tokens em um cofre associado usando &lt;code&gt;vault_ids&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Não coloque segredos no prompt.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Reescreva o tratamento de ferramentas de função&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Substitua o loop que envia &lt;code&gt;function_call_output&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Trate &lt;code&gt;agent.session.requires_action&lt;/code&gt; no stream.&lt;/li&gt;
&lt;li&gt;Trate &lt;code&gt;agent.session.action_required&lt;/code&gt; em webhooks.&lt;/li&gt;
&lt;li&gt;Responda com &lt;code&gt;agent.session.input.tool_result&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Inclua &lt;code&gt;turn_id&lt;/code&gt; e &lt;code&gt;call_id&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Mantenha ferramentas de função no agente principal&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Subagentes não podem chamar ferramentas de função.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Remova a compactação manual&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O harness da Agents API compacta o contexto automaticamente.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;
&lt;p&gt;&lt;strong&gt;Monitore eventos de término&lt;/strong&gt;&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;agent.session.turn.completed&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.turn.failed&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.turn.cancelled&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Uma sessão ociosa não indica sucesso. Use streaming ou webhooks para determinar o resultado do turno.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;Valide as restrições antes de migrar&lt;/strong&gt;

&lt;ul&gt;
&lt;li&gt;residência de dados apenas nos EUA;&lt;/li&gt;
&lt;li&gt;sem ZDR;&lt;/li&gt;
&lt;li&gt;cabeçalho &lt;code&gt;OpenAI-Beta: agents=v1&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  Teste Responses e Agents API no mesmo projeto Apidog
&lt;/h2&gt;

&lt;p&gt;Antes de mudar sua arquitetura, execute os dois fluxos lado a lado.&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Crie uma pasta &lt;code&gt;Responses&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Crie uma pasta &lt;code&gt;Agents API&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Compartilhe um ambiente com:

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;{{OPENAI_API_KEY}}&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;uma variável de modelo.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Envie os mesmos prompts para as duas APIs.&lt;/li&gt;
&lt;li&gt;Faça asserções sobre:

&lt;ul&gt;
&lt;li&gt;código HTTP;&lt;/li&gt;
&lt;li&gt;campos obrigatórios da saída;&lt;/li&gt;
&lt;li&gt;eventos esperados do turno.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;Abra o stream da Agents API como uma solicitação SSE para inspecionar eventos.&lt;/li&gt;
&lt;li&gt;Salve as execuções como um cenário de teste.&lt;/li&gt;
&lt;li&gt;Execute o cenário no CI com o Apidog CLI.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Dessa forma, mudanças no comportamento beta aparecem como falhas verificáveis no pipeline. O &lt;a href="https://apidog.com/pt/blog/production-ai-agent-reliability?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de confiabilidade de agentes de IA em produção&lt;/a&gt; mostra o que vale a pena validar. Para configurar o projeto, &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;baixe o Apidog&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Perguntas frequentes
&lt;/h2&gt;

&lt;h3&gt;
  
  
  A Agents API está substituindo a Responses API?
&lt;/h3&gt;

&lt;p&gt;Não. Nenhuma depreciação foi anunciada. A OpenAI lista Agents API, Agents SDK e Responses API como opções atuais para necessidades diferentes.&lt;/p&gt;

&lt;h3&gt;
  
  
  O OpenAI AgentKit está depreciado?
&lt;/h3&gt;

&lt;p&gt;Parcialmente. Agent Builder e Evals serão desativados em 30 de novembro de 2026. ChatKit continua disponível.&lt;/p&gt;

&lt;h3&gt;
  
  
  O Agents SDK usa a Agents API?
&lt;/h3&gt;

&lt;p&gt;Não. O SDK roda no seu aplicativo. A Agents API executa um harness gerenciado no serviço da OpenAI.&lt;/p&gt;

&lt;h3&gt;
  
  
  O que aconteceu com a Assistants API?
&lt;/h3&gt;

&lt;p&gt;A página de depreciações da OpenAI definiu sua remoção para 26 de agosto de 2026 e orienta desenvolvedores a usar as APIs Responses e Conversations.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual opção é mais barata?
&lt;/h3&gt;

&lt;p&gt;Os preços de tokens são os mesmos. A diferença está nos contêineres hospedados da Agents API versus a infraestrutura que você opera com SDK ou Responses.&lt;/p&gt;

&lt;h2&gt;
  
  
  Escolha um caminho esta semana
&lt;/h2&gt;

&lt;p&gt;Comece decidindo quem deve executar o loop. Depois, valide essa escolha com solicitações reais antes de construir a aplicação completa.&lt;/p&gt;

&lt;p&gt;Se você está começando, crie uma sessão na Agents API e compare a saída com sua &lt;a href="https://apidog.com/pt/blog/openai-responses-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;configuração atual de Responses&lt;/a&gt; no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/p&gt;

</description>
      <category>agents</category>
      <category>ai</category>
      <category>api</category>
      <category>openai</category>
    </item>
    <item>
      <title>Como usar a API de Agentes OpenAI?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Fri, 02 Oct 2026 09:48:13 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/como-usar-a-api-de-agentes-openai-2ilc</link>
      <guid>https://dev.to/lucas_ferreira/como-usar-a-api-de-agentes-openai-2ilc</guid>
      <description>&lt;p&gt;A API OpenAI Agents executa para você o harness Codex de código aberto da OpenAI. Envie uma requisição &lt;code&gt;POST https://api.openai.com/v1/agents/sessions&lt;/code&gt; com o cabeçalho &lt;code&gt;OpenAI-Beta: agents=v1&lt;/code&gt;, a definição do agente e uma tarefa. A OpenAI executa o modelo e o ciclo de ferramentas, mantém a sessão e pode provisionar um sandbox. Não há taxa específica da API Agents: você paga por tokens, ferramentas e tempo de contêiner hospedado — de US$ 0,03 a US$ 0,48 por sessão de 20 minutos, conforme o sandbox de 1 GB a 16 GB. A API entrou em beta público em 10 de setembro de 2026, e a OpenAI adicionou uso de computador no DevDay em 29 de setembro.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Neste guia, você vai criar uma sessão REST, acompanhar eventos, configurar ferramentas MCP e subagentes e implementar o fluxo de aprovação para uso de computador. Para comparar as interfaces de agente da OpenAI, leia &lt;a href="https://apidog.com/pt/blog/openai-agents-api-vs-responses-api-vs-agents-sdk?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;API Agents vs API Responses vs SDK Agents&lt;/a&gt;. Para o restante do evento, veja o &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;resumo do DevDay 2026&lt;/a&gt;. Como todas as chamadas são HTTP, você pode validá-las no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; antes de implementar a integração.&lt;/p&gt;

&lt;h2&gt;
  
  
  API OpenAI Agents em um relance
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Item&lt;/th&gt;
&lt;th&gt;Valor&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Status&lt;/td&gt;
&lt;td&gt;Beta público desde 10 de setembro de 2026; uso de computador adicionado em 29 de setembro&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Criar uma sessão&lt;/td&gt;
&lt;td&gt;&lt;code&gt;POST /v1/agents/sessions&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cabeçalho beta&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;OpenAI-Beta: agents=v1&lt;/code&gt; — os SDKs da OpenAI o adicionam&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Permissões de chave&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;api.agents.read&lt;/code&gt;, &lt;code&gt;api.agents.write&lt;/code&gt;, &lt;code&gt;api.responses.write&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Preço&lt;/td&gt;
&lt;td&gt;Sem taxa da API Agents; tokens do modelo a taxas de API e ferramentas a taxas padrão, como pesquisa web por US$ 10 a cada 1 mil chamadas&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Contêineres hospedados&lt;/td&gt;
&lt;td&gt;US$ 0,03 (&lt;code&gt;small&lt;/code&gt;, 1 GB), US$ 0,12 (&lt;code&gt;medium&lt;/code&gt;, 4 GB) e US$ 0,48 (&lt;code&gt;large&lt;/code&gt;, 16 GB) por sessão de 20 minutos&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ambientes&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;none&lt;/code&gt;, &lt;code&gt;openai_hosted&lt;/code&gt;, &lt;code&gt;self_hosted&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Modelo usado nos exemplos da documentação&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gpt-6-astra&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Controles de dados&lt;/td&gt;
&lt;td&gt;Residência de dados apenas nos EUA; sem Retenção de Dados Zero (ZDR)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tamanho máximo da requisição&lt;/td&gt;
&lt;td&gt;4 MiB&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Fontes: &lt;a href="https://openai.com/index/introducing-the-agents-api/" rel="noopener noreferrer"&gt;Apresentando a API Agents&lt;/a&gt;, &lt;a href="https://developers.openai.com/api/docs/guides/agents-api/overview" rel="noopener noreferrer"&gt;visão geral da API Agents&lt;/a&gt; e &lt;a href="https://developers.openai.com/api/docs/pricing" rel="noopener noreferrer"&gt;página de preços&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Os quatro conceitos que você precisa configurar
&lt;/h2&gt;

&lt;p&gt;A API é organizada em quatro partes:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Agente:&lt;/strong&gt; modelo, instruções, ferramentas e servidores MCP. Você pode defini-lo inline ou salvar e reutilizar um &lt;code&gt;agent_id&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ambiente:&lt;/strong&gt; sandbox ou computador opcional onde o agente lê arquivos e executa comandos.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Sessão:&lt;/strong&gt; instância durável que preserva configuração, conversação e trabalho salvo.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Eventos e itens:&lt;/strong&gt; eventos mostram o progresso em tempo real; itens guardam mensagens e chamadas de ferramentas.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Enviar uma mensagem para uma sessão ociosa inicia um turno. Enviar uma mensagem enquanto o turno está em execução direciona o agente. O harness — a instância hospedada do Codex que executa o modelo e o ciclo de ferramentas, conforme a &lt;a href="https://developers.openai.com/api/docs/guides/agents-api/architecture" rel="noopener noreferrer"&gt;página de arquitetura&lt;/a&gt; — também faz compactação de contexto automaticamente.&lt;/p&gt;

&lt;h2&gt;
  
  
  Escolha o ambiente de execução
&lt;/h2&gt;

&lt;p&gt;Defina &lt;code&gt;environment.type&lt;/code&gt; conforme o nível de execução necessário.&lt;/p&gt;

&lt;h3&gt;
  
  
  &lt;code&gt;none&lt;/code&gt;
&lt;/h3&gt;

&lt;p&gt;Use quando o agente não precisa executar código nem manipular arquivos.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Servidores MCP remotos e ferramentas de função continuam disponíveis.&lt;/li&gt;
&lt;li&gt;Bash embutido, &lt;code&gt;apply-patch&lt;/code&gt;, arquivos de workspace e MCPs executores não funcionam.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  &lt;code&gt;openai_hosted&lt;/code&gt;
&lt;/h3&gt;

&lt;p&gt;Use quando o agente precisa de um sandbox Linux gerenciado pela OpenAI.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O ambiente inclui Python e Node.js em &lt;code&gt;/workspace&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Escolha &lt;code&gt;container_size&lt;/code&gt;: &lt;code&gt;small&lt;/code&gt; (1 GB), &lt;code&gt;medium&lt;/code&gt; (padrão, 4 GB) ou &lt;code&gt;large&lt;/code&gt; (16 GB).&lt;/li&gt;
&lt;li&gt;Configure &lt;code&gt;network.access&lt;/code&gt; como &lt;code&gt;enabled&lt;/code&gt;, &lt;code&gt;disabled&lt;/code&gt; ou &lt;code&gt;restricted&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Com rede restrita, defina &lt;code&gt;allowed_domains&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Arquivos criados em &lt;code&gt;/workspace/outputs&lt;/code&gt; tornam-se artefatos quando o turno termina.&lt;/li&gt;
&lt;li&gt;Um sandbox ocioso sem keep-alives pode ser excluído após uma hora.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  &lt;code&gt;self_hosted&lt;/code&gt;
&lt;/h3&gt;

&lt;p&gt;Use quando você precisa executar o ambiente na sua própria infraestrutura.&lt;/p&gt;

&lt;p&gt;Execute &lt;code&gt;codex exec-server&lt;/code&gt; em um laptop, contêiner ou sandbox remoto. Ele se conecta externamente usando uma chave de ambiente separada.&lt;/p&gt;

&lt;p&gt;A postagem de lançamento lista Blaxel, Cloudflare, Daytona, DigitalOcean, E2B, Modal, Oracle, Runloop e Vercel como parceiros de sandbox. O &lt;a href="https://developers.openai.com/api/docs/guides/agents-api/environments/self-hosted" rel="noopener noreferrer"&gt;guia de auto-hospedagem&lt;/a&gt; também inclui AWS Lambda MicroVMs.&lt;/p&gt;

&lt;h2&gt;
  
  
  Crie sua primeira sessão via REST
&lt;/h2&gt;

&lt;p&gt;Primeiro, exporte uma chave com as permissões necessárias:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nb"&gt;export &lt;/span&gt;&lt;span class="nv"&gt;OPENAI_API_KEY&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="s2"&gt;"sua_chave"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Em seguida, crie uma sessão com um contêiner pequeno e streaming ativado:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl &lt;span class="nt"&gt;--no-buffer&lt;/span&gt; https://api.openai.com/v1/agents/sessions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"OpenAI-Beta: agents=v1"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "agent": {
      "model": "gpt-6-astra",
      "instructions": "Write clean code, run it, and report the actual output."
    },
    "environment": {
      "type": "openai_hosted",
      "container_size": "small"
    },
    "input": "Create tree.py, a script that prints a tree of the files in the current directory. Run it and show the output.",
    "stream": true
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Com &lt;code&gt;stream: true&lt;/code&gt;, a resposta contém o stream de eventos do primeiro turno. Capture o ID da sessão e reutilize-o nas próximas operações.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Ação&lt;/th&gt;
&lt;th&gt;Requisição&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Acompanhar ou direcionar o agente&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;POST /v1/agents/sessions/{id}/events&lt;/code&gt; com &lt;code&gt;agent.session.input.message&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Cancelar o turno ativo&lt;/td&gt;
&lt;td&gt;Mesmo endpoint, com &lt;code&gt;agent.session.input.cancel&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ler trabalho salvo&lt;/td&gt;
&lt;td&gt;&lt;code&gt;GET /v1/agents/sessions/{id}/items?order=asc&amp;amp;limit=100&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Excluir a sessão&lt;/td&gt;
&lt;td&gt;&lt;code&gt;DELETE /v1/agents/sessions/{id}&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h2&gt;
  
  
  Faça o mesmo com o SDK JavaScript
&lt;/h2&gt;

&lt;p&gt;O SDK JavaScript segue a mesma estrutura. Este exemplo adiciona pesquisa web, subagentes e um cofre:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="k"&gt;import&lt;/span&gt; &lt;span class="nx"&gt;OpenAI&lt;/span&gt; &lt;span class="k"&gt;from&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;openai&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="k"&gt;new&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;();&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;session&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="k"&gt;await&lt;/span&gt; &lt;span class="nx"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;beta&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;agents&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;sessions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;({&lt;/span&gt;
  &lt;span class="na"&gt;agent&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="na"&gt;model&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;gpt-6-astra&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="na"&gt;tools&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[{&lt;/span&gt; &lt;span class="na"&gt;type&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;web_search&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt; &lt;span class="p"&gt;}],&lt;/span&gt;
    &lt;span class="na"&gt;multi_agent&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
      &lt;span class="na"&gt;enabled&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
      &lt;span class="na"&gt;max_concurrent_subagents&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="p"&gt;},&lt;/span&gt;
  &lt;span class="p"&gt;},&lt;/span&gt;
  &lt;span class="na"&gt;vault_ids&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="nx"&gt;process&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;env&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;VAULT_ID&lt;/span&gt;&lt;span class="p"&gt;],&lt;/span&gt;
  &lt;span class="na"&gt;environment&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt; &lt;span class="na"&gt;type&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;openai_hosted&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt; &lt;span class="p"&gt;},&lt;/span&gt;
  &lt;span class="na"&gt;input&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;Summarize breaking changes in the latest release notes.&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;});&lt;/span&gt;

&lt;span class="nx"&gt;console&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;log&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;session&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;id&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Use &lt;code&gt;vault_ids&lt;/code&gt; quando ferramentas ou servidores MCP precisarem acessar credenciais armazenadas em um cofre.&lt;/p&gt;

&lt;h2&gt;
  
  
  Acompanhe o progresso com streaming ou webhooks
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Streaming SSE
&lt;/h3&gt;

&lt;p&gt;Abra o stream antes de enviar a entrada para evitar perder os eventos iniciais:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;GET /v1/agents/sessions/{id}/events?stream=true
Accept: text/event-stream
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Monitore principalmente:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;agent.session.turn.output_text.delta&lt;/code&gt; e &lt;code&gt;agent.session.turn.output_text.done&lt;/code&gt; para saída de texto;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;agent.session.turn.completed&lt;/code&gt;, &lt;code&gt;agent.session.turn.failed&lt;/code&gt; e &lt;code&gt;agent.session.turn.cancelled&lt;/code&gt; para o estado final;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;agent.session.requires_action&lt;/code&gt; quando o agente precisa de resultado de função, conexão de ambiente ou aprovação de uso de computador.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Evite estes erros comuns:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;code&gt;agent.session.idle&lt;/code&gt; não garante sucesso do turno.&lt;/li&gt;
&lt;li&gt;Um turno concluído pode conter chamadas de ferramenta que falharam.&lt;/li&gt;
&lt;li&gt;Fechar o stream não cancela a tarefa.&lt;/li&gt;
&lt;li&gt;Streams não reproduzem eventos perdidos. Após desconectar, abra outro stream e consulte a sessão e seus itens.&lt;/li&gt;
&lt;/ol&gt;

&lt;h3&gt;
  
  
  Webhooks
&lt;/h3&gt;

&lt;p&gt;Para tarefas longas, assine estes eventos:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;agent.session.created&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.action_required&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.in_progress&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.idle&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;agent.session.failed&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Há uma diferença importante de nomenclatura:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;No stream: &lt;code&gt;requires_action&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;No webhook: &lt;code&gt;action_required&lt;/code&gt;
&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Os payloads de webhook não incluem todos os detalhes da chamada. Portanto, seu handler deve recuperar a sessão e consultar &lt;code&gt;required_actions&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Sempre valide a assinatura recebida. Veja &lt;a href="https://apidog.com/pt/blog/webhook-signature-verification?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;verificação de assinatura de webhook&lt;/a&gt;. Para fluxos que podem levar vários minutos, consulte também &lt;a href="https://apidog.com/pt/blog/ai-agent-long-running-api-operations?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;operações de API de longa duração&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Configure ferramentas MCP, pesquisa de ferramentas e subagentes
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Adicione um servidor MCP
&lt;/h3&gt;

&lt;p&gt;Inclua o servidor em &lt;code&gt;agent.tools&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"mcp"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"server_label"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"openai_docs"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"transport"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"http"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"server_url"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"https://developers.openai.com/mcp"&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"required"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Por padrão, a OpenAI cria a conexão com &lt;code&gt;connection_origin: "service"&lt;/code&gt;. Nesse caso, o servidor MCP deve estar acessível pela infraestrutura da OpenAI.&lt;/p&gt;

&lt;p&gt;Use alternativas conforme a rede:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;connection_origin: "environment"&lt;/code&gt; para servidores em rede privada;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;stdio&lt;/code&gt; para iniciar o servidor dentro do sandbox;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;transport.authorization&lt;/code&gt; para credenciais de uma sessão;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;vault_ids&lt;/code&gt; para anexar credenciais de cofre, como &lt;code&gt;static_bearer&lt;/code&gt; ou &lt;code&gt;mcp_oauth&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Habilite pesquisa de ferramentas
&lt;/h3&gt;

&lt;p&gt;Ferramentas MCP são descobertas automaticamente quando o modelo suporta pesquisa de ferramentas.&lt;/p&gt;

&lt;p&gt;Se você tiver muitas ferramentas de função, reduza o contexto inicial adicionando:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"tool_search"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Depois, marque ferramentas que podem ser carregadas sob demanda:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"defer_loading"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Controle chamadas de ferramentas programáticas
&lt;/h3&gt;

&lt;p&gt;Por padrão, o agente recebe uma ferramenta &lt;code&gt;exec&lt;/code&gt; que executa JavaScript em um runtime V8 isolado. Isso permite agrupar chamadas de ferramentas e reduzir resultados antes que eles entrem no contexto do modelo.&lt;/p&gt;

&lt;p&gt;Para desativar:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"programmatic_tool_calling"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"enabled"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;false&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  Habilite subagentes
&lt;/h3&gt;

&lt;p&gt;Configure subagentes assim:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"multi_agent"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"enabled"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"max_concurrent_subagents"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O limite padrão é 6 subagentes simultâneos.&lt;/p&gt;

&lt;p&gt;Os subagentes:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;compartilham o sistema de arquivos do ambiente;&lt;/li&gt;
&lt;li&gt;herdam ferramentas MCP e pesquisa web;&lt;/li&gt;
&lt;li&gt;não podem usar ferramentas de função.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Nos itens de um turno, &lt;code&gt;subagent_id&lt;/code&gt; é &lt;code&gt;null&lt;/code&gt; para o agente principal.&lt;/p&gt;

&lt;h2&gt;
  
  
  Implemente uso de computador com aprovação explícita
&lt;/h2&gt;

&lt;p&gt;O uso de computador fornece um navegador hospedado ao agente. Para habilitá-lo, adicione a ferramenta e um desktop ao ambiente hospedado:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"agent"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"gpt-6-astra"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"tools"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"computer_use"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
        &lt;/span&gt;&lt;span class="nl"&gt;"include_screenshots"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"environment"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"type"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"openai_hosted"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"desktop"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"enabled"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;true&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="nl"&gt;"network"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
      &lt;/span&gt;&lt;span class="nl"&gt;"access"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"enabled"&lt;/span&gt;&lt;span class="w"&gt;
    &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O navegador exige aprovação do usuário antes de visitar cada nova origem, inclusive sites públicos.&lt;/p&gt;

&lt;p&gt;Quando receber &lt;code&gt;agent.session.requires_action&lt;/code&gt;:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Recupere a sessão.&lt;/li&gt;
&lt;li&gt;Localize entradas &lt;code&gt;computer_use_approval_request&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Inspecione o &lt;code&gt;request.type&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Envie uma resposta pelo endpoint de eventos.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Há dois tipos de solicitação.&lt;/p&gt;

&lt;h3&gt;
  
  
  Aprovação de origem
&lt;/h3&gt;

&lt;p&gt;Para &lt;code&gt;browser_origin_access&lt;/code&gt;, mostre ao usuário:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;origin&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;reason&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Depois envie &lt;code&gt;approve&lt;/code&gt;, &lt;code&gt;deny&lt;/code&gt; ou &lt;code&gt;cancel&lt;/code&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Autenticação no navegador
&lt;/h3&gt;

&lt;p&gt;Para &lt;code&gt;browser_authentication&lt;/code&gt;, você recebe:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;campos de formulário em &lt;code&gt;fields&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;opções de login em &lt;code&gt;options&lt;/code&gt;, quando disponíveis;&lt;/li&gt;
&lt;li&gt;a origem da credencial em &lt;code&gt;credential_origin&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Envie &lt;code&gt;action: "submit"&lt;/code&gt; com os valores fornecidos pelo usuário ou &lt;code&gt;action: "cancel"&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Exemplo de aprovação de origem:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl &lt;span class="s2"&gt;"https://api.openai.com/v1/agents/sessions/&lt;/span&gt;&lt;span class="nv"&gt;$SESSION_ID&lt;/span&gt;&lt;span class="s2"&gt;/events"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"OpenAI-Beta: agents=v1"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "events": [
      {
        "type": "agent.session.input.computer_use_approval_request_result",
        "request_id": "REQUEST_ID",
        "response": {
          "type": "browser_origin_access",
          "decision": "approve"
        }
      }
    ]
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;O trabalho do navegador aparece nos itens como &lt;code&gt;computer_use_call&lt;/code&gt;. Cada item pode incluir:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;id&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;turn_id&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;title&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;status&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;output&lt;/code&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Com &lt;code&gt;include_screenshots&lt;/code&gt; ativado, &lt;code&gt;output&lt;/code&gt; pode carregar uma captura JPEG em base64. Não registre essas imagens em logs: elas podem conter dados de conta.&lt;/p&gt;

&lt;p&gt;O &lt;a href="https://developers.openai.com/api/docs/guides/agents-api/tools/computer-use" rel="noopener noreferrer"&gt;guia de uso de computador&lt;/a&gt; destaca estas restrições:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Aprovar uma origem não confirma ações individuais, como compras ou exclusões.&lt;/li&gt;
&lt;li&gt;Login cobre e-mail, senhas e códigos de verificação.&lt;/li&gt;
&lt;li&gt;Chaves de acesso e login por código QR não são suportados.&lt;/li&gt;
&lt;li&gt;Apenas o agente principal pode solicitar autenticação.&lt;/li&gt;
&lt;li&gt;Desative tentativas automáticas para envios de credenciais: &lt;code&gt;maxRetries: 0&lt;/code&gt; no SDK ou &lt;code&gt;--retry 0&lt;/code&gt; no &lt;code&gt;curl&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Uma resposta &lt;code&gt;202&lt;/code&gt; significa apenas que a solicitação foi aceita.&lt;/li&gt;
&lt;li&gt;Solicitações de autenticação expiram após cinco minutos.&lt;/li&gt;
&lt;li&gt;A aprovação de origem não substitui a política de rede: permita também domínios de redirecionamento em &lt;code&gt;network&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O resumo informa que o uso de computador é oferecido “através da API e no Codex e ChatGPT Work no Pro 500 e Enterprise”. Para testes baseados em UI com o mesmo modelo, veja &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-computer-use-api-testing?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Uso de computador GPT-6 Astra para testes de API&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Dê ao agente sua API, não sua UI
&lt;/h2&gt;

&lt;p&gt;Use o navegador como alternativa para sistemas que não têm API. Se o sistema é seu, prefira expô-lo por um servidor MCP.&lt;/p&gt;

&lt;p&gt;Isso oferece:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;ferramentas tipadas;&lt;/li&gt;
&lt;li&gt;resultados verificáveis;&lt;/li&gt;
&lt;li&gt;menos dependência de fluxos visuais;&lt;/li&gt;
&lt;li&gt;ausência de prompts de aprovação de origem para operações de API.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Leia &lt;a href="https://apidog.com/pt/blog/computer-use-vs-structured-apis?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Uso de computador vs APIs estruturadas&lt;/a&gt; para avaliar esse trade-off. O &lt;a href="https://apidog.com/pt/blog/apidog-mcp-server?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog MCP Server&lt;/a&gt; pode usar sua especificação de API como base para o assistente de codificação criar esse wrapper.&lt;/p&gt;

&lt;h2&gt;
  
  
  Teste a API Agents no Apidog antes de escrever código
&lt;/h2&gt;

&lt;p&gt;Como a API está em beta, valide manualmente a estrutura de cada chamada no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; antes de integrá-la à aplicação.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fmanc6vo56npfm0hb7wt8.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fmanc6vo56npfm0hb7wt8.png" alt="Interface do Apidog para testar a API Agents" width="799" height="530"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Crie um ambiente no Apidog com &lt;code&gt;OPENAI_API_KEY&lt;/code&gt;, &lt;code&gt;VAULT_ID&lt;/code&gt; e &lt;code&gt;SESSION_ID&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Envie &lt;code&gt;Bearer {{OPENAI_API_KEY}}&lt;/code&gt; e &lt;code&gt;OpenAI-Beta: agents=v1&lt;/code&gt; em todas as requisições.&lt;/li&gt;
&lt;li&gt;Crie a sessão sem &lt;code&gt;stream&lt;/code&gt;, valide um status &lt;code&gt;2xx&lt;/code&gt; e confirme que o campo &lt;code&gt;id&lt;/code&gt; não está vazio.&lt;/li&gt;
&lt;li&gt;Extraia o &lt;code&gt;id&lt;/code&gt; da resposta para &lt;code&gt;SESSION_ID&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Abra o stream de eventos em uma requisição SSE.&lt;/li&gt;
&lt;li&gt;Envie a entrada usando uma segunda requisição e acompanhe os eventos recebidos.&lt;/li&gt;
&lt;li&gt;Salve payloads de aprovação e cancelamento para reproduzir cenários de &lt;code&gt;required_actions&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Encadeie as requisições em um cenário de teste e execute-o em CI com o Apidog CLI.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/ai-agent-long-running-api-operations?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de teste de API de agente de IA&lt;/a&gt; inclui padrões de asserção para respostas não determinísticas. &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; para acompanhar.&lt;/p&gt;

&lt;h2&gt;
  
  
  Perguntas frequentes
&lt;/h2&gt;

&lt;h3&gt;
  
  
  A API OpenAI Agents é gratuita?
&lt;/h3&gt;

&lt;p&gt;Não há taxa de plataforma, mas você paga por tokens do modelo, chamadas de ferramentas e tempo de contêiner hospedado.&lt;/p&gt;

&lt;h3&gt;
  
  
  Quais modelos funcionam com a API Agents?
&lt;/h3&gt;

&lt;p&gt;Os exemplos da documentação, incluindo todos os exemplos de uso de computador, usam &lt;code&gt;gpt-6-astra&lt;/code&gt;. As páginas não listam outros modelos suportados, então teste seu modelo antes de adotar a integração.&lt;/p&gt;

&lt;h3&gt;
  
  
  A API Agents suporta Retenção Zero de Dados?
&lt;/h3&gt;

&lt;p&gt;Não. Ela oferece residência de dados apenas nos EUA e não é elegível para ZDR, mesmo com sandbox auto-hospedado.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual é a diferença entre o SDK Agents e a API Responses?
&lt;/h3&gt;

&lt;p&gt;O SDK executa o loop de agente dentro da sua aplicação. A API Responses é a chamada ao modelo em torno da qual você constrói seu próprio loop. Veja a &lt;a href="https://apidog.com/pt/blog/openai-agents-api-vs-responses-api-vs-agents-sdk?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;comparação completa&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Comece com uma sessão somente leitura
&lt;/h2&gt;

&lt;p&gt;Comece com um agente que apenas lê dados. Em seguida, adicione um servidor MCP. Só então habilite uso de computador, sempre atrás de um handler de aprovação que negue solicitações por padrão.&lt;/p&gt;

&lt;p&gt;Quando o ChatGPT precisar reagir a eventos emitidos pelo seu próprio servidor, use &lt;a href="https://apidog.com/pt/blog/mcp-events?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Eventos MCP&lt;/a&gt; como a peça de integração.&lt;/p&gt;

</description>
      <category>agents</category>
      <category>ai</category>
      <category>api</category>
      <category>openai</category>
    </item>
    <item>
      <title>GPT-6.1 Sol vs Claude Sonnet 5.5: Mesmos Preços ($2/$10), Lançados Quase Juntos e Sem Benchmark Comum</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Wed, 30 Sep 2026 05:02:57 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/gpt-61-sol-vs-claude-sonnet-55-mesmos-precos-210-lancados-quase-juntos-e-sem-benchmark-1idk</link>
      <guid>https://dev.to/lucas_ferreira/gpt-61-sol-vs-claude-sonnet-55-mesmos-precos-210-lancados-quase-juntos-e-sem-benchmark-1idk</guid>
      <description>&lt;p&gt;GPT-6.1 Sol e Claude Sonnet 5.5 custam US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Os lançamentos ocorreram com apenas um dia de diferença: Sonnet 5.5 em 28 de setembro de 2026 e GPT-6.1 Sol em 29 de setembro. Como nenhum fornecedor publicou um benchmark direto entre essas versões, a forma mais confiável de escolher é executar os dois modelos nas suas tarefas reais e comparar o custo por tarefa aprovada — não apenas o preço por token.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;Este guia reúne especificações, preços, benchmarks divulgados pelos fornecedores e dados de terceiros — que ainda avaliam o GPT-6 Sol, não o GPT-6.1 Sol. No final, você verá como montar uma comparação reproduzível no &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;. Para detalhes de cada modelo, consulte &lt;a href="https://apidog.com/pt/blog/what-is-gpt-6-1-sol?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é GPT-6.1 Sol&lt;/a&gt; e &lt;a href="https://apidog.com/pt/blog/what-is-claude-sonnet-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é Claude Sonnet 5.5&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  GPT-6.1 Sol vs Claude Sonnet 5.5: especificações e preços
&lt;/h2&gt;

&lt;p&gt;Fontes: &lt;a href="https://developers.openai.com/api/docs/pricing" rel="noopener noreferrer"&gt;página de preços&lt;/a&gt; da OpenAI, &lt;a href="https://platform.claude.com/docs/en/models/sonnet-5-5/overview" rel="noopener noreferrer"&gt;visão geral do Sonnet 5.5&lt;/a&gt; e &lt;a href="https://platform.claude.com/docs/en/about-claude/pricing" rel="noopener noreferrer"&gt;preços&lt;/a&gt; da Anthropic, além da página do modelo GPT-6.1 Sol.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;GPT-6.1 Sol&lt;/th&gt;
&lt;th&gt;Claude Sonnet 5.5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;ID do modelo&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gpt-6.1-sol&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;claude-sonnet-5-5&lt;/code&gt;&lt;br&gt;(Bedrock: &lt;code&gt;anthropic.claude-sonnet-5-5&lt;/code&gt;)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lançado&lt;/td&gt;
&lt;td&gt;29 de setembro de 2026&lt;/td&gt;
&lt;td&gt;28 de setembro de 2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada / saída por 1M&lt;/td&gt;
&lt;td&gt;US$ 2 / US$ 10&lt;/td&gt;
&lt;td&gt;US$ 2 / US$ 10&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Leituras de cache por 1M&lt;/td&gt;
&lt;td&gt;US$ 0,10&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Escritas de cache por 1M&lt;/td&gt;
&lt;td&gt;US$ 2,50&lt;/td&gt;
&lt;td&gt;US$ 2,50 (5 minutos), US$ 4 (1 hora)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lote por 1M&lt;/td&gt;
&lt;td&gt;US$ 1 / US$ 5&lt;/td&gt;
&lt;td&gt;US$ 1 / US$ 5&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Prompts acima de 272K tokens de entrada&lt;/td&gt;
&lt;td&gt;US$ 4 entrada, US$ 0,20 cache, US$ 15 saída para toda a requisição&lt;/td&gt;
&lt;td&gt;Sem taxa adicional na janela de 1M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Nível mais rápido&lt;/td&gt;
&lt;td&gt;Fast por US$ 4 / US$ 20; Ultrafast “em breve”&lt;/td&gt;
&lt;td&gt;Modo rápido não disponível&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Janela de contexto&lt;/td&gt;
&lt;td&gt;1.050.000 (922.000 de entrada máxima)&lt;/td&gt;
&lt;td&gt;1M&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Saída máxima&lt;/td&gt;
&lt;td&gt;128.000&lt;/td&gt;
&lt;td&gt;128K (300K em Lote com cabeçalho beta)&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Corte de conhecimento&lt;/td&gt;
&lt;td&gt;30 de abril de 2026&lt;/td&gt;
&lt;td&gt;Junho de 2026&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Níveis de esforço&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;low&lt;/code&gt;, &lt;code&gt;medium&lt;/code&gt; (padrão), &lt;code&gt;high&lt;/code&gt;, &lt;code&gt;xhigh&lt;/code&gt;, &lt;code&gt;max&lt;/code&gt;; sem &lt;code&gt;none&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;low&lt;/code&gt;, &lt;code&gt;medium&lt;/code&gt;, &lt;code&gt;high&lt;/code&gt; (padrão da API), &lt;code&gt;xhigh&lt;/code&gt;, &lt;code&gt;max&lt;/code&gt;; o pensamento não pode ser desativado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Formato da API&lt;/td&gt;
&lt;td&gt;Respostas com ferramentas, Conclusões de Chat sem ferramentas, Lote&lt;/td&gt;
&lt;td&gt;Mensagens, Lote&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Outras plataformas&lt;/td&gt;
&lt;td&gt;OpenRouter: &lt;code&gt;openai/gpt-6.1-sol&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Bedrock, Google Cloud, Microsoft Foundry, Claude Platform na AWS&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Acesso gratuito&lt;/td&gt;
&lt;td&gt;Nenhum. Plus, Pro, Business, Enterprise e Edu têm acesso no ChatGPT Work e Codex, conforme a &lt;a href="https://learn.chatgpt.com/docs/models" rel="noopener noreferrer"&gt;documentação dos modelos&lt;/a&gt;
&lt;/td&gt;
&lt;td&gt;Disponível para conversa em &lt;a href="http://Claude.ai" rel="noopener noreferrer"&gt;Claude.ai&lt;/a&gt;; a API cobra por token&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;h3&gt;
  
  
  Onde o preço realmente muda
&lt;/h3&gt;

&lt;p&gt;Há dois pontos que afetam diretamente o custo:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Cache abaixo de 272K tokens de entrada&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
As leituras de cache do GPT-6.1 Sol custam metade das do Sonnet 5.5. Se sua aplicação reutiliza um prompt de sistema longo, instruções fixas ou documentos estáveis, a OpenAI pode ter custo menor.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Prompts acima de 272K tokens de entrada&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
O cenário se inverte. Segundo a &lt;a href="https://developers.openai.com/api/docs/models/gpt-6.1-sol" rel="noopener noreferrer"&gt;página do modelo GPT-6.1 Sol&lt;/a&gt;, a requisição inteira passa a usar 2x as taxas de entrada e cache e 1,5x a taxa de saída. O Sonnet 5.5 mantém as taxas de US$ 2 e US$ 10.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Por exemplo, sem cache, um prompt de 400.000 tokens com resposta de 5.000 tokens custa aproximadamente:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;GPT-6.1 Sol:&lt;/strong&gt; US$ 1,68&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Claude Sonnet 5.5:&lt;/strong&gt; US$ 0,85&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Preço de tabela não basta: o consumo de tokens e a taxa de aprovação por tarefa definem o custo efetivo.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que cada fornecedor afirma — e contra qual modelo
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;&lt;/th&gt;
&lt;th&gt;OpenAI sobre GPT-6.1 Sol&lt;/th&gt;
&lt;th&gt;Anthropic sobre Claude Sonnet 5.5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Comparado com&lt;/td&gt;
&lt;td&gt;GPT-6 Sol, GPT-6 Astra, Claude Opus 5.5, Claude Fable 5.1&lt;/td&gt;
&lt;td&gt;Sonnet 5, Opus 5.5, GPT-6 Sol&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Inclui o outro modelo&lt;/td&gt;
&lt;td&gt;Não&lt;/td&gt;
&lt;td&gt;Não; GPT-6.1 Sol ainda não existia&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Manchete&lt;/td&gt;
&lt;td&gt;“Inteligência próxima à Astra” por um quinto do preço padrão de tokens da Astra&lt;/td&gt;
&lt;td&gt;Mais de 30% mais rápido que Sonnet 5, com até 30% menos custo por tarefa&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Quem realizou os testes&lt;/td&gt;
&lt;td&gt;OpenAI; resultados de concorrentes vieram de relatórios públicos, conforme nota de rodapé&lt;/td&gt;
&lt;td&gt;Anthropic, Cognition, Cursor, Artificial Analysis e Surge AI, dependendo do benchmark&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;A &lt;a href="https://openai.com/index/introducing-gpt-6-1-sol/" rel="noopener noreferrer"&gt;postagem de lançamento do GPT-6.1 Sol&lt;/a&gt; apresenta os seguintes resultados:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;AutomationBench 1.0.6, esforço médio:&lt;/strong&gt; +2,2 pontos percentuais sobre o Opus 5.5 por aproximadamente um terço do custo, além de +4,8 pp sobre o GPT-6 Sol.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Terminal-Bench Science 0.1, esforço máximo:&lt;/strong&gt; US$ 5,47 por tarefa, contra US$ 23,21 do Opus 5.5. O GPT-6 Astra ainda tem pontuação superior, com 68,1%.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;OSWorld 2.0 offline, esforço máximo:&lt;/strong&gt; +7 pp sobre o GPT-6 Sol por menos da metade do custo.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A &lt;a href="https://www.anthropic.com/claude-sonnet-5-5" rel="noopener noreferrer"&gt;postagem de lançamento do Sonnet 5.5&lt;/a&gt; inclui o GPT-6 Sol como referência:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;FrontierCode 1.1, executado pela Cognition:&lt;/strong&gt; Sonnet 5.5 alcança 52,1% em &lt;code&gt;xhigh&lt;/code&gt; e 46,2% em &lt;code&gt;max&lt;/code&gt;, contra 49,3% do GPT-6 Sol. Em esforço alto, a Anthropic afirma que o Sonnet 5.5 iguala a melhor pontuação do GPT-6 Sol por cerca de um quinto do custo.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;GDPval-AA v2.1 e AA-Briefcase v1.1, executados pela Artificial Analysis:&lt;/strong&gt; 1844 contra 1487 e 1811 contra 1483, respectivamente.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A &lt;a href="https://apidog.com/pt/blog/claude-sonnet-5-5-benchmarks?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;análise dos benchmarks do Sonnet 5.5&lt;/a&gt; cobre o restante da tabela publicada pela Anthropic.&lt;/p&gt;

&lt;h3&gt;
  
  
  Por que não fazer uma comparação indireta?
&lt;/h3&gt;

&lt;p&gt;É tentador usar o Opus 5.5 como ponte, porque ambos os fornecedores citam AutomationBench e Terminal-Bench Science. Mas os ambientes e configurações não são equivalentes:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;A OpenAI relata AutomationBench 1.0.6 com esforço médio no próprio ambiente.&lt;/li&gt;
&lt;li&gt;A tabela do cartão de sistema da Anthropic executa Claude com esforço máximo.&lt;/li&gt;
&lt;li&gt;A Anthropic informa Sonnet 5.5 em 59,9% no Terminal-Bench Science, mas a OpenAI não publica uma pontuação bruta equivalente para GPT-6.1 Sol.&lt;/li&gt;
&lt;li&gt;A OpenAI usou OSWorld 2.0 offline; a Anthropic usou OSWorld 2.1.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A &lt;a href="https://apidog.com/pt/blog/gpt-6-sol-vs-claude-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;comparação GPT-6 Sol vs Claude Opus 5.5&lt;/a&gt; encontrou a mesma limitação: benchmarks com nomes semelhantes não são necessariamente comparáveis.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que terceiros mediram no GPT-6 Sol, não no 6.1
&lt;/h2&gt;

&lt;p&gt;As comparações independentes disponíveis ainda emparelham Sonnet 5.5 com o GPT-6 Sol anterior. A mais abrangente é da &lt;a href="https://artificialanalysis.ai/models/releases/comparisons/claude-sonnet-5-5-vs-gpt-6-sol" rel="noopener noreferrer"&gt;Artificial Analysis&lt;/a&gt;, cujo Intelligence Index v4.3.2 agrega 10 avaliações.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Esforço&lt;/th&gt;
&lt;th&gt;Índice Sonnet 5.5&lt;/th&gt;
&lt;th&gt;Sonnet 5.5: custo por tarefa&lt;/th&gt;
&lt;th&gt;Índice GPT-6 Sol&lt;/th&gt;
&lt;th&gt;GPT-6 Sol: custo por tarefa&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Médio&lt;/td&gt;
&lt;td&gt;41&lt;/td&gt;
&lt;td&gt;US$ 0,59&lt;/td&gt;
&lt;td&gt;40&lt;/td&gt;
&lt;td&gt;US$ 0,25&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Alto&lt;/td&gt;
&lt;td&gt;47&lt;/td&gt;
&lt;td&gt;US$ 1,08&lt;/td&gt;
&lt;td&gt;43&lt;/td&gt;
&lt;td&gt;US$ 0,38&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Xhigh&lt;/td&gt;
&lt;td&gt;52&lt;/td&gt;
&lt;td&gt;US$ 2,74&lt;/td&gt;
&lt;td&gt;44&lt;/td&gt;
&lt;td&gt;US$ 0,52&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Máximo&lt;/td&gt;
&lt;td&gt;56&lt;/td&gt;
&lt;td&gt;US$ 7,60&lt;/td&gt;
&lt;td&gt;48&lt;/td&gt;
&lt;td&gt;US$ 1,05&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;No esforço máximo, a mesma página mede:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Sonnet 5.5:&lt;/strong&gt; 138 tokens de saída por segundo&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;GPT-6 Sol:&lt;/strong&gt; 76 tokens de saída por segundo&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O Sonnet 5.5 teve pontuação mais alta e custo maior por tarefa em todos os níveis exibidos, apesar de os preços por token serem idênticos. A diferença é o número de tokens consumidos durante a execução.&lt;/p&gt;

&lt;p&gt;Um exemplo útil: o Sonnet 5.5 em esforço alto registrou índice 47 por US$ 1,08 por tarefa, enquanto o GPT-6 Sol em esforço máximo alcançou 48 por US$ 1,05.&lt;/p&gt;

&lt;p&gt;Os próprios gráficos da Anthropic mostram esse trade-off:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;No &lt;strong&gt;AA-Briefcase&lt;/strong&gt;, o GPT-6 Sol custa menos por tarefa em todos os níveis — US$ 0,34 contra US$ 1,64 em médio — enquanto o Sonnet 5.5 pontua mais alto.&lt;/li&gt;
&lt;li&gt;No &lt;strong&gt;FrontierCode&lt;/strong&gt;, Sonnet 5.5 em alto atinge 49,4% por US$ 0,42 por tarefa, contra 49,3% do GPT-6 Sol em máximo por US$ 2,07.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Esses dados se referem ao GPT-6 Sol, não ao GPT-6.1 Sol. A OpenAI afirma que o GPT-6.1 Sol supera o GPT-6 Sol com esforço igual ou menor em vários benchmarks, mas será necessário aguardar medições independentes.&lt;/p&gt;

&lt;h2&gt;
  
  
  Onde cada modelo tende a ser mais forte
&lt;/h2&gt;

&lt;h3&gt;
  
  
  GPT-6.1 Sol
&lt;/h3&gt;

&lt;p&gt;A OpenAI posiciona o GPT-6.1 Sol para codificação complexa, uso de computador e trabalho profissional que exige desempenho próximo ao Astra com menor custo.&lt;/p&gt;

&lt;p&gt;Pontos destacados pelo fornecedor:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Automação agêntica;&lt;/li&gt;
&lt;li&gt;Uso de computador;&lt;/li&gt;
&lt;li&gt;Tarefas científicas;&lt;/li&gt;
&lt;li&gt;Menos erros factuais em esforço baixo;&lt;/li&gt;
&lt;li&gt;Cargas de trabalho com cache intenso abaixo de 272K tokens de entrada;&lt;/li&gt;
&lt;li&gt;Opção de velocidade paga com o nível Fast.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  Claude Sonnet 5.5
&lt;/h3&gt;

&lt;p&gt;A Anthropic posiciona o Sonnet 5.5 para tarefas cotidianas bem definidas, correção de bugs e criação ou melhoria de documentos, slides e planilhas.&lt;/p&gt;

&lt;p&gt;Pontos destacados pelo fornecedor:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Codificação agêntica;&lt;/li&gt;
&lt;li&gt;Trabalho de conhecimento;&lt;/li&gt;
&lt;li&gt;Uso de computador;&lt;/li&gt;
&lt;li&gt;70,6% no Terminal-Bench 4.0 em &lt;code&gt;max&lt;/code&gt;, executado pela Anthropic;&lt;/li&gt;
&lt;li&gt;80,1% parcial no OSWorld 2.1;&lt;/li&gt;
&lt;li&gt;Prompts acima de 272K tokens;&lt;/li&gt;
&lt;li&gt;Disponibilidade em Bedrock, Google Cloud e Microsoft Foundry.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;A Anthropic afirma que o Opus 5.5 continua mais forte em trabalhos complexos e abertos. Veja a comparação &lt;a href="https://apidog.com/pt/blog/claude-sonnet-5-5-vs-opus-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Sonnet 5.5 vs Opus 5.5&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Controle esforço e variância
&lt;/h3&gt;

&lt;p&gt;Dois detalhes podem invalidar uma comparação rápida:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Os padrões de esforço são diferentes&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
O GPT-6.1 Sol usa &lt;code&gt;medium&lt;/code&gt; como padrão; o Sonnet 5.5 usa &lt;code&gt;high&lt;/code&gt; como padrão na API. Compare pares correspondentes, como &lt;code&gt;medium&lt;/code&gt; vs &lt;code&gt;medium&lt;/code&gt; e &lt;code&gt;high&lt;/code&gt; vs &lt;code&gt;high&lt;/code&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;li&gt;&lt;p&gt;&lt;strong&gt;Controles de amostragem não devem ser usados como variável principal&lt;/strong&gt;&lt;br&gt;&lt;br&gt;
O Sonnet 5.5 retorna erro 400 para valores não padrão de &lt;code&gt;temperature&lt;/code&gt;, &lt;code&gt;top_p&lt;/code&gt; ou &lt;code&gt;top_k&lt;/code&gt;. A &lt;a href="https://developers.openai.com/api/docs/guides/latest-model" rel="noopener noreferrer"&gt;orientação do GPT-6&lt;/a&gt; recomenda diminuir &lt;code&gt;temperature&lt;/code&gt; e &lt;code&gt;top_p&lt;/code&gt; quando o esforço não for &lt;code&gt;none&lt;/code&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Para medir variância, execute cada tarefa mais de uma vez e registre taxa de aprovação, tokens, latência e custo.&lt;/p&gt;

&lt;h2&gt;
  
  
  Execute a comparação no Apidog
&lt;/h2&gt;

&lt;p&gt;Use de 20 a 50 tarefas do seu tráfego real. Priorize tarefas com resultado verificável, por exemplo:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;geração de JSON válido;&lt;/li&gt;
&lt;li&gt;classificação com rótulo esperado;&lt;/li&gt;
&lt;li&gt;extração estruturada;&lt;/li&gt;
&lt;li&gt;testes de código;&lt;/li&gt;
&lt;li&gt;validação de campos obrigatórios;&lt;/li&gt;
&lt;li&gt;resolução de tickets com critérios de aceite.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  1. Crie o ambiente
&lt;/h3&gt;

&lt;p&gt;No &lt;a href="https://apidog.com?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, crie um ambiente com estes segredos:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;OPENAI_API_KEY
ANTHROPIC_API_KEY
EFFORT
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Mantenha chaves de API fora das requisições e use variáveis de ambiente.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. Salve uma requisição para cada fornecedor
&lt;/h3&gt;

&lt;p&gt;As APIs têm formatos diferentes. Consulte a &lt;a href="https://developers.openai.com/api/reference/resources/responses/methods/create" rel="noopener noreferrer"&gt;referência de Respostas&lt;/a&gt; da OpenAI e a &lt;a href="https://platform.claude.com/docs/en/api/messages" rel="noopener noreferrer"&gt;referência de Mensagens&lt;/a&gt; da Anthropic. A &lt;a href="https://apidog.com/pt/blog/deepseek-v4-pro-api-formats-compared?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;comparação de formatos de API&lt;/a&gt; explica por que essa diferença importa.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;OpenAI Responses API&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{
  "model": "gpt-6.1-sol",
  "reasoning": {
    "effort": "{{EFFORT}}"
  },
  "max_output_tokens": 25000,
  "input": "{{prompt}}"
}
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;&lt;strong&gt;Anthropic Messages API&lt;/strong&gt;&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{
  "model": "claude-sonnet-5-5",
  "max_tokens": 25000,
  "output_config": {
    "effort": "{{EFFORT}}"
  },
  "messages": [
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ]
}
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  3. Adicione asserções de resposta e qualidade
&lt;/h3&gt;

&lt;p&gt;Valide primeiro se a API concluiu normalmente. Depois, valide o resultado contra uma coluna &lt;code&gt;expected&lt;/code&gt; do seu CSV ou dataset.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Verificação&lt;/th&gt;
&lt;th&gt;OpenAI Responses&lt;/th&gt;
&lt;th&gt;Anthropic Messages&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Finalizado normalmente&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;$.status&lt;/code&gt; igual a &lt;code&gt;completed&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;$.stop_reason&lt;/code&gt; igual a &lt;code&gt;end_turn&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Resposta presente&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;$.output[*].type&lt;/code&gt; contém &lt;code&gt;message&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;$.content[*].type&lt;/code&gt; contém &lt;code&gt;text&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tokens de saída, incluindo raciocínio&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.output_tokens&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.output_tokens&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Leituras de cache&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.input_tokens_details.cached_tokens&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.cache_read_input_tokens&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Escritas de cache&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.input_tokens_details.cache_write_tokens&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;&lt;code&gt;$.usage.cache_creation_input_tokens&lt;/code&gt;&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Para resultados estruturados, uma asserção prática pode verificar:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;campo obrigatório presente;&lt;/li&gt;
&lt;li&gt;JSON válido;&lt;/li&gt;
&lt;li&gt;valor igual ao esperado;&lt;/li&gt;
&lt;li&gt;expressão regular;&lt;/li&gt;
&lt;li&gt;tempo máximo de resposta;&lt;/li&gt;
&lt;li&gt;ausência de campos proibidos.&lt;/li&gt;
&lt;/ul&gt;

&lt;h3&gt;
  
  
  4. Calcule o custo de cada resposta
&lt;/h3&gt;

&lt;p&gt;Use um script pós-processador ou exporte os dados de uso para calcular o custo.&lt;/p&gt;

&lt;p&gt;Para a OpenAI:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;input_tokens&lt;/code&gt; inclui tokens em cache e tokens de escrita de cache;&lt;/li&gt;
&lt;li&gt;subtraia esses valores antes de aplicar a taxa padrão de US$ 2 por milhão;&lt;/li&gt;
&lt;li&gt;aplique as taxas de cache separadamente;&lt;/li&gt;
&lt;li&gt;aplique a regra de entrada acima de 272K tokens.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Consulte a documentação de &lt;a href="https://developers.openai.com/api/docs/guides/prompt-caching" rel="noopener noreferrer"&gt;cache de prompt da OpenAI&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Para a Anthropic:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;input_tokens&lt;/code&gt; conta apenas os tokens após o último ponto de interrupção do cache;&lt;/li&gt;
&lt;li&gt;use &lt;code&gt;cache_read_input_tokens&lt;/code&gt; e &lt;code&gt;cache_creation_input_tokens&lt;/code&gt; para calcular leituras e escritas de cache.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Consulte a documentação de &lt;a href="https://platform.claude.com/docs/en/build-with-claude/prompt-caching" rel="noopener noreferrer"&gt;cache de prompt da Anthropic&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  5. Execute o cenário com o CSV
&lt;/h3&gt;

&lt;p&gt;Adicione ambas as requisições a um cenário de teste. Mantenha os prompts em uma única linha e sem aspas duplas no CSV.&lt;/p&gt;

&lt;p&gt;Exemplo de &lt;code&gt;prompts.csv&lt;/code&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;prompt,expected
Classifique o sentimento: excelente produto,positivo
Classifique o sentimento: atendimento ruim,negativo
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Execute o cenário pela CLI do Apidog:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;apidog run &lt;span class="nt"&gt;--access-token&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$APIDOG_ACCESS_TOKEN&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="nt"&gt;-t&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$SCENARIO_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="nt"&gt;-e&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$ENV_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; prompts.csv &lt;span class="nt"&gt;--env-var&lt;/span&gt; &lt;span class="s2"&gt;"EFFORT=medium"&lt;/span&gt; &lt;span class="nt"&gt;-r&lt;/span&gt; cli,junit
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Repita a execução para cada nível de esforço relevante:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="c"&gt;# GPT-6.1 Sol e Sonnet 5.5 em medium&lt;/span&gt;
&lt;span class="nt"&gt;--env-var&lt;/span&gt; &lt;span class="s2"&gt;"EFFORT=medium"&lt;/span&gt;

&lt;span class="c"&gt;# GPT-6.1 Sol e Sonnet 5.5 em high&lt;/span&gt;
&lt;span class="nt"&gt;--env-var&lt;/span&gt; &lt;span class="s2"&gt;"EFFORT=high"&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h3&gt;
  
  
  6. Compare custo por tarefa aprovada
&lt;/h3&gt;

&lt;p&gt;Use esta fórmula:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;custo por tarefa aprovada = gasto total / número de tarefas aprovadas
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Registre ao menos estas métricas por modelo e nível de esforço:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Métrica&lt;/th&gt;
&lt;th&gt;Por que medir&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Taxa de aprovação&lt;/td&gt;
&lt;td&gt;Mede qualidade útil&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Custo total&lt;/td&gt;
&lt;td&gt;Mede gasto real&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Custo por tarefa aprovada&lt;/td&gt;
&lt;td&gt;Normaliza qualidade e custo&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tokens de entrada e saída&lt;/td&gt;
&lt;td&gt;Explica diferenças de custo&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Uso de cache&lt;/td&gt;
&lt;td&gt;Mostra o impacto do prompt reutilizado&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Latência&lt;/td&gt;
&lt;td&gt;Ajuda em fluxos interativos ou síncronos&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Taxa de erro&lt;/td&gt;
&lt;td&gt;Identifica falhas de API ou formato&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Execute pelo menos &lt;code&gt;medium&lt;/code&gt; e &lt;code&gt;high&lt;/code&gt; em ambos os modelos. O mesmo nome de esforço não representa necessariamente o mesmo nível de raciocínio entre fornecedores.&lt;/p&gt;

&lt;p&gt;Para detalhes adicionais, consulte o &lt;a href="https://apidog.com/pt/blog/gpt-6-1-sol-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API GPT-6.1 Sol&lt;/a&gt; e &lt;a href="https://apidog.com/pt/blog/how-to-use-claude-sonnet-5-5-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;como usar a API Claude Sonnet 5.5&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  O GPT-6.1 Sol é mais barato que o Claude Sonnet 5.5?
&lt;/h3&gt;

&lt;p&gt;O preço de tabela é o mesmo: US$ 2 por 1M tokens de entrada e US$ 10 por 1M tokens de saída. O GPT-6.1 Sol tem leituras de cache mais baratas, enquanto o Sonnet 5.5 é mais barato para entradas acima de 272K tokens. O custo real depende dos tokens usados e da taxa de aprovação por tarefa.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual é melhor para codificação?
&lt;/h3&gt;

&lt;p&gt;Não existe benchmark compartilhado entre GPT-6.1 Sol e Claude Sonnet 5.5. A Anthropic relata Sonnet 5.5 acima do GPT-6 Sol no FrontierCode. A OpenAI relata que GPT-6.1 Sol supera a melhor pontuação DeepSWE do GPT-6 Sol em 6,4 pp. Teste ambos no seu repositório, pipeline de CI e tarefas reais.&lt;/p&gt;

&lt;h3&gt;
  
  
  Qual é mais rápido?
&lt;/h3&gt;

&lt;p&gt;A Artificial Analysis mediu 138 tokens por segundo para Sonnet 5.5 e 76 para GPT-6 Sol, ambos em esforço máximo. Ainda não há números independentes equivalentes para GPT-6.1 Sol.&lt;/p&gt;

&lt;h3&gt;
  
  
  Algum dos dois é gratuito?
&lt;/h3&gt;

&lt;p&gt;O GPT-6.1 Sol não tem nível gratuito de API. O Sonnet 5.5 está disponível nos aplicativos de chat &lt;a href="http://Claude.ai" rel="noopener noreferrer"&gt;Claude.ai&lt;/a&gt;, mas a API cobra por token. Veja &lt;a href="https://apidog.com/pt/blog/how-to-use-claude-sonnet-5-5-for-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;como usar o Claude Sonnet 5.5 gratuitamente&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Escolha executando ambos
&lt;/h2&gt;

&lt;p&gt;Pegue dez tarefas do seu backlog e execute os dois modelos em &lt;code&gt;medium&lt;/code&gt; e &lt;code&gt;high&lt;/code&gt;. Compare:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;tarefas aprovadas;&lt;/li&gt;
&lt;li&gt;custo total;&lt;/li&gt;
&lt;li&gt;custo por tarefa aprovada;&lt;/li&gt;
&lt;li&gt;latência;&lt;/li&gt;
&lt;li&gt;consumo de tokens;&lt;/li&gt;
&lt;li&gt;comportamento com cache.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Use o &lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; para salvar esse par de requisições como um cenário reutilizável. Assim, você pode repetir o teste quando a Artificial Analysis publicar dados do GPT-6.1 Sol ou quando qualquer fornecedor lançar um novo snapshot.&lt;/p&gt;

</description>
    </item>
    <item>
      <title>Como usar GPT-6.1 Sol API?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Wed, 30 Sep 2026 05:02:07 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/como-usar-gpt-61-sol-api-4plg</link>
      <guid>https://dev.to/lucas_ferreira/como-usar-gpt-61-sol-api-4plg</guid>
      <description>&lt;p&gt;Para chamar a API GPT-6.1 Sol, envie uma requisição &lt;code&gt;POST&lt;/code&gt; para &lt;code&gt;https://api.openai.com/v1/responses&lt;/code&gt; com &lt;code&gt;"model": "gpt-6.1-sol"&lt;/code&gt; e sua chave como token Bearer. O preço permanece em US$ 2 de entrada e US$ 10 de saída por milhão de tokens, como no GPT-6 Sol. A diferença de custo está na entrada em cache, que cai de US$ 0,20 para US$ 0,10. Na maioria dos casos, a migração de &lt;code&gt;gpt-6-sol&lt;/code&gt; é uma troca de string, mas há uma quebra importante: GPT-6.1 Sol não aceita &lt;code&gt;none&lt;/code&gt; nem &lt;code&gt;minimal&lt;/code&gt; em &lt;code&gt;reasoning.effort&lt;/code&gt;; use &lt;code&gt;low&lt;/code&gt; e reavalie os fluxos que dependiam de &lt;code&gt;none&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;A OpenAI lançou o GPT-6.1 Sol no DevDay em 29 de setembro de 2026. O &lt;a href="https://apidog.com/pt/blog/openai-devday-2026?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;resumo do DevDay 2026&lt;/a&gt; cobre os demais lançamentos, enquanto &lt;a href="https://apidog.com/pt/blog/what-is-gpt-6-1-sol?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é o GPT-6.1 Sol&lt;/a&gt; detalha os benchmarks. Neste guia, você vai criar a primeira requisição, escolher um nível de esforço, aplicar as mudanças de migração, entender Batch, Flex e Fast e executar regressões lado a lado no &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt; antes de alterar o tráfego de produção.&lt;/p&gt;

&lt;h2&gt;
  
  
  GPT-6 Sol vs GPT-6.1 Sol: o que muda na API
&lt;/h2&gt;

&lt;p&gt;A maior parte da especificação é idêntica. A comparação abaixo consolida as diferenças entre a &lt;a href="https://developers.openai.com/api/docs/models/gpt-6.1-sol" rel="noopener noreferrer"&gt;página do modelo GPT-6.1 Sol&lt;/a&gt;, a &lt;a href="https://developers.openai.com/api/docs/models/gpt-6-sol" rel="noopener noreferrer"&gt;página do GPT-6 Sol&lt;/a&gt; e a &lt;a href="https://developers.openai.com/api/docs/guides/latest-model" rel="noopener noreferrer"&gt;orientação de migração Usando GPT-6&lt;/a&gt; da OpenAI.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Item&lt;/th&gt;
&lt;th&gt;&lt;code&gt;gpt-6-sol&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;&lt;code&gt;gpt-6.1-sol&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;Ação&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Entrada / saída por 1M de tokens, Standard&lt;/td&gt;
&lt;td&gt;US$ 2 / US$ 10&lt;/td&gt;
&lt;td&gt;US$ 2 / US$ 10&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrada em cache por 1M&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;td&gt;US$ 0,10&lt;/td&gt;
&lt;td&gt;Recalcule os custos de cache&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Escritas de cache por 1M&lt;/td&gt;
&lt;td&gt;US$ 2,50&lt;/td&gt;
&lt;td&gt;US$ 2,50&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Janela de contexto / entrada máxima / saída máxima&lt;/td&gt;
&lt;td&gt;1.050.000 / 922.000 / 128.000&lt;/td&gt;
&lt;td&gt;1.050.000 / 922.000 / 128.000&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Corte de conhecimento&lt;/td&gt;
&lt;td&gt;20 de abril de 2026&lt;/td&gt;
&lt;td&gt;30 de abril de 2026&lt;/td&gt;
&lt;td&gt;Reexecute avaliações sensíveis à data&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;reasoning.effort&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;none&lt;/code&gt;, &lt;code&gt;low&lt;/code&gt;, &lt;code&gt;medium&lt;/code&gt;, &lt;code&gt;high&lt;/code&gt;, &lt;code&gt;xhigh&lt;/code&gt;, &lt;code&gt;max&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;low&lt;/code&gt;, &lt;code&gt;medium&lt;/code&gt;, &lt;code&gt;high&lt;/code&gt;, &lt;code&gt;xhigh&lt;/code&gt;, &lt;code&gt;max&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Migre &lt;code&gt;none&lt;/code&gt; para &lt;code&gt;low&lt;/code&gt; e avalie&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Chamada de função em Chat Completions&lt;/td&gt;
&lt;td&gt;Apenas com &lt;code&gt;reasoning_effort: "none"&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Não suportado&lt;/td&gt;
&lt;td&gt;Migre ferramentas para Responses&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Endpoints&lt;/td&gt;
&lt;td&gt;Chat Completions, Responses, Batch&lt;/td&gt;
&lt;td&gt;Os mesmos&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Limites de taxa&lt;/td&gt;
&lt;td&gt;Nível 1: 500 RPM / 500K TPM; Nível 5: 15.000 RPM / 40M TPM&lt;/td&gt;
&lt;td&gt;Os mesmos&lt;/td&gt;
&lt;td&gt;Nenhuma&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;A página do GPT-6 Sol agora direciona leitores ao GPT-6.1 Sol como o modelo Sol mais recente.&lt;/p&gt;

&lt;h2&gt;
  
  
  Envie sua primeira requisição GPT-6.1 Sol
&lt;/h2&gt;

&lt;p&gt;Exporte sua chave como &lt;code&gt;OPENAI_API_KEY&lt;/code&gt; e chame a &lt;a href="https://developers.openai.com/api/reference/resources/responses/methods/create" rel="noopener noreferrer"&gt;API Responses&lt;/a&gt;:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://api.openai.com/v1/responses &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$OPENAI_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gpt-6.1-sol",
    "reasoning": {"effort": "medium"},
    "input": "List three ways a webhook retry policy can create duplicate orders. One line each."
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Com o SDK Python, use a mesma variável de ambiente:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;()&lt;/span&gt;

&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;responses&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gpt-6.1-sol&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;reasoning&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;effort&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;medium&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;List three ways a webhook retry policy can create duplicate orders. One line each.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;

&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;output_text&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Ao processar a resposta, verifique estes quatro pontos:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;status&lt;/code&gt;&lt;/strong&gt;: em caso de sucesso, o valor é &lt;code&gt;completed&lt;/code&gt;. Se o modelo atingir o orçamento de saída, a resposta pode vir como &lt;code&gt;incomplete&lt;/code&gt;, com &lt;code&gt;incomplete_details.reason&lt;/code&gt; definido como &lt;code&gt;max_output_tokens&lt;/code&gt;, às vezes antes de haver texto visível. O &lt;a href="https://developers.openai.com/api/docs/guides/reasoning" rel="noopener noreferrer"&gt;guia de raciocínio&lt;/a&gt; sugere reservar pelo menos 25.000 tokens para raciocínio e saída durante os testes.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;output&lt;/code&gt;&lt;/strong&gt;: é um array. Localize o item com &lt;code&gt;type: "message"&lt;/code&gt; e extraia o conteúdo &lt;code&gt;output_text&lt;/code&gt;. Não dependa de um índice fixo.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;usage.output_tokens&lt;/code&gt;&lt;/strong&gt;: inclui tokens de raciocínio, cobrados na taxa de saída. Use &lt;code&gt;usage.output_tokens_details.reasoning_tokens&lt;/code&gt; para separá-los.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;&lt;code&gt;usage.input_tokens_details&lt;/code&gt;&lt;/strong&gt;: informa &lt;code&gt;cached_tokens&lt;/code&gt; e &lt;code&gt;cache_write_tokens&lt;/code&gt;. Esses campos mostram o impacto do cache no custo.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Use a API Responses em fluxos com ferramentas. O GPT-6.1 Sol suporta Chat Completions apenas em requisições sem ferramentas. Veja também o &lt;a href="https://apidog.com/pt/blog/openai-responses-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Responses&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Escolha um nível de esforço de raciocínio
&lt;/h2&gt;

&lt;p&gt;&lt;code&gt;reasoning.effort&lt;/code&gt; é o principal seletor de custo, latência e qualidade. Se você omitir o campo, o padrão é &lt;code&gt;medium&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;O &lt;a href="https://developers.openai.com/api/docs/guides/model-selection" rel="noopener noreferrer"&gt;guia de seleção de modelos&lt;/a&gt; associa &lt;code&gt;medium&lt;/code&gt; a trabalho técnico complexo e entregas coordenadas que serão revisadas. Já &lt;code&gt;xhigh&lt;/code&gt; é indicado para entregas mais polidas e decisões baseadas em evidências conflitantes.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Esforço&lt;/th&gt;
&lt;th&gt;Comece aqui para&lt;/th&gt;
&lt;th&gt;O que a OpenAI relata para GPT-6.1 Sol&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;low&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Chat, extração, classificação e cargas que usavam &lt;code&gt;none&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Em conversas sinalizadas por usuários, respostas com erro factual caem de 11,4% para 7,7% em relação ao GPT-6 Sol&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;medium&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Automações com agentes e chamadas de ferramentas&lt;/td&gt;
&lt;td&gt;AutomationBench 1.0.6: +2,2 pp sobre Claude Opus 5.5 por aproximadamente um terço do custo; +4,8 pp sobre GPT-6 Sol na mesma configuração&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;high&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Depuração difícil e planejamento aprofundado&lt;/td&gt;
&lt;td&gt;Nenhuma afirmação específica por configuração&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;xhigh&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Entregas polidas e execuções assíncronas longas&lt;/td&gt;
&lt;td&gt;Nenhuma afirmação específica por configuração&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;max&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Uso de computador e tarefas científicas complexas&lt;/td&gt;
&lt;td&gt;OSWorld 2.0: +7 pp sobre GPT-6 Sol no máximo por menos da metade do custo; Terminal-Bench Science 0.1: US$ 5,47 por tarefa, contra US$ 23,21 para Opus 5.5 e US$ 23,80 para GPT-6 Astra&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Os benchmarks são relatados pela OpenAI na &lt;a href="https://openai.com/index/introducing-gpt-6-1-sol/" rel="noopener noreferrer"&gt;publicação de lançamento&lt;/a&gt;. Considere duas ressalvas:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;O conjunto de fatos usa conversas previamente sinalizadas por erro, não tráfego típico.&lt;/li&gt;
&lt;li&gt;No Terminal-Bench Science, o GPT-6 Astra ainda pontua mais alto, com 68,1%. Para trabalho científico mais difícil, a OpenAI recomenda Astra.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Para chamadas sensíveis à latência que usavam &lt;code&gt;none&lt;/code&gt;, comece com &lt;code&gt;low&lt;/code&gt; e meça resultados, custo e tempo de resposta. O guia de raciocínio descreve &lt;code&gt;low&lt;/code&gt; como raciocínio eficiente com aumento modesto de latência.&lt;/p&gt;

&lt;p&gt;Para alterar o esforço no meio de uma conversa sem quebrar o cache de prompts, adicione um item de entrada &lt;code&gt;configuration_update&lt;/code&gt; em vez de alterar &lt;code&gt;reasoning.effort&lt;/code&gt; no nível da requisição.&lt;/p&gt;

&lt;h2&gt;
  
  
  Migrar de &lt;code&gt;gpt-6-sol&lt;/code&gt;: quatro mudanças no código
&lt;/h2&gt;

&lt;h3&gt;
  
  
  1. Troque o ID do modelo
&lt;/h3&gt;

&lt;p&gt;Mantenha o modelo em configuração ou variável de ambiente para facilitar rollback:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;&lt;span class="nv"&gt;OPENAI_MODEL&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;gpt-6.1-sol
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;No código:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;os&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;environ&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;OPENAI_MODEL&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Assim, voltar para &lt;code&gt;gpt-6-sol&lt;/code&gt; exige apenas uma alteração de configuração.&lt;/p&gt;

&lt;h3&gt;
  
  
  2. Remapeie &lt;code&gt;none&lt;/code&gt; e &lt;code&gt;minimal&lt;/code&gt;
&lt;/h3&gt;

&lt;p&gt;GPT-6.1 Sol não suporta &lt;code&gt;none&lt;/code&gt; nem &lt;code&gt;minimal&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Use este mapeamento inicial:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;EFFORT_MAP&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;none&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;low&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;minimal&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;low&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;low&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;low&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;medium&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;medium&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;high&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;high&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;xhigh&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;xhigh&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;max&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;max&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Execute avaliações representativas após o remapeamento. No GPT-6 Astra, enviar &lt;code&gt;none&lt;/code&gt; retorna HTTP 400; corrija esse caso antes de transferir tráfego.&lt;/p&gt;

&lt;h3&gt;
  
  
  3. Remova parâmetros de amostragem incompatíveis
&lt;/h3&gt;

&lt;p&gt;Quando o esforço não for &lt;code&gt;none&lt;/code&gt;, remova:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;&lt;code&gt;temperature&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;top_p&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;&lt;code&gt;top_logprobs&lt;/code&gt;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;logprobs&lt;/code&gt; em Chat Completions&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Exemplo de normalização do payload:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="kd"&gt;function&lt;/span&gt; &lt;span class="nf"&gt;buildRequest&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nx"&gt;effort&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nx"&gt;input&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
  &lt;span class="k"&gt;return&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
    &lt;span class="nx"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="na"&gt;reasoning&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt; &lt;span class="nx"&gt;effort&lt;/span&gt; &lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nx"&gt;input&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
  &lt;span class="p"&gt;};&lt;/span&gt;
&lt;span class="p"&gt;}&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Se seu código associava &lt;code&gt;temperature&lt;/code&gt; a &lt;code&gt;reasoning_effort: "none"&lt;/code&gt; no GPT-6 Sol, remova essa combinação durante a migração.&lt;/p&gt;

&lt;h3&gt;
  
  
  4. Mova ferramentas de Chat Completions para Responses
&lt;/h3&gt;

&lt;p&gt;No GPT-6 Sol, Chat Completions aceitava chamadas de função somente com &lt;code&gt;reasoning_effort: "none"&lt;/code&gt;. Não existe uma combinação equivalente no GPT-6.1 Sol.&lt;/p&gt;

&lt;p&gt;Para fluxos com ferramentas, use Responses:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;responses&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;gpt-6.1-sol&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;reasoning&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;effort&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;medium&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;
    &lt;span class="nb"&gt;input&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Consulte o pedido 123 e informe o status.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;tools&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;
        &lt;span class="p"&gt;{&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;function&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;name&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;get_order&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;description&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;Busca os dados de um pedido.&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
            &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;parameters&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;object&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;properties&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;
                    &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;order_id&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;type&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;string&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;
                &lt;span class="p"&gt;},&lt;/span&gt;
                &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;required&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;order_id&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;]&lt;/span&gt;
            &lt;span class="p"&gt;}&lt;/span&gt;
        &lt;span class="p"&gt;}&lt;/span&gt;
    &lt;span class="p"&gt;],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Por fim, reexecute testes que dependam de conhecimento recente: o corte de conhecimento muda de 20 para 30 de abril de 2026.&lt;/p&gt;

&lt;p&gt;Se você migrou anteriormente do Astra para o Sol, consulte o &lt;a href="https://apidog.com/pt/blog/gpt-6-astra-to-sol-migration?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia de migração Astra para Sol&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Preços de Batch, Flex, Fast e entrada em cache
&lt;/h2&gt;

&lt;p&gt;Os preços por 1 milhão de tokens vêm da &lt;a href="https://developers.openai.com/api/docs/pricing" rel="noopener noreferrer"&gt;página de preços da API&lt;/a&gt;.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Nível&lt;/th&gt;
&lt;th&gt;Entrada&lt;/th&gt;
&lt;th&gt;Entrada em cache&lt;/th&gt;
&lt;th&gt;Escritas de cache&lt;/th&gt;
&lt;th&gt;Saída&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Standard&lt;/td&gt;
&lt;td&gt;US$ 2,00&lt;/td&gt;
&lt;td&gt;US$ 0,10&lt;/td&gt;
&lt;td&gt;US$ 2,50&lt;/td&gt;
&lt;td&gt;US$ 10,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Batch&lt;/td&gt;
&lt;td&gt;US$ 1,00&lt;/td&gt;
&lt;td&gt;US$ 0,05&lt;/td&gt;
&lt;td&gt;US$ 1,25&lt;/td&gt;
&lt;td&gt;US$ 5,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Flex&lt;/td&gt;
&lt;td&gt;US$ 1,00&lt;/td&gt;
&lt;td&gt;US$ 0,05&lt;/td&gt;
&lt;td&gt;US$ 1,25&lt;/td&gt;
&lt;td&gt;US$ 5,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Fast&lt;/td&gt;
&lt;td&gt;US$ 4,00&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;td&gt;US$ 5,00&lt;/td&gt;
&lt;td&gt;US$ 20,00&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Standard, prompt com mais de 272K tokens de entrada&lt;/td&gt;
&lt;td&gt;US$ 4,00&lt;/td&gt;
&lt;td&gt;US$ 0,20&lt;/td&gt;
&lt;td&gt;US$ 5,00&lt;/td&gt;
&lt;td&gt;US$ 15,00&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;A &lt;a href="https://developers.openai.com/api/docs/models/gpt-6.1-sol" rel="noopener noreferrer"&gt;página do modelo&lt;/a&gt; informa que prompts com mais de 272K tokens de entrada são cobrados em 2x as taxas de entrada e cache e 1,5x a taxa de saída para toda a requisição.&lt;/p&gt;

&lt;p&gt;Use Flex por requisição:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"service_tier"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"flex"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Use Fast quando a prioridade de latência justificar o preço:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"service_tier"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"fast"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;&lt;code&gt;"priority"&lt;/code&gt; também é aceito como alias de Fast. O modo Fast não está disponível com residência de dados na UE.&lt;/p&gt;

&lt;p&gt;O Ultrafast para GPT-6.1 Sol está marcado como “chegando em breve” e está amplamente disponível apenas para GPT-6 Astra. Veja o &lt;a href="https://apidog.com/pt/blog/openai-ultrafast-mode?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;modo Ultrafast da OpenAI&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Para trabalhos noturnos ou processamento assíncrono, consulte o &lt;a href="https://apidog.com/pt/blog/openai-batch-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API OpenAI Batch&lt;/a&gt;.&lt;/p&gt;

&lt;h3&gt;
  
  
  Calcule a economia de cache
&lt;/h3&gt;

&lt;p&gt;No GPT-6.1 Sol, leituras de cache custam 0,05x a taxa de entrada. No GPT-6 Sol, custam 0,1x. Escritas de cache custam 1,25x em ambos os modelos, segundo o &lt;a href="https://developers.openai.com/api/docs/guides/prompt-caching" rel="noopener noreferrer"&gt;guia de cache de prompts&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Exemplo: um prompt de sistema de 50.000 tokens reutilizado em 1.000 requisições.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Uma escrita: US$ 0,125 nos dois modelos.&lt;/li&gt;
&lt;li&gt;999 leituras no GPT-6 Sol: US$ 9,99.&lt;/li&gt;
&lt;li&gt;999 leituras no GPT-6.1 Sol: US$ 5,00.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O prefixo mínimo armazenável em cache tem 1.024 tokens visíveis. Um prefixo em cache permanece elegível por pelo menos 30 minutos após a última escrita ou reutilização.&lt;/p&gt;

&lt;p&gt;Para projetar prompts com mais reaproveitamento, veja &lt;a href="https://apidog.com/pt/blog/gpt-6-prompt-caching-90-percent?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;cache de prompts GPT-6&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Teste a troca no Apidog
&lt;/h2&gt;

&lt;p&gt;Não altere a produção apenas com base em preços de tabela. Execute a mesma requisição salva com ambos os IDs de modelo, valide a estrutura da resposta e compare custo, tokens e qualidade.&lt;/p&gt;

&lt;p&gt;No &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Crie um ambiente com:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;OPENAI_API_KEY&lt;/code&gt; armazenada como segredo;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;MODEL_ID=gpt-6-sol&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;EFFORT=medium&lt;/code&gt;.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;Crie e salve uma requisição &lt;code&gt;POST https://api.openai.com/v1/responses&lt;/code&gt;.&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Cabeçalho:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;   Authorization: Bearer {{OPENAI_API_KEY}}
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Corpo:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="w"&gt;   &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{MODEL_ID}}"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"reasoning"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="nl"&gt;"effort"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"{{EFFORT}}"&lt;/span&gt;&lt;span class="p"&gt;},&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"max_output_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;25000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
     &lt;/span&gt;&lt;span class="nl"&gt;"input"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"Return a JSON object with keys risk and fix for this policy: retry any 5xx three times with no idempotency key."&lt;/span&gt;&lt;span class="w"&gt;
   &lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;ol&gt;
&lt;li&gt;
&lt;p&gt;Adicione asserções para:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;HTTP &lt;code&gt;200&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;$.status&lt;/code&gt; igual a &lt;code&gt;completed&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;$.output[*].type&lt;/code&gt; contendo &lt;code&gt;message&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;$.usage.output_tokens&lt;/code&gt; maior que &lt;code&gt;0&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;existência de &lt;code&gt;$.usage.output_tokens_details.reasoning_tokens&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;JSON válido e as chaves que seu código realmente consome.&lt;/li&gt;
&lt;/ul&gt;
&lt;/li&gt;
&lt;li&gt;&lt;p&gt;Adicione um script de pós-processamento para estimar o custo por chamada:&lt;br&gt;
&lt;/p&gt;&lt;/li&gt;
&lt;/ol&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;().&lt;/span&gt;&lt;span class="nx"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;input_tokens_details&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="p"&gt;{};&lt;/span&gt;
   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;cached_tokens&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;writes&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;cache_write_tokens&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;model&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;environment&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;get&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;MODEL_ID&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;

   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;cachedRate&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;model&lt;/span&gt; &lt;span class="o"&gt;===&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;gpt-6.1-sol&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt; &lt;span class="p"&gt;?&lt;/span&gt; &lt;span class="mf"&gt;0.10&lt;/span&gt; &lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="mf"&gt;0.20&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

   &lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;cost&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="p"&gt;(&lt;/span&gt;
     &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;input_tokens&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="nx"&gt;writes&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;2&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt;
     &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="nx"&gt;cachedRate&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt;
     &lt;span class="nx"&gt;writes&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mf"&gt;2.5&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt;
     &lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;output_tokens&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;10&lt;/span&gt;
   &lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;/&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="nx"&gt;e6&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

   &lt;span class="nx"&gt;console&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;log&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="s2"&gt;cost per call $&lt;/span&gt;&lt;span class="dl"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="nx"&gt;cost&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;toFixed&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;5&lt;/span&gt;&lt;span class="p"&gt;));&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;ol&gt;
&lt;li&gt;Execute com &lt;code&gt;MODEL_ID=gpt-6-sol&lt;/code&gt;. Depois, altere apenas &lt;code&gt;MODEL_ID&lt;/code&gt; para &lt;code&gt;gpt-6.1-sol&lt;/code&gt; e execute novamente.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Compare:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;reasoning_tokens&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;output_tokens&lt;/code&gt;;&lt;/li&gt;
&lt;li&gt;formato e conteúdo da resposta;&lt;/li&gt;
&lt;li&gt;custo estimado;&lt;/li&gt;
&lt;li&gt;tempo de resposta;&lt;/li&gt;
&lt;li&gt;taxas de falha e respostas incompletas.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Se você estiver migrando de &lt;code&gt;none&lt;/code&gt;, execute a linha de base com &lt;code&gt;none&lt;/code&gt; no GPT-6 Sol e o candidato com &lt;code&gt;low&lt;/code&gt; no GPT-6.1 Sol.&lt;/p&gt;

&lt;h3&gt;
  
  
  Execute regressões na CI com Apidog CLI
&lt;/h3&gt;

&lt;p&gt;Coloque a requisição e alguns prompts reais em um cenário de teste. Depois, execute cada modelo na CI usando &lt;code&gt;--env-var&lt;/code&gt; para sobrescrever o modelo em cada execução:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;npm &lt;span class="nb"&gt;install&lt;/span&gt; &lt;span class="nt"&gt;-g&lt;/span&gt; apidog-cli

apidog run &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--access-token&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$APIDOG_ACCESS_TOKEN&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-t&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$SCENARIO_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-e&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$ENV_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--env-var&lt;/span&gt; &lt;span class="s2"&gt;"MODEL_ID=gpt-6-sol"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-r&lt;/span&gt; cli,junit

apidog run &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--access-token&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$APIDOG_ACCESS_TOKEN&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-t&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$SCENARIO_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-e&lt;/span&gt; &lt;span class="s2"&gt;"&lt;/span&gt;&lt;span class="nv"&gt;$ENV_ID&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;--env-var&lt;/span&gt; &lt;span class="s2"&gt;"MODEL_ID=gpt-6.1-sol"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-r&lt;/span&gt; cli,junit
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Uma asserção falha o job, e os relatórios JUnit permitem comparar as duas execuções. Para validar saídas que variam entre execuções, veja &lt;a href="https://apidog.com/pt/blog/testing-non-deterministic-ai-agents?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;testando agentes de IA não determinísticos&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;O GPT-6.1 Sol é mais caro que o GPT-6 Sol?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. Ambos custam US$ 2 de entrada e US$ 10 de saída por 1 milhão de tokens. A entrada em cache do GPT-6.1 Sol custa US$ 0,10, contra US$ 0,20 no GPT-6 Sol.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O que fazer com &lt;code&gt;reasoning.effort: "none"&lt;/code&gt;?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;GPT-6.1 Sol não suporta &lt;code&gt;none&lt;/code&gt; nem &lt;code&gt;minimal&lt;/code&gt;. Mapeie ambos para &lt;code&gt;low&lt;/code&gt;, remova &lt;code&gt;temperature&lt;/code&gt; e &lt;code&gt;top_p&lt;/code&gt; quando aplicável e reexecute suas avaliações antes de mudar o tráfego.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Posso usar GPT-6.1 Sol com Chat Completions?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Sim, para requisições sem ferramentas. Para chamadas de ferramenta, use a API Responses.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Existe nível gratuito para a API GPT-6.1 Sol?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. As chamadas de API são cobradas por token desde a primeira requisição. Veja &lt;a href="https://apidog.com/pt/blog/gpt-6-1-sol-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;O GPT-6.1 Sol é gratuito?&lt;/a&gt; para opções mais econômicas.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;p&gt;Salve uma requisição representativa do seu tráfego. Execute-a primeiro com &lt;code&gt;gpt-6-sol&lt;/code&gt; e seu esforço atual. Depois, execute o mesmo teste com &lt;code&gt;gpt-6.1-sol&lt;/code&gt;, compare uso, custo e saída e só então avance com o rollout.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt; para manter as duas execuções como testes com asserções reutilizáveis na CI. Se você também está comparando provedores, veja &lt;a href="https://apidog.com/pt/blog/gpt-6-1-sol-vs-claude-sonnet-5-5?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;GPT-6.1 Sol vs Claude Sonnet 5.5&lt;/a&gt;.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>openai</category>
    </item>
    <item>
      <title>GPT-6.1 Sol Grátis?</title>
      <dc:creator>Lucas</dc:creator>
      <pubDate>Wed, 30 Sep 2026 05:01:03 +0000</pubDate>
      <link>https://dev.to/lucas_ferreira/gpt-61-sol-gratis-5fla</link>
      <guid>https://dev.to/lucas_ferreira/gpt-61-sol-gratis-5fla</guid>
      <description>&lt;p&gt;Não, o GPT-6.1 Sol não é gratuito. A OpenAI o lançou em 29 de setembro de 2026 para usuários Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex. Ele ainda não está no Chat, os planos Free e Go não o incluem, e o modelo da API &lt;code&gt;gpt-6.1-sol&lt;/code&gt; não possui um nível gratuito. O preço padrão da API é de $2 por milhão de tokens de entrada, $0.10 por milhão de tokens de entrada em cache e $10 por milhão de tokens de saída.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation" class="crayons-btn crayons-btn--primary"&gt;Experimente o Apidog hoje&lt;/a&gt;
&lt;/p&gt;

&lt;p&gt;O lado positivo é que as rotas mais baratas ficaram ainda mais acessíveis. O GPT-6.1 Sol mantém o preço de tabela de $2/$10 do GPT-6 Sol e reduz pela metade a taxa de entrada em cache.&lt;/p&gt;

&lt;p&gt;Este guia mostra como escolher a rota pelo custo, o que não é gratuito, como calcular uma chamada real e qual alternativa gratuita existe na família GPT-6. Para entender o modelo, veja &lt;a href="https://apidog.com/pt/blog/what-is-gpt-6-1-sol?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o que é o GPT-6.1 Sol&lt;/a&gt;. Para comparar com o predecessor, consulte &lt;a href="https://apidog.com/pt/blog/gpt-6-sol-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o GPT-6 Sol é gratuito&lt;/a&gt;. Antes de escolher uma rota, meça o custo dos seus prompts no &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Todas as rotas para o GPT-6.1 Sol, comparadas
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Rota&lt;/th&gt;
&lt;th&gt;Custo&lt;/th&gt;
&lt;th&gt;O que você obtém&lt;/th&gt;
&lt;th&gt;A ressalva&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Alternativa gratuita (não Sol): GPT-6 Luna no aplicativo de desktop do ChatGPT&lt;/td&gt;
&lt;td&gt;$0 no plano Gratuito&lt;/td&gt;
&lt;td&gt;Luna, não Sol, no Work e Codex no aplicativo de desktop&lt;/td&gt;
&lt;td&gt;Modelo diferente; não no Chat; sem chave de API&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;ChatGPT Plus no Codex ou ChatGPT Work&lt;/td&gt;
&lt;td&gt;Uma assinatura Plus&lt;/td&gt;
&lt;td&gt;6.1 Sol para tarefas de codificação e trabalho&lt;/td&gt;
&lt;td&gt;Limites de uso do plano; não no Chat; sem chave de API&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Entrar com aplicativos parceiros do ChatGPT&lt;/td&gt;
&lt;td&gt;Conta contra o uso do seu Plus ou Pro&lt;/td&gt;
&lt;td&gt;Seu plano dentro de aplicativos como Devin, Notion, Vercel, T3, OpenClaw e Dactyl&lt;/td&gt;
&lt;td&gt;Apenas Plus e Pro; limite semanal por aplicativo; créditos desativados por padrão&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;API, Batch ou Flex&lt;/td&gt;
&lt;td&gt;$1 de entrada, $0.05 em cache, $5 de saída&lt;/td&gt;
&lt;td&gt;Metade da taxa Padrão&lt;/td&gt;
&lt;td&gt;Batch é assíncrono; Flex é mais lento e pode retornar 429&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;API, Padrão com cache&lt;/td&gt;
&lt;td&gt;$2 de entrada, $0.10 em cache, $10 de saída&lt;/td&gt;
&lt;td&gt;O modelo no seu próprio código&lt;/td&gt;
&lt;td&gt;Cada token faturado; acertos de cache precisam de um prefixo estável&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;OpenRouter &lt;code&gt;openai/gpt-6.1-sol&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;$2 de entrada, $0.10 em cache, $10 de saída (endpoint da OpenAI)&lt;/td&gt;
&lt;td&gt;Uma chave para todos os provedores&lt;/td&gt;
&lt;td&gt;Mesmo preço de tabela; não gratuito&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Todos os preços da API são por milhão de tokens para prompts de até 272 mil tokens de entrada, conforme a &lt;a href="https://developers.openai.com/api/docs/pricing" rel="noopener noreferrer"&gt;página de preços&lt;/a&gt; da OpenAI e a &lt;a href="https://openrouter.ai/openai/gpt-6.1-sol" rel="noopener noreferrer"&gt;página do modelo&lt;/a&gt; no OpenRouter.&lt;/p&gt;

&lt;h2&gt;
  
  
  ChatGPT Plus: o plano de entrada para uso interativo
&lt;/h2&gt;

&lt;p&gt;Para usar o 6.1 Sol diretamente no Codex ou no ChatGPT Work, o Plus é o plano de menor custo que o inclui.&lt;/p&gt;

&lt;p&gt;A &lt;a href="https://openai.com/index/introducing-gpt-6-1-sol/" rel="noopener noreferrer"&gt;postagem de lançamento&lt;/a&gt; da OpenAI informa que o modelo está disponível “para todos os usuários Plus, Pro, Business, Enterprise e Edu no ChatGPT Work e no Codex” e que ele “ainda não está disponível no Chat”.&lt;/p&gt;

&lt;p&gt;Segundo a &lt;a href="https://learn.chatgpt.com/docs/models" rel="noopener noreferrer"&gt;documentação de modelos&lt;/a&gt; da OpenAI, os planos Enterprise e Edu mantêm o modelo desativado até que um administrador o habilite.&lt;/p&gt;

&lt;p&gt;Você não paga por token nessa rota, mas continua sujeito aos limites de uso do plano. Consulte o guia sobre &lt;a href="https://apidog.com/pt/blog/codex-usage-limits?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;limites de uso do Codex&lt;/a&gt; para entender como esses limites funcionam.&lt;/p&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/use-codex-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia gratuito do Codex&lt;/a&gt; cobre as opções sem custo, mas o 6.1 Sol começa no plano Plus.&lt;/p&gt;

&lt;h2&gt;
  
  
  Entrar com ChatGPT: use seu plano em outros aplicativos
&lt;/h2&gt;

&lt;p&gt;O DevDay adicionou o Entrar com ChatGPT. A parte de identidade, baseada em OAuth/OIDC, está disponível globalmente. Além disso, usuários Plus e Pro podem usar o próprio plano em ferramentas participantes.&lt;/p&gt;

&lt;p&gt;A OpenAI lançou o recurso com 16 parceiros. O &lt;a href="https://openai.com/index/devday-2026-recap/" rel="noopener noreferrer"&gt;resumo do DevDay&lt;/a&gt; cita Devin da Cognition, Notion, Vercel, T3, OpenClaw e Dactyl.&lt;/p&gt;

&lt;p&gt;De acordo com o &lt;a href="https://help.openai.com/en/articles/20001542-using-your-chatgpt-plan-in-other-apps-and-sites" rel="noopener noreferrer"&gt;artigo de ajuda da OpenAI sobre uso do plano em outros aplicativos&lt;/a&gt;, o fluxo funciona assim:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Requisições elegíveis contam para o uso do seu plano no ChatGPT Work e Codex.&lt;/li&gt;
&lt;li&gt;Cada aplicativo recebe um limite semanal definido como porcentagem do seu uso semanal total. É um teto, não um pool reservado.&lt;/li&gt;
&lt;li&gt;Pagar com créditos após atingir o limite é opcional, fica desativado por padrão e só se aplica quando o limite do aplicativo chega a 100%.&lt;/li&gt;
&lt;li&gt;O aplicativo recebe seu nome, endereço de e-mail e foto de perfil. Ele não recebe suas conversas, memórias ou chave de API.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Verifique o modelo usado por cada aplicativo antes de assumir que ele é o 6.1 Sol. Para avaliar custos do OpenClaw, veja &lt;a href="https://apidog.com/pt/blog/openclaw-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;o OpenClaw é gratuito&lt;/a&gt;.&lt;/p&gt;

&lt;p&gt;Para implementar a integração, incluindo IDs de cliente e fluxo OAuth, consulte o &lt;a href="https://apidog.com/pt/blog/sign-in-with-chatgpt?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia Entrar com ChatGPT&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  Um plano ChatGPT não é uma chave de API
&lt;/h2&gt;

&lt;p&gt;Esta é a principal armadilha em buscas por “GPT gratuito”.&lt;/p&gt;

&lt;p&gt;Um plano Plus ou Pro dá acesso ao 6.1 Sol no ChatGPT Work e Codex, mas não fornece uma chave de API. Um script, pipeline de CI ou agente que envia:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight http"&gt;&lt;code&gt;&lt;span class="err"&gt;Authorization: Bearer $OPENAI_API_KEY
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;para:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://api.openai.com/v1
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;paga por token, independentemente do plano ChatGPT.&lt;/p&gt;

&lt;p&gt;A única forma de o código consumir um plano é pelo OAuth do Entrar com ChatGPT. A &lt;a href="https://developers.openai.com/siwc/token-sharing-open-source" rel="noopener noreferrer"&gt;documentação de uso do plano&lt;/a&gt; da OpenAI permite esse fluxo para aplicativos de código aberto e hospedados localmente, com estas limitações de pré-visualização:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Apenas streaming.&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;store: false&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Sem &lt;code&gt;temperature&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Sem ferramentas hospedadas, como pesquisa de arquivos.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Essas requisições continuam contando contra o uso do Plus ou Pro e contra o limite semanal do aplicativo.&lt;/p&gt;

&lt;h2&gt;
  
  
  A rota de API mais barata: Batch, Flex e cache
&lt;/h2&gt;

&lt;p&gt;Use três alavancas para reduzir o custo por token:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;Batch:&lt;/strong&gt; executa tarefas de forma assíncrona pela metade da taxa Padrão: $1 de entrada, $0.05 em cache e $5 de saída. Veja o &lt;a href="https://apidog.com/pt/blog/openai-batch-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API Batch&lt;/a&gt; para executar uma tarefa do início ao fim.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Flex:&lt;/strong&gt; cobra as mesmas taxas do Batch em requisições comuns quando você define &lt;code&gt;service_tier: "flex"&lt;/code&gt;. O &lt;a href="https://developers.openai.com/api/docs/guides/flex-processing" rel="noopener noreferrer"&gt;guia de processamento Flex&lt;/a&gt; alerta para respostas mais lentas e erros ocasionais de &lt;code&gt;429 Resource Unavailable&lt;/code&gt;, que não são cobrados.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Cache de prompts:&lt;/strong&gt; já vem ativado por padrão. A entrada em cache custa $0.10, ou 95% menos que a entrada padrão, e metade dos $0.20 cobrados pelo GPT-6 Sol.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O &lt;a href="https://developers.openai.com/api/docs/guides/prompt-caching" rel="noopener noreferrer"&gt;guia de cache de prompts&lt;/a&gt; da OpenAI define:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Mínimo de 1.024 tokens para cache.&lt;/li&gt;
&lt;li&gt;Gravações em cache cobradas a 1.25x a taxa de entrada não em cache: $2.50 por milhão de tokens neste modelo.&lt;/li&gt;
&lt;li&gt;Prefixo reutilizável mantido por 30 minutos após a última gravação ou reutilização.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Mantenha os prompts abaixo de 272 mil tokens de entrada. Acima desse limite, a &lt;a href="https://developers.openai.com/api/docs/models/gpt-6.1-sol" rel="noopener noreferrer"&gt;página do modelo&lt;/a&gt; informa que a requisição completa é cobrada a 2x as taxas de entrada e cache e 1.5x a taxa de saída.&lt;/p&gt;

&lt;h2&gt;
  
  
  Exemplo prático: quanto custa uma chamada de agente
&lt;/h2&gt;

&lt;p&gt;Considere uma etapa de agente com:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Prefixo estável de 100.000 tokens: prompt do sistema, esquemas de ferramentas e contexto do repositório.&lt;/li&gt;
&lt;li&gt;8.000 novos tokens de entrada.&lt;/li&gt;
&lt;li&gt;2.000 tokens de saída, incluindo raciocínio.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O prefixo já está em cache. O modo explícito-apenas impede novas gravações de cache no prefixo, então os tokens novos são cobrados como entrada comum.&lt;/p&gt;

&lt;p&gt;No modo Padrão, com acerto de cache:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Entrada em cache: &lt;code&gt;100.000 × $0.10 / 1.000.000 = $0.0100&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Nova entrada: &lt;code&gt;8.000 × $2.00 / 1.000.000 = $0.0160&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;Saída: &lt;code&gt;2.000 × $10.00 / 1.000.000 = $0.0200&lt;/code&gt;
&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Total: $0.0460 por chamada&lt;/strong&gt;&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;No Batch ou Flex, cada taxa cai pela metade:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;$0.0050 + $0.0080 + $0.0100 = $0.0230
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;No GPT-6 Sol, a linha de cache dobra para $0.0200, então a mesma chamada custa $0.0560.&lt;/p&gt;

&lt;p&gt;Sem acerto de cache no 6.1 Sol, os 108.000 tokens de entrada são cobrados a $2.00:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;$0.2160 + $0.0200 = $0.2360
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Cenário&lt;/th&gt;
&lt;th&gt;Por chamada&lt;/th&gt;
&lt;th&gt;1.000 chamadas&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;6.1 Sol Padrão, acerto de cache&lt;/td&gt;
&lt;td&gt;$0.046&lt;/td&gt;
&lt;td&gt;$46&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6.1 Sol Batch ou Flex, acerto de cache&lt;/td&gt;
&lt;td&gt;$0.023&lt;/td&gt;
&lt;td&gt;$23&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;GPT-6 Sol Padrão, acerto de cache&lt;/td&gt;
&lt;td&gt;$0.056&lt;/td&gt;
&lt;td&gt;$56&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;6.1 Sol Padrão, sem acerto de cache&lt;/td&gt;
&lt;td&gt;$0.236&lt;/td&gt;
&lt;td&gt;$236&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;A primeira chamada grava o prefixo no cache a $2.50 por milhão:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;100.000 × $2.50 / 1.000.000 = $0.25
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Depois disso:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;O acerto de cache muda a fatura em cerca de cinco vezes.&lt;/li&gt;
&lt;li&gt;Batch ou Flex reduz o valor pela metade.&lt;/li&gt;
&lt;li&gt;A migração do GPT-6 Sol economiza um centavo por chamada neste exemplo, pois apenas a linha de cache mudou.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;Para otimizar essa parte, leia sobre &lt;a href="https://apidog.com/pt/blog/gpt-6-prompt-caching-90-percent?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;cache de prompts GPT-6&lt;/a&gt;.&lt;/p&gt;

&lt;h2&gt;
  
  
  O que NÃO é gratuito
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;strong&gt;ChatGPT Free e Go:&lt;/strong&gt; não incluem o 6.1 Sol.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;ChatGPT Chat:&lt;/strong&gt; o 6.1 Sol ainda não está disponível em nenhum plano.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;API:&lt;/strong&gt; não possui nível gratuito.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Entrar com ChatGPT em uma conta Gratuita:&lt;/strong&gt; o uso do plano é exclusivo para Plus e Pro.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;OpenRouter:&lt;/strong&gt; usa o mesmo preço de tabela; não é um desconto.&lt;/li&gt;
&lt;li&gt;
&lt;strong&gt;Ultrafast:&lt;/strong&gt; o 6.1 Sol está “chegando em breve”; no GPT-6 Astra, custa 6x o preço Padrão.&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  A alternativa gratuita: GPT-6 Luna
&lt;/h2&gt;

&lt;p&gt;Se você precisa de uma opção sem custo, use o GPT-6 Luna no plano Gratuito, pelo Work e Codex no aplicativo de desktop do ChatGPT. O plano Go, que é pago, também inclui o modelo.&lt;/p&gt;

&lt;p&gt;Antes de escolher essa rota, considere as limitações:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;É Luna, não Sol.&lt;/li&gt;
&lt;li&gt;Não está disponível no Chat.&lt;/li&gt;
&lt;li&gt;Um assento de plano não fornece uma chave de API.&lt;/li&gt;
&lt;li&gt;Não pode alimentar diretamente um script ou agente que você escreveu.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/how-to-use-gpt-6-luna-for-free?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia gratuito do GPT-6 Luna&lt;/a&gt; explica a configuração.&lt;/p&gt;

&lt;p&gt;Na API, o Luna custa $0.10 de entrada e $0.50 de saída: um vigésimo das taxas de entrada e saída do 6.1 Sol. Isso o torna uma opção econômica para classificação e extração em alto volume.&lt;/p&gt;

&lt;h2&gt;
  
  
  Meça o uso real de tokens no Apidog antes de escolher
&lt;/h2&gt;

&lt;p&gt;Os números do exemplo são hipotéticos. Use uma requisição real para decidir entre Padrão, Batch, Flex ou outro modelo.&lt;/p&gt;

&lt;p&gt;No &lt;a href="https://apidog.com/?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Apidog&lt;/a&gt;, siga estes passos:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Crie um ambiente com &lt;code&gt;OPENAI_API_KEY&lt;/code&gt; e &lt;code&gt;MODEL_ID&lt;/code&gt;, definindo &lt;code&gt;MODEL_ID&lt;/code&gt; como &lt;code&gt;gpt-6.1-sol&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Salve uma requisição &lt;code&gt;POST&lt;/code&gt; para &lt;code&gt;https://api.openai.com/v1/responses&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Adicione &lt;code&gt;Bearer {{OPENAI_API_KEY}}&lt;/code&gt; ao cabeçalho &lt;code&gt;Authorization&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Use um corpo com &lt;code&gt;"model": "{{MODEL_ID}}"&lt;/code&gt;, &lt;code&gt;"reasoning": {"effort": "low"}&lt;/code&gt; e um prompt real da sua carga de trabalho em &lt;code&gt;input&lt;/code&gt;.&lt;/li&gt;
&lt;li&gt;Envie a requisição duas vezes.&lt;/li&gt;
&lt;li&gt;Valide se &lt;code&gt;$.usage.input_tokens_details.cached_tokens&lt;/code&gt; é maior que &lt;code&gt;0&lt;/code&gt; na segunda execução. Assim, uma alteração de prompt que quebre o cache falha no teste.&lt;/li&gt;
&lt;li&gt;Compare &lt;code&gt;usage.output_tokens&lt;/code&gt; e &lt;code&gt;usage.output_tokens_details.reasoning_tokens&lt;/code&gt; usando &lt;code&gt;low&lt;/code&gt; e &lt;code&gt;medium&lt;/code&gt;.&lt;/li&gt;
&lt;/ol&gt;

&lt;p&gt;O &lt;a href="https://developers.openai.com/api/docs/guides/reasoning" rel="noopener noreferrer"&gt;guia de raciocínio&lt;/a&gt; informa que tokens de raciocínio são cobrados como saída.&lt;/p&gt;

&lt;p&gt;Adicione este script pós-resposta para precificar cada chamada pelas taxas Padrão:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight javascript"&gt;&lt;code&gt;&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;pm&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;json&lt;/span&gt;&lt;span class="p"&gt;().&lt;/span&gt;&lt;span class="nx"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;input_tokens_details&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="p"&gt;{};&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;cached_tokens&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;written&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;d&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;cache_write_tokens&lt;/span&gt; &lt;span class="o"&gt;||&lt;/span&gt; &lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;
&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;fresh&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;input_tokens&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;-&lt;/span&gt; &lt;span class="nx"&gt;written&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

&lt;span class="kd"&gt;const&lt;/span&gt; &lt;span class="nx"&gt;usd&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt;
  &lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="nx"&gt;fresh&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;2&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="nx"&gt;cached&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mf"&gt;0.1&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="nx"&gt;written&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mf"&gt;2.5&lt;/span&gt; &lt;span class="o"&gt;+&lt;/span&gt; &lt;span class="nx"&gt;u&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nx"&gt;output_tokens&lt;/span&gt; &lt;span class="o"&gt;*&lt;/span&gt; &lt;span class="mi"&gt;10&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt; &lt;span class="o"&gt;/&lt;/span&gt; &lt;span class="mi"&gt;1&lt;/span&gt;&lt;span class="nx"&gt;e6&lt;/span&gt;&lt;span class="p"&gt;;&lt;/span&gt;

&lt;span class="nx"&gt;console&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;log&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="s2"&gt;`gpt-6.1-sol Standard: $&lt;/span&gt;&lt;span class="p"&gt;${&lt;/span&gt;&lt;span class="nx"&gt;usd&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;toFixed&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="mi"&gt;4&lt;/span&gt;&lt;span class="p"&gt;)}&lt;/span&gt;&lt;span class="s2"&gt; per call`&lt;/span&gt;&lt;span class="p"&gt;);&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Multiplique o resultado pelo volume diário e reduza pela metade para Batch ou Flex.&lt;/p&gt;

&lt;p&gt;Salve a requisição em um cenário de teste. O Apidog CLI pode executá-la novamente na CI, permitindo detectar uma queda na taxa de acerto de cache antes que ela apareça na fatura.&lt;/p&gt;

&lt;h2&gt;
  
  
  Perguntas frequentes
&lt;/h2&gt;

&lt;p&gt;&lt;strong&gt;O GPT-6.1 Sol é gratuito no ChatGPT?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. Ele está no ChatGPT Work e Codex para Plus, Pro, Business, Enterprise e Edu. Ainda não está no Chat e não está disponível nos planos Free ou Go.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Posso usar meu plano ChatGPT Plus para chamar a API do GPT-6.1 Sol?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não com uma chave de API. Um plano não é uma chave, e código que envia uma chave de API paga por token. O &lt;a href="https://apidog.com/pt/blog/sign-in-with-chatgpt?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Entrar com ChatGPT&lt;/a&gt; permite que aplicativos que implementam OAuth, incluindo os de código aberto e hospedados localmente, contabilizem requisições elegíveis contra o uso do Plus ou Pro, dentro dos limites de pré-visualização.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;Existe uma API gratuita para o GPT-6.1 Sol?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. A taxa oficial mais barata é Batch ou Flex: $1 de entrada, $0.05 em cache e $5 de saída por milhão de tokens.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O GPT-6.1 Sol é gratuito no OpenRouter?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;Não. O OpenRouter lista &lt;code&gt;openai/gpt-6.1-sol&lt;/code&gt; a $2/$10 em seu endpoint OpenAI, o mesmo preço de tabela da OpenAI.&lt;/p&gt;

&lt;p&gt;&lt;strong&gt;O GPT-6.1 Sol é mais barato que o GPT-6 Sol?&lt;/strong&gt;&lt;/p&gt;

&lt;p&gt;O preço de tabela é o mesmo: $2 de entrada e $10 de saída. A entrada em cache custa metade, $0.10 contra $0.20, então cargas de trabalho com alta taxa de acerto de cache ficam mais baratas.&lt;/p&gt;

&lt;h2&gt;
  
  
  Próximo passo
&lt;/h2&gt;

&lt;p&gt;Escolha a rota pelos seus números reais.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://apidog.com/download?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;Baixe o Apidog&lt;/a&gt;, salve uma requisição representativa, envie-a duas vezes e analise &lt;code&gt;usage&lt;/code&gt;.&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;Se você precisa do 6.1 Sol apenas de forma interativa, Plus no Codex é o ponto de entrada.&lt;/li&gt;
&lt;li&gt;Se seu código precisa do modelo, use a API com cache.&lt;/li&gt;
&lt;li&gt;Mova tarefas que podem esperar para Batch ou Flex.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;O &lt;a href="https://apidog.com/pt/blog/gpt-6-1-sol-api?utm_source=dev.to&amp;amp;utm_medium=wanda&amp;amp;utm_content=n8n-post-automation"&gt;guia da API do GPT-6.1 Sol&lt;/a&gt; cobre a primeira requisição e a migração de &lt;code&gt;gpt-6-sol&lt;/code&gt;.&lt;/p&gt;

</description>
    </item>
  </channel>
</rss>
