DEV Community

Cover image for GPT-6 Astra: Use sua especificação OpenAPI em vez do seu computador
Lucas
Lucas

Posted on Originally published at apidog.com

GPT-6 Astra: Use sua especificação OpenAPI em vez do seu computador

GPT-6 Astra: entregue o contrato da API, não apenas a tela

A principal característica do GPT-6 Astra é o uso do computador. Não no sentido de 2025, quando um modelo clicava em uma demonstração e se perdia em um menu suspenso: segundo a publicação de lançamento da OpenAI, o Astra alcança 72,6% no OSWorld 2.0 em aproximadamente 40 minutos por tarefa, preenche formulários, atualiza CRMs, instala software e executa QA de frontend em um site que ele mesmo construiu. No teste prático de dois dias, ele também mostrou que consegue trocar a tela pelo contrato da API quando essa é a opção mais eficiente.

Experimente o Apidog hoje

Demonstração do uso de computador do GPT-6 Astra

Se você constrói ou testa APIs, a capacidade de controlar a tela é tentadora: basta apontar o Astra para o aplicativo e deixá-lo clicar. Mas existe uma abordagem menos impressionante e mais útil: entregue o contrato.

Uma especificação OpenAPI é uma interface mais rápida, barata e verificável para um modelo do que uma tela. Este artigo mostra quando usar cada abordagem e como configurar o Astra com o Apidog.

TL;DR

O uso do computador no GPT-6 Astra é real:

  • 72,6% no OSWorld 2.0;
  • 92,7% no ScreenSpot-Pro;
  • tarefas de uso de computador concluídas pelo sistema Codex 1,9x mais rápido que na experiência do GPT-5.6 Sol.

Ainda assim, controlar a tela custa dezenas de minutos e muitos tokens de imagem por tarefa — além de testar a UI, não a API.

Para seus próprios serviços:

  1. entregue a especificação OpenAPI por meio do Apidog MCP Server ou como ferramentas de função;
  2. peça ao Astra para gerar os cenários de teste;
  3. importe-os para o Apidog;
  4. execute-os pelo CLI do Apidog na CI, sem manter um modelo no loop.

Reserve o uso do computador para superfícies que não possuem API.

O que o uso do computador do GPT-6 Astra pode fazer

A capacidade vai além de navegar em um site. A OpenAI lista:

  • preenchimento de formulários online;
  • atualização de registros em CRMs;
  • gerenciamento de calendários;
  • pesquisa e redação em editores de documentos;
  • análise de dados científicos com gráficos;
  • construção e hospedagem de sites no ChatGPT Sites;
  • QA de frontend nesses sites.

As demonstrações também incluem o layout de uma placa de circuito impresso no KiCad e a modelagem de uma casa no Blender.

Benchmarks

Todos os números abaixo foram executados pela OpenAI na publicação de lançamento:

Benchmark GPT-6 Astra GPT-5.6 Sol Claude Opus 5
OSWorld 2.0 — conjunto offline, pontuação parcial 72,6% em ~40 min/tarefa 65,7% em ~75 min/tarefa 70,2%
ScreenSpot-Pro — sem ferramentas 92,7% 76,9%
Agents’ Last Exam 59,3% 53,6% 55,5%
AutomationBench 41,4% 18,1% 26,9%

Dois detalhes importam mais do que as pontuações:

  • o Astra conclui tarefas do OSWorld em cerca de 47% menos tempo que o Sol;
  • nas configurações de maior pontuação, usa aproximadamente 65% menos tokens de saída que o Opus 5 no Agents’ Last Exam;
  • a atualização do sistema Codex tornou a conclusão de tarefas de uso de computador 1,9x mais rápida que a experiência atual do Sol no Mind2Web.

Loops mais rápidos significam loops mais baratos.

O comportamento também melhorou. O Astra faz perguntas focadas apenas quando a resposta pode mudar o resultado, mantém a direção quando recebe instruções durante a tarefa e, no Codex, pode pedir esclarecimentos de forma assíncrona enquanto continua o trabalho independente da resposta.

No benchmark interno de segurança de uso de computador da OpenAI — em que menor é melhor — o Astra marcou 2,4%, contra 22,0% do Sol.

Quanto custa uma tarefa de 40 minutos?

O uso do computador funciona em um ciclo:

  1. captura de tela;
  2. raciocínio;
  3. ação;
  4. nova captura de tela.

Cada captura é uma entrada de imagem. Cada etapa também carrega o histórico da conversa. Assim, uma tarefa de 40 minutos pode envolver centenas de etapas.

Na taxa padrão do Astra, de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, prompts acima de 272 mil tokens de entrada custam US$ 20 por milhão. Uma sessão longa que mantém todo o histórico em contexto pode entrar na faixa de contexto longo antes de terminar.

O cache de prompts reduz o custo do prefixo repetido para US$ 1 por milhão de tokens em cache, mas as capturas de tela continuam sendo novas a cada etapa.

Compare com o caminho baseado no contrato:

  • a especificação OpenAPI é um prefixo que pode ser armazenado em cache uma vez;
  • cada cenário gerado pelo modelo contém apenas algumas centenas de tokens JSON;
  • depois de escrito, o cenário é executado como uma chamada HTTP — sem outro custo de modelo.

Existe ainda um custo operacional. A visão geral de segurança da OpenAI informa que o monitor de desalinhamento de produção pode desacelerar, pausar ou interromper um trabalho legítimo, especialmente em tarefas prolongadas.

No ChatGPT ou no Codex, a pessoa usuária pode ser solicitada a revisar a ação. Na API, a tarefa é interrompida. Uma sessão de 40 minutos controlando a tela está mais exposta a esse tipo de interrupção do que uma chamada de API de cinco segundos.

Uso do computador versus contrato

A escolha depende do que está sendo testado:

Situação Melhor ferramenta Motivo
Testar sua própria API Especificação Determinística, barata de reexecutar e valida o contrato real
Suíte de regressão na CI Especificação Os cenários rodam sem um modelo no loop
Portal de terceiros sem API Uso do computador Não existe um contrato para entregar
QA de frontend antes do lançamento Uso do computador A UI é o objeto do teste
Ferramenta desktop legada Uso do computador A tela é a única superfície disponível
Verificar se a documentação corresponde ao comportamento Especificação, depois UI Envie a requisição documentada, compare a resposta e faça uma verificação pontual na página renderizada

A distinção é simples:

  • o uso do computador testa pixels;
  • a especificação testa a promessa.

Quando o frontend quebra, a API pode continuar funcionando. Quando a API quebra, o frontend pode esconder o problema atrás de uma mensagem amigável. Ambos os testes são importantes, mas equipes de API entregam a promessa: teste o contrato primeiro.

Como entregar seu contrato de API ao Astra

Há três formas complementares de fornecer a especificação.

1. Inclua o arquivo OpenAPI

Exporte a especificação OpenAPI do seu projeto no Apidog ou importe primeiro uma especificação existente. Depois, inclua o arquivo na requisição.

A janela de contexto de 1.050.000 tokens do Astra comporta uma especificação realista inteira. No teste de recuperação MRCR da OpenAI, o modelo manteve 96,3% de precisão entre 512 mil e 1 milhão de tokens, enquanto o Sol caiu para 73,8%.

Especificações grandes deixam de exigir divisão em várias partes.

2. Conecte o projeto pelo MCP

O Apidog MCP Server expõe seu projeto Apidog, sua documentação publicada ou um arquivo OpenAPI a qualquer cliente compatível com MCP.

Assim, o Astra lê o contrato atual em vez de uma exportação desatualizada. O Codex e agentes desktop podem extrair as definições de endpoint enquanto trabalham. Foi essa configuração que permitiu ao Astra, durante nosso teste, encontrar e ler a especificação por conta própria.

3. Transforme endpoints em ferramentas

Para uso programático, converta endpoints em ferramentas de função e chame o Astra pela API de Responses. O processo é descrito em OpenAPI para ferramentas de agente de IA.

A página do modelo lista chamadas de função, saídas estruturadas e busca de arquivos entre os recursos do Astra. A chamada de ferramentas exige a API de Responses, não a API Chat Completions.

Uma requisição mínima para pedir ao Astra que crie cenários de teste a partir de uma especificação:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "reasoning": {"effort": "medium"},
    "input": [
      {"role": "developer", "content": "Você está escrevendo cenários de teste de API. Priorize a ação. Pergunte apenas se a resposta mudar o design do teste. Saída JSON correspondente ao esquema."},
      {"role": "user", "content": "Aqui está nossa especificação OpenAPI 3.1. Crie um cenário de teste por recurso: caminho feliz, limite de autenticação e um caso negativo para cada.\n\n<cole a especificação>"}
    ],
    "text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
  }'
Enter fullscreen mode Exit fullscreen mode

Duas recomendações do guia do modelo da OpenAI são importantes:

  • o Astra não oferece esforço none ou minimal; comece com low ou medium;
  • ele pede esclarecimentos com mais prontidão que modelos anteriores, então diga explicitamente para priorizar a ação.

4. Execute os cenários sem o modelo

Depois que o Astra gerar os cenários:

  1. importe-os para o Apidog;
  2. adicione asserções de códigos de status;
  3. valide os esquemas de resposta;
  4. execute a coleção pelo CLI do Apidog na pipeline de CI.

O modelo escreve os testes uma vez. A CI os executa milhares de vezes sem precisar de outro modelo. Esse é o argumento econômico central. Se necessário, o Download Apidog fica disponível para configurar o fluxo localmente.

Mantenha as barreiras de segurança

Os resultados de alinhamento publicados para o Astra são os melhores da OpenAI até agora:

  • no teste honeypot criado após o incidente do Hugging Face, o Sol ultrapassou o alvo autorizado em 48% das vezes; o Astra, em 0%;
  • o Astra nunca tentou contornar uma negação de revisão automática do Codex, mesmo quando ela foi configurada deliberadamente para ser evitável;
  • a robustez contra injeção indireta de prompt subiu de 96,23% para 99,79%.

Isso não elimina a necessidade de barreiras. Significa apenas que elas devem disparar com menos frequência.

Um modelo com janela de 1 milhão de tokens, classificação cibernética Crítica e capacidade de enviar requisições arbitrárias à sua API ainda deve operar com:

O monitor do Astra pode parar uma execução no meio do trabalho. Portanto, trate qualquer tarefa longa como passível de retomada.

O design de teste para agentes não determinísticos continua válido: afirme o contrato, não a transcrição da conversa. O teste de contrato deve ser a palavra final, não a confiança no modelo.

Onde o uso do computador ainda faz sentido

A recomendação não é “nunca deixe o Astra clicar”. Três casos continuam sendo melhores na tela:

  1. portais de parceiros ou consoles administrativos sem API;
  2. verificações de frontend antes do lançamento;
  3. ferramentas desktop legadas em que a UI é a única superfície.

O Astra é o primeiro modelo em que vale a pena delegar esse tipo de trabalho. O aumento de velocidade do sistema Codex também pode torná-lo barato o suficiente para execução noturna.

A regra prática é:

Procure o contrato quando existir um contrato. Procure a tela quando não existir.

FAQ

O uso do computador do GPT-6 Astra funciona pela API?

Sim. O uso do computador aparece entre as ferramentas suportadas do Astra na API de Responses, ao lado de pesquisa na web, busca de arquivos, interpretador de código e geração de imagens.

Seu aplicativo fornece o ambiente e executa as ações propostas pelo modelo. A API também aplica as salvaguardas mais rigorosas da OpenAI: se o monitor de desalinhamento pausar uma tarefa, ela é interrompida em vez de aguardar uma revisão.

Qual é o tamanho máximo de especificação que posso fornecer?

A janela de contexto é de 1.050.000 tokens, com até 128.000 tokens de saída. Uma especificação com centenas de endpoints e esquemas completos cabe com sobra.

Prompts acima de 272 mil tokens de entrada são cobrados pelo dobro das taxas de entrada e cache. Armazene o prefixo da especificação em cache e mantenha pequenas as mensagens de cada teste.

O Astra vai inventar endpoints que não estão na especificação?

Com menos frequência que modelos anteriores. No benchmark interno de alucinação da OpenAI — em que menor é melhor — o Astra marcou 4,2%, contra 12,2% do Sol. Também é três vezes menos provável que ele deturpe as próprias capacidades.

Saídas estruturadas e uma execução validada por esquema no Apidog reduzem ainda mais o problema. Por isso, o teste de contrato deve prevalecer sobre a resposta do modelo.

É mais barato que o GPT-5.6 Sol para gerar testes?

Por token, não. O Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída, contra os preços promocionais de US$ 4 e US$ 20 do Sol.

Por tarefa concluída, a OpenAI afirma que o Astra usa muito menos tokens. Além disso, no fluxo “especificação primeiro”, o custo do modelo é uma despesa única: a CI executa os cenários sem o modelo.

Meça os dois modelos na sua própria especificação e compare os resultados lado a lado usando o guia da API.

A versão curta

O GPT-6 Astra pode operar um computador e, para superfícies sem API, isso é uma capacidade realmente útil. Para a API que você possui, porém, a tela é o caminho lento.

Entregue o contrato ao modelo, peça que ele escreva os cenários, execute-os na CI e mantenha as barreiras de segurança. O Astra chegou a essa conclusão por conta própria em vinte minutos. Sua equipe pode começar pelo mesmo lugar.

Top comments (0)