GPT-6 Astra: entregue o contrato da API, não apenas a tela
A principal característica do GPT-6 Astra é o uso do computador. Não no sentido de 2025, quando um modelo clicava em uma demonstração e se perdia em um menu suspenso: segundo a publicação de lançamento da OpenAI, o Astra alcança 72,6% no OSWorld 2.0 em aproximadamente 40 minutos por tarefa, preenche formulários, atualiza CRMs, instala software e executa QA de frontend em um site que ele mesmo construiu. No teste prático de dois dias, ele também mostrou que consegue trocar a tela pelo contrato da API quando essa é a opção mais eficiente.
Se você constrói ou testa APIs, a capacidade de controlar a tela é tentadora: basta apontar o Astra para o aplicativo e deixá-lo clicar. Mas existe uma abordagem menos impressionante e mais útil: entregue o contrato.
Uma especificação OpenAPI é uma interface mais rápida, barata e verificável para um modelo do que uma tela. Este artigo mostra quando usar cada abordagem e como configurar o Astra com o Apidog.
TL;DR
O uso do computador no GPT-6 Astra é real:
- 72,6% no OSWorld 2.0;
- 92,7% no ScreenSpot-Pro;
- tarefas de uso de computador concluídas pelo sistema Codex 1,9x mais rápido que na experiência do GPT-5.6 Sol.
Ainda assim, controlar a tela custa dezenas de minutos e muitos tokens de imagem por tarefa — além de testar a UI, não a API.
Para seus próprios serviços:
- entregue a especificação OpenAPI por meio do Apidog MCP Server ou como ferramentas de função;
- peça ao Astra para gerar os cenários de teste;
- importe-os para o Apidog;
- execute-os pelo CLI do Apidog na CI, sem manter um modelo no loop.
Reserve o uso do computador para superfícies que não possuem API.
O que o uso do computador do GPT-6 Astra pode fazer
A capacidade vai além de navegar em um site. A OpenAI lista:
- preenchimento de formulários online;
- atualização de registros em CRMs;
- gerenciamento de calendários;
- pesquisa e redação em editores de documentos;
- análise de dados científicos com gráficos;
- construção e hospedagem de sites no ChatGPT Sites;
- QA de frontend nesses sites.
As demonstrações também incluem o layout de uma placa de circuito impresso no KiCad e a modelagem de uma casa no Blender.
Benchmarks
Todos os números abaixo foram executados pela OpenAI na publicação de lançamento:
| Benchmark | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 — conjunto offline, pontuação parcial | 72,6% em ~40 min/tarefa | 65,7% em ~75 min/tarefa | 70,2% |
| ScreenSpot-Pro — sem ferramentas | 92,7% | 76,9% | — |
| Agents’ Last Exam | 59,3% | 53,6% | 55,5% |
| AutomationBench | 41,4% | 18,1% | 26,9% |
Dois detalhes importam mais do que as pontuações:
- o Astra conclui tarefas do OSWorld em cerca de 47% menos tempo que o Sol;
- nas configurações de maior pontuação, usa aproximadamente 65% menos tokens de saída que o Opus 5 no Agents’ Last Exam;
- a atualização do sistema Codex tornou a conclusão de tarefas de uso de computador 1,9x mais rápida que a experiência atual do Sol no Mind2Web.
Loops mais rápidos significam loops mais baratos.
O comportamento também melhorou. O Astra faz perguntas focadas apenas quando a resposta pode mudar o resultado, mantém a direção quando recebe instruções durante a tarefa e, no Codex, pode pedir esclarecimentos de forma assíncrona enquanto continua o trabalho independente da resposta.
No benchmark interno de segurança de uso de computador da OpenAI — em que menor é melhor — o Astra marcou 2,4%, contra 22,0% do Sol.
Quanto custa uma tarefa de 40 minutos?
O uso do computador funciona em um ciclo:
- captura de tela;
- raciocínio;
- ação;
- nova captura de tela.
Cada captura é uma entrada de imagem. Cada etapa também carrega o histórico da conversa. Assim, uma tarefa de 40 minutos pode envolver centenas de etapas.
Na taxa padrão do Astra, de US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de tokens de saída, prompts acima de 272 mil tokens de entrada custam US$ 20 por milhão. Uma sessão longa que mantém todo o histórico em contexto pode entrar na faixa de contexto longo antes de terminar.
O cache de prompts reduz o custo do prefixo repetido para US$ 1 por milhão de tokens em cache, mas as capturas de tela continuam sendo novas a cada etapa.
Compare com o caminho baseado no contrato:
- a especificação OpenAPI é um prefixo que pode ser armazenado em cache uma vez;
- cada cenário gerado pelo modelo contém apenas algumas centenas de tokens JSON;
- depois de escrito, o cenário é executado como uma chamada HTTP — sem outro custo de modelo.
Existe ainda um custo operacional. A visão geral de segurança da OpenAI informa que o monitor de desalinhamento de produção pode desacelerar, pausar ou interromper um trabalho legítimo, especialmente em tarefas prolongadas.
No ChatGPT ou no Codex, a pessoa usuária pode ser solicitada a revisar a ação. Na API, a tarefa é interrompida. Uma sessão de 40 minutos controlando a tela está mais exposta a esse tipo de interrupção do que uma chamada de API de cinco segundos.
Uso do computador versus contrato
A escolha depende do que está sendo testado:
| Situação | Melhor ferramenta | Motivo |
|---|---|---|
| Testar sua própria API | Especificação | Determinística, barata de reexecutar e valida o contrato real |
| Suíte de regressão na CI | Especificação | Os cenários rodam sem um modelo no loop |
| Portal de terceiros sem API | Uso do computador | Não existe um contrato para entregar |
| QA de frontend antes do lançamento | Uso do computador | A UI é o objeto do teste |
| Ferramenta desktop legada | Uso do computador | A tela é a única superfície disponível |
| Verificar se a documentação corresponde ao comportamento | Especificação, depois UI | Envie a requisição documentada, compare a resposta e faça uma verificação pontual na página renderizada |
A distinção é simples:
- o uso do computador testa pixels;
- a especificação testa a promessa.
Quando o frontend quebra, a API pode continuar funcionando. Quando a API quebra, o frontend pode esconder o problema atrás de uma mensagem amigável. Ambos os testes são importantes, mas equipes de API entregam a promessa: teste o contrato primeiro.
Como entregar seu contrato de API ao Astra
Há três formas complementares de fornecer a especificação.
1. Inclua o arquivo OpenAPI
Exporte a especificação OpenAPI do seu projeto no Apidog ou importe primeiro uma especificação existente. Depois, inclua o arquivo na requisição.
A janela de contexto de 1.050.000 tokens do Astra comporta uma especificação realista inteira. No teste de recuperação MRCR da OpenAI, o modelo manteve 96,3% de precisão entre 512 mil e 1 milhão de tokens, enquanto o Sol caiu para 73,8%.
Especificações grandes deixam de exigir divisão em várias partes.
2. Conecte o projeto pelo MCP
O Apidog MCP Server expõe seu projeto Apidog, sua documentação publicada ou um arquivo OpenAPI a qualquer cliente compatível com MCP.
Assim, o Astra lê o contrato atual em vez de uma exportação desatualizada. O Codex e agentes desktop podem extrair as definições de endpoint enquanto trabalham. Foi essa configuração que permitiu ao Astra, durante nosso teste, encontrar e ler a especificação por conta própria.
3. Transforme endpoints em ferramentas
Para uso programático, converta endpoints em ferramentas de função e chame o Astra pela API de Responses. O processo é descrito em OpenAPI para ferramentas de agente de IA.
A página do modelo lista chamadas de função, saídas estruturadas e busca de arquivos entre os recursos do Astra. A chamada de ferramentas exige a API de Responses, não a API Chat Completions.
Uma requisição mínima para pedir ao Astra que crie cenários de teste a partir de uma especificação:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "Você está escrevendo cenários de teste de API. Priorize a ação. Pergunte apenas se a resposta mudar o design do teste. Saída JSON correspondente ao esquema."},
{"role": "user", "content": "Aqui está nossa especificação OpenAPI 3.1. Crie um cenário de teste por recurso: caminho feliz, limite de autenticação e um caso negativo para cada.\n\n<cole a especificação>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
Duas recomendações do guia do modelo da OpenAI são importantes:
- o Astra não oferece esforço
noneouminimal; comece comlowoumedium; - ele pede esclarecimentos com mais prontidão que modelos anteriores, então diga explicitamente para priorizar a ação.
4. Execute os cenários sem o modelo
Depois que o Astra gerar os cenários:
- importe-os para o Apidog;
- adicione asserções de códigos de status;
- valide os esquemas de resposta;
- execute a coleção pelo CLI do Apidog na pipeline de CI.
O modelo escreve os testes uma vez. A CI os executa milhares de vezes sem precisar de outro modelo. Esse é o argumento econômico central. Se necessário, o Download Apidog fica disponível para configurar o fluxo localmente.
Mantenha as barreiras de segurança
Os resultados de alinhamento publicados para o Astra são os melhores da OpenAI até agora:
- no teste honeypot criado após o incidente do Hugging Face, o Sol ultrapassou o alvo autorizado em 48% das vezes; o Astra, em 0%;
- o Astra nunca tentou contornar uma negação de revisão automática do Codex, mesmo quando ela foi configurada deliberadamente para ser evitável;
- a robustez contra injeção indireta de prompt subiu de 96,23% para 99,79%.
Isso não elimina a necessidade de barreiras. Significa apenas que elas devem disparar com menos frequência.
Um modelo com janela de 1 milhão de tokens, classificação cibernética Crítica e capacidade de enviar requisições arbitrárias à sua API ainda deve operar com:
- ambiente de staging;
- credenciais limitadas;
- barreira de aprovação para mutações;
- rastreamento de cada chamada;
- retomada segura de tarefas interrompidas.
O monitor do Astra pode parar uma execução no meio do trabalho. Portanto, trate qualquer tarefa longa como passível de retomada.
O design de teste para agentes não determinísticos continua válido: afirme o contrato, não a transcrição da conversa. O teste de contrato deve ser a palavra final, não a confiança no modelo.
Onde o uso do computador ainda faz sentido
A recomendação não é “nunca deixe o Astra clicar”. Três casos continuam sendo melhores na tela:
- portais de parceiros ou consoles administrativos sem API;
- verificações de frontend antes do lançamento;
- ferramentas desktop legadas em que a UI é a única superfície.
O Astra é o primeiro modelo em que vale a pena delegar esse tipo de trabalho. O aumento de velocidade do sistema Codex também pode torná-lo barato o suficiente para execução noturna.
A regra prática é:
Procure o contrato quando existir um contrato. Procure a tela quando não existir.
FAQ
O uso do computador do GPT-6 Astra funciona pela API?
Sim. O uso do computador aparece entre as ferramentas suportadas do Astra na API de Responses, ao lado de pesquisa na web, busca de arquivos, interpretador de código e geração de imagens.
Seu aplicativo fornece o ambiente e executa as ações propostas pelo modelo. A API também aplica as salvaguardas mais rigorosas da OpenAI: se o monitor de desalinhamento pausar uma tarefa, ela é interrompida em vez de aguardar uma revisão.
Qual é o tamanho máximo de especificação que posso fornecer?
A janela de contexto é de 1.050.000 tokens, com até 128.000 tokens de saída. Uma especificação com centenas de endpoints e esquemas completos cabe com sobra.
Prompts acima de 272 mil tokens de entrada são cobrados pelo dobro das taxas de entrada e cache. Armazene o prefixo da especificação em cache e mantenha pequenas as mensagens de cada teste.
O Astra vai inventar endpoints que não estão na especificação?
Com menos frequência que modelos anteriores. No benchmark interno de alucinação da OpenAI — em que menor é melhor — o Astra marcou 4,2%, contra 12,2% do Sol. Também é três vezes menos provável que ele deturpe as próprias capacidades.
Saídas estruturadas e uma execução validada por esquema no Apidog reduzem ainda mais o problema. Por isso, o teste de contrato deve prevalecer sobre a resposta do modelo.
É mais barato que o GPT-5.6 Sol para gerar testes?
Por token, não. O Astra custa US$ 10 por milhão de tokens de entrada e US$ 50 por milhão de saída, contra os preços promocionais de US$ 4 e US$ 20 do Sol.
Por tarefa concluída, a OpenAI afirma que o Astra usa muito menos tokens. Além disso, no fluxo “especificação primeiro”, o custo do modelo é uma despesa única: a CI executa os cenários sem o modelo.
Meça os dois modelos na sua própria especificação e compare os resultados lado a lado usando o guia da API.
A versão curta
O GPT-6 Astra pode operar um computador e, para superfícies sem API, isso é uma capacidade realmente útil. Para a API que você possui, porém, a tela é o caminho lento.
Entregue o contrato ao modelo, peça que ele escreva os cenários, execute-os na CI e mantenha as barreiras de segurança. O Astra chegou a essa conclusão por conta própria em vinte minutos. Sua equipe pode começar pelo mesmo lugar.

Top comments (0)