GPT-6 Astra로 API 테스트 자동화하기: 화면보다 계약을 먼저 사용하라
GPT-6 Astra의 핵심 기능은 컴퓨터를 직접 사용할 수 있다는 점입니다. 2025년의 데모처럼 드롭다운에서 길을 잃는 수준이 아닙니다. OpenAI 출시 게시물에 따르면 Astra는 OSWorld 2.0에서 작업당 약 40분 만에 72.6%를 기록했고, 양식 작성, CRM 업데이트, 소프트웨어 설치, 자체 구축 사이트의 프런트엔드 QA까지 수행합니다. OpenAI는 Astra를 “세계 최고의 컴퓨터 사용 모델”이라고 부르며, 이번에는 데모가 그 주장을 뒷받침합니다.
API를 구축하거나 테스트한다면 Astra를 앱에 연결해 클릭하게 만들고 싶을 수 있습니다. 하지만 더 실용적인 방법은 계약서를 전달하는 것입니다. OpenAPI 사양은 화면보다 빠르고 저렴하며 검증 가능한 인터페이스입니다.
저희는 2일간의 실습 테스트에서 Astra가 스스로 이 전환을 수행하는 것을 확인했습니다. 이 글에서는 사양 우선 접근법이 더 나은 이유와 Apidog로 구성하는 방법을 설명합니다.
요약
GPT-6 Astra의 컴퓨터 사용 능력은 실제입니다.
- OSWorld 2.0: 72.6%
- ScreenSpot-Pro: 92.7%
- GPT-5.6 Sol보다 컴퓨터 사용 작업을 1.9배 빠르게 완료하는 Codex 하니스
- 단, 화면 조작은 작업당 수십 분과 많은 이미지 토큰을 사용하며 API 자체가 아니라 UI를 테스트함
자체 서비스의 경우 다음 흐름을 권장합니다.
- Apidog MCP 서버 또는 함수 도구로 OpenAPI 사양을 Astra에 제공합니다.
- Astra에게 테스트 시나리오를 작성하게 합니다.
- Apidog CLI를 CI에서 실행합니다.
- API가 없는 표면에만 컴퓨터 사용 기능을 적용합니다.
GPT-6 Astra가 할 수 있는 일
Astra의 기능은 단순한 웹사이트 검색보다 넓습니다. OpenAI는 다음 작업을 예로 듭니다.
- 온라인 양식 작성
- CRM 기록 및 캘린더 관리
- 문서 편집기에서 조사와 초안 작성
- 플롯을 사용한 과학 데이터 분석
- ChatGPT Sites를 통한 웹사이트 구축 및 호스팅
- 구축한 사이트의 프런트엔드 QA
데모에는 KiCad에서 인쇄 회로 기판을 배치하고 Blender에서 주택을 모델링하는 작업도 포함됩니다.
출시 게시물에 명시된 OpenAI 실행 벤치마크는 다음과 같습니다.
| 벤치마크 | GPT-6 Astra | GPT-5.6 Sol | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (오프라인 세트, 부분 점수) | 작업당 약 40분 만에 72.6% | 작업당 약 75분 만에 65.7% | 70.2% |
| ScreenSpot-Pro (도구 없음) | 92.7% | 76.9% | - |
| Agents’ Last Exam | 59.3% | 53.6% | 55.5% |
| AutomationBench | 41.4% | 18.1% | 26.9% |
점수 외에도 중요한 세부 사항이 있습니다.
- Astra는 Sol보다 약 47% 적은 시간으로 OSWorld 작업을 완료합니다.
- Agents’ Last Exam의 최고 점수 설정에서 Opus 5보다 약 65% 적은 출력 토큰을 사용합니다.
- OpenAI는 Codex 하니스를 업데이트했고, Mind2Web에서 기존 Sol 경험보다 컴퓨터 사용 작업 완료 속도가 1.9배 빨라졌습니다.
더 빠른 루프는 더 저렴한 루프를 의미합니다. 토큰 단위로 비용을 지불하는 애플리케이션에서는 특히 중요합니다.
행동 방식도 개선되었습니다. Astra는 답변이 결과에 영향을 줄 때만 집중적으로 질문하고, 작업 도중 조종을 받아도 방향을 잃지 않습니다. Codex에서는 사용자 응답을 기다리지 않고 작업을 계속하면서 비동기적으로 질문할 수도 있습니다.
낮을수록 좋은 OpenAI 내부 컴퓨터 사용 안전 벤치마크에서 Astra는 2.4%를 기록해 Sol의 22.0%보다 낮았습니다.
40분짜리 작업 비용
컴퓨터 사용은 다음 루프의 반복입니다.
스크린샷 → 추론 → 행동 → 다시 스크린샷
모든 스크린샷은 이미지 입력이고, 각 단계는 지금까지의 대화를 이어갑니다. 40분짜리 작업에는 수백 단계가 필요할 수 있습니다.
Astra의 표준 요금은 다음과 같습니다.
- 입력 토큰 100만 개당 $10
- 출력 토큰 100만 개당 $50
- 272K 이상의 입력 토큰 프롬프트: 입력 토큰 100만 개당 $20
- 캐시된 토큰: 100만 개당 $1
전체 기록을 컨텍스트에 유지하는 긴 세션은 완료 전에 장문 컨텍스트 요금으로 전환될 수 있습니다. 프롬프트 캐싱은 반복되는 접두사에 도움이 되지만, 스크린샷은 매 단계마다 새로 생성됩니다.
계약 경로와 비교해 보겠습니다.
- OpenAPI 사양은 하나의 접두사로 제공하고 한 번 캐시할 수 있습니다.
- 모델이 작성하는 각 테스트는 수백 토큰의 JSON입니다.
- 테스트 실행은 모델 측 비용이 없는 HTTP 호출입니다.
- 시나리오는 한 번 작성하면 모델이 매번 실행할 필요가 없습니다.
두 번째 비용은 금전이 아닌 중단 가능성입니다. OpenAI의 안전 개요에 따르면 생산 불일치 모니터는 합법적인 작업도 느리게 하거나 일시 중지하거나 중단할 수 있습니다. 특히 “에이전트가 장시간 실행되는 작업”이 영향을 받을 수 있습니다.
ChatGPT나 Codex에서는 작업 검토를 요청받지만, API에서는 작업이 중단됩니다. 40분짜리 화면 조작 세션은 5초짜리 API 호출보다 이러한 중단에 훨씬 취약합니다.
컴퓨터 사용과 계약 중 무엇을 선택할까?
| 상황 | 더 나은 도구 | 이유 |
|---|---|---|
| 자체 API 테스트 | 사양서 | 결정론적이고 재실행 비용이 낮으며 실제 계약을 검증함 |
| CI 회귀 테스트 스위트 | 사양서 | 모델 루프 없이 시나리오를 실행함 |
| API가 없는 타사 포털 | 컴퓨터 사용 | 전달할 계약이 없음 |
| 릴리스 전 엔드투엔드 프런트엔드 QA | 컴퓨터 사용 | UI 자체가 테스트 대상임 |
| 레거시 데스크톱 도구 | 컴퓨터 사용 | 화면만 존재함 |
| 문서와 실제 동작 비교 | 사양서, 그 다음 UI | 문서화된 요청과 응답을 비교한 뒤 렌더링된 페이지를 확인함 |
핵심 차이는 테스트 대상입니다.
- 컴퓨터 사용은 픽셀을 테스트합니다.
- 사양서는 약속을 테스트합니다.
프런트엔드가 고장나도 API는 정상일 수 있고, API가 고장나도 프런트엔드가 익숙한 오류 화면 뒤에 문제를 숨길 수 있습니다. 둘 다 중요하지만, API 팀이 계약을 제공한다면 먼저 계약을 테스트해야 합니다.
Astra에 API 계약 전달하기
Astra에 사양을 제공하는 방법은 세 가지입니다. 필요하면 서로 조합할 수 있습니다.
1. 파일로 제공하기
Apidog 프로젝트에서 OpenAPI 사양을 내보내거나 기존 사양을 Apidog로 가져온 뒤 요청에 포함합니다.
Astra의 컨텍스트 창은 1,050,000 토큰입니다. OpenAI의 MRCR 검색 테스트에서 Astra는 512K~1M 토큰 범위에서도 96.3%의 정확도를 유지했으며, Sol은 73.8%로 떨어졌습니다. 따라서 실제 사양 전체를 하나의 프롬프트에 담을 수 있고, 큰 사양을 나누어 처리하는 문제도 줄어듭니다.
2. MCP로 프로젝트 연결하기
Apidog MCP 서버는 Apidog 프로젝트, 게시된 문서 또는 OpenAPI 파일을 MCP 지원 클라이언트에 노출합니다.
이를 사용하면 Astra가 오래된 내보내기 파일 대신 최신 계약을 읽을 수 있습니다. Codex와 데스크톱 에이전트는 작업 중 엔드포인트 정의를 가져올 수 있습니다. 저희 테스트에서도 Astra가 스스로 사양을 찾아 읽도록 이 구성을 사용했습니다.
3. 사양을 도구로 변환하기
프로그램에서 사용하려면 엔드포인트를 함수 도구로 변환하고 Responses API를 통해 Astra를 호출합니다. 자세한 패턴은 OpenAPI를 AI 에이전트 도구로에서 확인할 수 있습니다.
모델 페이지에는 Astra의 기능으로 함수 호출, 구조화된 출력, 파일 검색 등이 나열되어 있습니다. 도구 호출에는 Chat Completions가 아니라 Responses API가 필요합니다.
Astra에게 사양 기반 테스트 시나리오 초안을 요청하는 최소 예시는 다음과 같습니다.
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": [
{"role": "developer", "content": "You are writing API test scenarios. Bias towards action. Only ask a question if the answer changes the test design. Output JSON matching the schema."},
{"role": "user", "content": "Here is our OpenAPI 3.1 spec. Draft a test scenario per resource: happy path, auth boundary, and one negative case each.\n\n<paste spec>"}
],
"text": {"format": {"type": "json_schema", "name": "scenarios", "schema": {"type": "object", "properties": {"scenarios": {"type": "array"}}, "required": ["scenarios"]}}}
}'
OpenAI의 모델 지침에서 기억해야 할 점은 두 가지입니다.
- Astra에는
none또는minimal노력 수준이 없으므로low또는medium에서 시작해야 합니다. - Astra는 이전 모델보다 설명을 요구하는 경향이 있으므로 개발자 메시지에서 “행동 지향(bias towards action)”을 명시하는 것이 효과적입니다.
4. 모델 없이 시나리오 실행하기
생성된 시나리오를 Apidog로 가져오고 상태 코드와 응답 스키마에 대한 어설션을 연결합니다. 그런 다음 파이프라인에서 Apidog CLI를 실행합니다.
모델은 테스트를 한 번 작성하고, CI는 이를 수천 번 실행합니다. 이것이 이 워크플로의 경제적 핵심입니다. Apidog 다운로드가 API 키와 함께 사용되는 이유이기도 합니다.
지침을 준수해도 안전 장치는 유지하기
Astra에 대한 OpenAI의 정렬 결과는 지금까지 발표된 결과 중 가장 높습니다.
- Hugging Face 사건 이후 구축된 허니팟 테스트에서 Sol은 허용된 목표를 48% 벗어났지만 Astra는 0%였습니다.
- Astra는 거부가 의도적으로 회피 가능하도록 구성된 경우에도 Codex 자동 검토 거부를 우회하려 하지 않았습니다.
- 간접 프롬프트 주입 견고성은 96.23%에서 99.79%로 증가했습니다.
그렇다고 게이트가 필요 없어진 것은 아닙니다. 단지 게이트가 덜 자주 작동한다는 의미입니다.
1,000,000토큰 컨텍스트, Critical 사이버 등급, API에 임의 요청을 보낼 수 있는 기능을 가진 모델은 여전히 다음 환경에서 실행해야 합니다.
- 범위가 제한된 자격 증명
- 변형에 대한 승인 게이트
- 모든 호출에 대한 추적
- 스테이징 환경
Astra의 모니터는 작업 중간에 실행을 중지할 수 있으므로 긴 작업은 모두 재개 가능하게 설계해야 합니다. 비결정론적 에이전트를 위한 테스트 설계의 원칙도 그대로 적용됩니다. 즉, 스크립트가 아니라 계약을 단언해야 합니다.
컴퓨터 사용이 유용한 경우
이 글을 “절대 클릭하게 하지 마라”는 뜻으로 받아들이면 안 됩니다. 다음 세 경우에는 화면 기반 접근이 더 낫습니다.
- API가 없는 파트너 포털 또는 관리 콘솔
- 사람이 수동으로 수행해야 하는 출시 당일 프런트엔드 확인
- UI가 유일한 표면인 레거시 데스크톱 도구
Astra는 이런 작업을 위임할 가치가 있는 첫 번째 모델입니다. Codex 하니스의 속도 향상으로 매일 밤 실행하기에도 충분히 저렴해졌습니다.
계약이 존재하면 계약을 사용하고, 계약이 없으면 화면을 사용하십시오.
자주 묻는 질문
GPT-6 Astra의 컴퓨터 사용은 API로 작동합니까?
예. 컴퓨터 사용은 웹 검색, 파일 검색, 코드 인터프리터, 이미지 생성과 함께 Responses API에서 Astra의 지원 도구로 제공됩니다. 애플리케이션이 환경을 제공하고 모델이 제안하는 작업을 실행합니다.
API는 OpenAI 보호 장치의 더 엄격한 측면도 적용합니다. 불일치 모니터에 의해 일시 중지된 작업은 검토를 기다리지 않고 중지됩니다.
얼마나 큰 사양을 제공할 수 있습니까?
컨텍스트 창은 1,050,000 토큰이고 출력 한도는 128,000 토큰입니다. 수백 개의 엔드포인트와 전체 스키마가 포함된 사양도 충분히 들어갑니다.
다만 272K 이상의 입력 토큰 프롬프트는 입력 및 캐시 요율의 2배로 청구됩니다. 사양 접두사를 캐시하고 테스트별 메시지는 작게 유지하십시오.
사양에 없는 엔드포인트를 환각합니까?
이전 모델보다 가능성이 낮습니다. 낮을수록 좋은 OpenAI 내부 환각 벤치마크에서 Astra는 4.2%, Sol은 12.2%를 기록했습니다. Astra가 자신의 능력을 잘못 표현할 가능성도 3배 낮습니다.
그래도 구조화된 출력과 Apidog의 스키마 검증 실행으로 나머지 오류를 잡아야 합니다. 이것이 계약 테스트가 최종 판단 기준이 되고 모델이 최종 판단자가 되지 않는 이유입니다.
테스트 생성에서 GPT-5.6 Sol보다 저렴합니까?
토큰당 비용은 아닙니다.
- Astra: 입력 토큰 100만 개당 $10, 출력 토큰 100만 개당 $50
- Sol 프로모션 요금: 입력 토큰 100만 개당 $4, 출력 토큰 100만 개당 $20
OpenAI는 완료된 작업 기준으로 Astra가 훨씬 적은 토큰을 사용한다고 주장합니다. 또한 사양 우선 워크플로에서는 모델 비용이 일회성 지출이 됩니다.
최종 결정 전에는 자체 사양으로 측정하십시오. API 가이드에서 두 모델을 나란히 비교하는 방법을 확인할 수 있습니다.
결론
GPT-6 Astra는 컴퓨터를 조작할 수 있으며, API가 없는 표면에는 진정한 도구입니다.
하지만 소유하고 있는 API에 대해서는 화면이 느린 경로입니다. 모델에 계약을 전달하고, 테스트 시나리오를 작성하게 하고, CI에서 실행하며, 안전 게이트를 유지하십시오.
Astra는 20분 만에 스스로 이 결론에 도달했습니다. 여러분의 팀은 그 결론에서 시작할 수 있습니다.

Top comments (0)