GPT-6 Astra API 실전 가이드
OpenAI는 2026년 9월 3일 GPT-6 Astra를 일부 제한된 조직에 먼저 출시한 뒤, 며칠에 걸쳐 ChatGPT Plus, Pro, Business, Enterprise 사용자와 OpenAI API, Microsoft Azure, AWS Bedrock에 순차적으로 공개했습니다. 모델 ID는 gpt-6-astra이며 1,050,000토큰 컨텍스트 창을 제공합니다. OpenAI는 Astra를 “현재까지 소프트웨어 엔지니어링을 위한 최고의 모델”이라고 부릅니다. 또한 사이버 보안 기능에 Critical 등급을 부여한 첫 모델로, 이 등급은 API에서 모델의 동작 방식에도 영향을 줍니다.
이 글은 API 사용에 초점을 둔 실전 가이드입니다. 모델 ID와 엔드포인트, 첫 요청, 5가지 추론 노력 수준, 장문 컨텍스트 및 Fast 모드 요금, GPT-5.6 Sol과의 호환성 변경, 그리고 Sol 프로모션 요금 대비 2.5배 가격이 가치 있는지 다룹니다. 수치는 OpenAI 모델 페이지를 기준으로 했으며, 실제 사용 경험은 2일간의 실습 보고서에서 확인할 수 있습니다.
핵심 요약
- 모델 ID는
gpt-6-astra이며 단일 스냅샷으로 제공됩니다. - Chat Completions, Responses, Batch를 지원합니다. Realtime, Assistants, fine-tuning은 지원하지 않습니다.
- 함수 호출과 내장 도구를 사용하려면 Responses API가 필요합니다.
- 컨텍스트 창은 1,050,000토큰, 최대 출력은 128,000토큰입니다.
- 지식 차단일은 2026년 4월 30일입니다.
- 텍스트와 이미지 입력, 텍스트 출력을 지원합니다.
- 표준 요금은 입력 100만 토큰당 $10, 캐시 읽기 $1, 캐시 쓰기 $12.50, 출력 $50입니다.
- 입력이 272K 토큰을 초과하면 장문 컨텍스트 요금이 적용됩니다.
- Batch와 Flex는 표준 요금의 절반이며, Fast 모드는 두 배입니다.
- 추론 노력 수준은
low,medium,high,xhigh,max입니다.none과minimal은 제거되었습니다. - Sol에서 지원하던
temperature,top_p,logprobs가 제거되었습니다. -
prompt_cache_retention은prompt_cache_options.ttl로 변경되었습니다. - GPT-5.6 Sol의 프로모션 요금은 최소 2026년 11월 21일까지 입력 $4, 출력 $20입니다. Astra는 양쪽 모두 2.5배 비쌉니다.
GPT-6 Astra 한눈에 보기
| 항목 | 값 |
|---|---|
| 모델 ID | gpt-6-astra |
| 컨텍스트 창 | 1,050,000토큰 |
| 최대 출력 | 128,000토큰 |
| 지식 차단일 | 2026년 4월 30일 |
| 모달리티 | 입력: 텍스트, 이미지 / 출력: 텍스트 |
| 엔드포인트 | Chat Completions, Responses, Batch |
| 지원되지 않음 | Realtime, Assistants, fine-tuning |
| 기능 | 스트리밍, 구조화된 출력, 함수 호출, 파일 검색, 웹 검색, 프롬프트 캐싱, 이미지 입력 |
| 내장 도구 | 컴퓨터 사용, 웹 검색, 파일 검색, 코드 인터프리터, 이미지 생성 |
| 추론 노력 |
low, medium, high, xhigh, max
|
| Tier 5 속도 제한 | 15,000 RPM, 40,000,000 TPM |
| 추가 제공처 | Microsoft Azure, AWS Bedrock, OpenRouter(openai/gpt-6-astra) |
| 데이터 처리 | 적격 API 고객을 위한 Zero Data Retention |
Enterprise 작업 공간에서는 Astra가 기본적으로 비활성화되어 있으므로 관리자가 먼저 활성화해야 합니다. ChatGPT에서 Astra 사용량은 기존 구독 한도에 포함됩니다. Pro, Business, Enterprise 플랜 사용자는 GPT-6 Astra Pro도 사용할 수 있습니다.
첫 번째 요청
Responses API가 기본 인터페이스이며 도구 사용에도 필수입니다. 최소한의 Python 호출은 다음과 같습니다.
from openai import OpenAI
client = OpenAI()
response = client.responses.create(
model="gpt-6-astra",
reasoning={"effort": "medium"},
input=[
{"role": "developer", "content": "You are a senior API engineer. Bias towards action. Ask only when the answer would change the result."},
{"role": "user", "content": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."},
],
)
print(response.output_text)
print(response.usage)
동일한 요청을 curl로 보내면 다음과 같습니다.
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"reasoning": {"effort": "medium"},
"input": "Review this OpenAPI operation for auth and validation gaps, then propose three test cases."
}'
일반 텍스트 생성에는 Chat Completions도 계속 사용할 수 있습니다. 다만 엔드포인트와 메시지 형식에 맞게 요청을 바꾸고, OpenAI 지침에 따라 temperature와 top_p를 삭제하세요. 함수 호출이나 내장 도구가 필요해지는 순간 Responses API로 전환해야 합니다. 요청 형식은 Responses API 가이드에서 자세히 확인할 수 있습니다.
개발자 메시지를 구체적으로 작성하기
개발자 메시지는 이전보다 중요해졌습니다. OpenAI의 모델 지침에 따르면 Astra는 이전 모델보다 “더 쉽게 설명을 요청”하는 경향이 있습니다. 따라서 다음 지침을 명시하는 것이 좋습니다.
- 행동 지향적으로 답하도록 지시합니다.
- 사용자 지침이 기술 파일이나 첨부 파일의 지침보다 우선한다고 선언합니다.
- 질문은 결과를 바꿀 때만 하도록 제한합니다.
- 목록과 테이블 대신 산문을 원한다면 산문 형식을 명시합니다.
Astra는 기술(skills)과 첨부 파일에 포함된 지침에도 더 민감합니다. 지침 간 우선순위를 프롬프트에서 분명히 지정하세요.
추론 노력: 5단계, none 없음
GPT-5.6은 none부터 max까지 6단계의 노력 수준을 제공했습니다. Astra는 다음 5단계만 제공합니다.
low → medium → high → xhigh → max
현재 none 또는 minimal을 사용 중이라면 low로 바꾼 뒤 평가하는 것이 OpenAI의 마이그레이션 권장 사항입니다. 나머지 설정은 기존 수준을 유지하면 됩니다.
이 변경은 저비용 작업의 선택지를 줄입니다. GPT-5.6 제품군에서 none의 Luna는 빠른 고전적 완료 옵션이었지만 Astra에는 직접적인 대응 수준이 없습니다. 따라서 기계적인 작업은 GPT-5.6 Terra나 Luna로 라우팅하고, Astra는 어려운 호출에 예약하는 방식이 합리적입니다.
반대로 max는 출시 벤치마크가 실행된 수준이며, 모든 노력 수준에서 평가 점수가 최대였던 설정입니다. 다만 Artificial Analysis는 max 실행에서 첫 토큰까지 7분 이상 걸리는 경우를 측정했습니다. 토큰 예산을 세우기 전에 지연 시간 예산부터 정하세요.
GPT-6 Astra 비용
OpenAI의 가격 페이지에 따른 100만 토큰당 요금은 다음과 같습니다.
| 계층 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|
| 표준 | $10.00 | $1.00 | $50.00 |
| 표준, 장문 컨텍스트(272K 입력 초과) | $20.00 | $2.00 | $75.00 |
| Batch / Flex | $5.00 | $0.50 | $25.00 |
| Batch, 장문 컨텍스트 | $10.00 | $1.00 | $37.50 |
| Fast 모드 | $20.00 | $2.00 | $100.00 |
| Fast 모드, 장문 컨텍스트 | $40.00 | $4.00 | $150.00 |
캐시 쓰기는 100만 토큰당 $12.50입니다. Fast 모드는 표준 처리 속도의 최대 2배를 제공하지만 표준 요금의 2배가 청구됩니다.
GPT-5.6 제품군과 비교
| 모델 | 입력 | 캐시된 입력 | 출력 |
|---|---|---|---|
| GPT-5.6 Sol(최소 2026년 11월 21일까지 프로모션) | $4.00 | $0.40 | $20.00 |
| GPT-5.6 Terra | $2.00 | $0.20 | $12.00 |
| GPT-5.6 Luna | $0.20 | $0.02 | $1.20 |
Sol의 정가는 입력 $5, 출력 $30입니다. $4와 $20 요금은 8월 21일부터 적용되었으며, OpenAI는 최소 11월 21일까지 유지한다고 밝혔습니다.
프로모션 요금 기준으로 Astra는 입력과 출력 모두 Sol보다 2.5배 비쌉니다. Sol 정가와 비교하면 입력은 2배, 출력은 약 1.67배입니다.
실제 에이전트 실행 비용
다음과 같은 실행을 가정해 보겠습니다.
- 200,000토큰 코드베이스 스냅샷을 한 번 읽음
- 30회 호출에 걸쳐 캐시된 접두사를 재사용함
- 총 60,000토큰을 출력함
비용은 다음과 같습니다.
- Astra: 최초 읽기 $2.00 + 캐시 읽기 29회 × $0.20($5.80) + 출력 $3.00 = 약 $10.80
- Sol 프로모션: 최초 읽기 $0.80 + 캐시 읽기 $2.32 + 출력 $1.20 = 약 $4.32
이 경우에도 비용 비율은 2.5배입니다.
Astra가 실제로 더 적은 호출과 출력 토큰으로 작업을 완료한다면 최종 작업당 비용은 비슷해질 수 있습니다. OpenAI는 Terminal-Bench 4.0에서 높은 요금에도 불구하고 Sol보다 작업당 비용이 약 9% 낮다고 주장합니다. 또한 Agents' Last Exam에서는 Claude Opus 5보다 약 65% 적은 출력 토큰을 사용한다고 밝혔습니다.
이 수치가 여러분의 워크로드에도 적용되는지 직접 측정해야 합니다. 그렇지 않다면 단순히 2.5배를 지불하게 됩니다.
비용을 낮추는 방법은 두 가지입니다.
- 272K 임계값을 피합니다. 이 값을 넘으면 입력 및 캐시 요금이 두 배가 됩니다. 도구 출력을 줄이고 정적 접두사를 캐시하세요.
- 대기 가능한 작업에는 Batch를 사용합니다. 모든 요금이 절반으로 줄어듭니다.
GPT-5.6 Sol에서 마이그레이션할 때 확인할 사항
OpenAI가 제공한 마이그레이션 목록을 그대로 적용하는 것이 안전합니다.
1. 샘플링 매개변수 제거
다음 매개변수는 제거해야 합니다.
temperaturetop_ptop_logprobs
Chat Completions에서는 logprobs도 삭제하세요. Responses API에서는 include 배열에서 message.output_text.logprobs를 제거해야 합니다.
API가 해당 필드를 무시할 것이라고 가정하지 말고, 클라이언트 코드 전체를 grep하여 정리하세요.
2. 최소 추론 노력은 low
none 또는 minimal 설정은 모두 low로 변경해야 합니다.
3. 캐시 유지 방식 변경
기존 설정:
{
"prompt_cache_retention": "30m"
}
Astra 설정:
{
"prompt_cache_options": {
"ttl": "30m"
}
}
GPT-5.6을 위해 설정한 명시적 캐싱 모드는 이 변경 외에는 그대로 유지할 수 있습니다.
4. 도구 사용에는 Responses API 필요
Chat Completions는 텍스트 생성에는 사용할 수 있지만, 함수 호출과 내장 도구는 Responses API에서 사용해야 합니다.
5. 프롬프트를 행동 중심으로 수정
Astra에는 다음과 같은 프롬프트가 더 적합합니다.
- 행동 지향적인 문구를 추가합니다.
- 사용자 지침이 기술 파일보다 우선한다고 선언합니다.
- UI가 산문을 기대한다면 산문 형식을 명시합니다.
- 불필요한 확인 질문은 하지 않도록 지시합니다.
구조화된 출력이나 함수 정의에 영향을 주는 변경 사항은 없습니다. Sol에서 동작하던 스키마는 Astra에서도 사용할 수 있습니다.
가장 먼저 체감할 행동 변화는 질문 방식입니다. Sol에서는 완료까지 실행되던 프롬프트가 Astra에서는 명확한 질문과 함께 멈출 수 있습니다. 개발자 메시지에서 예상되는 답을 미리 제공하면 중단을 줄일 수 있습니다.
Sol보다 2.5배의 가치가 있는가?
에이전트 및 장문 컨텍스트 작업에 대해서는 출시 수치만 보면 그렇다고 할 수 있습니다. 아래 수치는 각 모델의 최고 노력 수준에서 OpenAI가 실행한 결과입니다.
| 벤치마크 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| FrontierCode 1.1 Extended | 64.5% | 60.6% | 63.6% |
| 내부 데이터베이스 마이그레이션 작업 | 63.9% | 42.7% | 57.8% |
| OSWorld 2.0 | 72.6% | 65.7% | - |
| MRCR v2 8-needle, 512K ~ 1M | 96.3% | 73.8% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% |
| Humanity's Last Exam(도구 포함) | 57.2% | - | 65.0% |
개발자 관점에서 특히 중요한 격차는 다음과 같습니다.
- 에이전트 터미널 작업에서 Sol보다 20점 높음
- 장문 컨텍스트 검색 성능이 1M 컨텍스트 창을 실제로 활용 가능한 수준으로 만듦
- DeepSWE의 격차는 작음
- Claude Fable 5.1은 Humanity's Last Exam에서 Astra보다 거의 8점 앞섬
- Artificial Analysis의 독립 지수에서 Astra는 202개 모델 중 2위
완벽한 압승은 아닙니다. Fable 5.1 벤치마크 분석에서도 비교의 다른 측면을 확인할 수 있습니다.
Sol이 더 적합한 경우
- 낮은 노력 수준으로 충분한 짧은 호출
- 2.5배 요금이 지배적인 대량 호출
-
none스타일의 지연 시간이 필요한 작업
Astra가 더 적합한 경우
- 긴 에이전트 실행
- 전체 저장소 컨텍스트를 사용하는 작업
- 컴퓨터 사용
- Sol이 표류하거나 포기했던 작업
배포 전에 스왑 테스트하기
마이그레이션 자체는 오후에 완료할 수 있을 만큼 작지만, 성능과 비용을 측정할 만큼 중요합니다.
Apidog에서 모델 ID를 환경 변수로 관리하면 동일하게 저장된 요청을 gpt-5.6-sol과 gpt-6-astra에 한 번의 스위치로 실행할 수 있습니다.
다음 검증을 자동화하세요.
-
usage.input_tokens에 대한 assertion 추가 -
usage.output_tokens에 대한 assertion 추가 - 캐시된 토큰 수에 대한 assertion 추가
- 대표적인 작업 세트를 두 모델에 모두 전송
- 총 토큰, 경과 시간, 작업 성공률, 작업당 비용 비교
이렇게 하면 출시 벤치마크가 아니라 실제 트래픽으로 “2.5배 가격이 정당한가?”라는 질문에 답할 수 있습니다.
같은 테스트 프로젝트에 다음 두 가지 확인도 추가하세요.
-
temperature가 여전히 포함된 요청을 테스트 환경에서 보내고 응답을 기록합니다. 프로덕션에서 우연히 동작을 확인하지 마세요. - 긴 프롬프트가 272K 입력 토큰 미만인지 확인합니다. 이 선을 넘으면 요금이 조용히 두 배가 됩니다.
이 테스트 세트를 회귀 테스트로 예약하세요. 아직 Apidog가 없다면 Apidog를 다운로드할 수 있습니다. 이전 세대 구성은 GPT-5.6 API 가이드에서 확인할 수 있습니다.
FAQ
GPT-6 Astra 모델 ID는 무엇인가요?
gpt-6-astra이며 단일 스냅샷으로 제공됩니다. Azure와 AWS Bedrock에서도 사용할 수 있고, OpenRouter에서는 openai/gpt-6-astra로 제공됩니다.
GPT-6 Astra는 fine-tuning 또는 Realtime API를 지원하나요?
아니요. Chat Completions, Responses, Batch만 지원하며 Realtime, Assistants, fine-tuning은 지원하지 않습니다.
컨텍스트 창과 최대 출력은 얼마인가요?
입력 컨텍스트는 1,050,000토큰이고 최대 출력은 128,000토큰입니다. 입력이 272K 토큰을 초과하면 장문 컨텍스트 요금이 적용됩니다.
Sol에서 전환한 후 요청이 실패하는 이유는 무엇인가요?
대부분 다음 설정이 남아 있기 때문입니다.
-
temperature또는top_p -
none또는minimal추론 노력 prompt_cache_retention
Astra에서는 이 세 가지를 제거하거나 새 형식으로 바꿔야 합니다. 위의 마이그레이션 목록을 확인하세요.
요청이 스스로 중단될 수 있나요?
예. OpenAI는 도구를 사용하는 요청에 대해 불일치 모니터를 실행합니다. API에서는 플래그가 지정된 작업이 검토를 위해 일시 중지되지 않고 중단될 수 있습니다.
긴 에이전트 실행이 가장 큰 영향을 받으므로 재개 가능한 작업으로 설계하세요. Critical 사이버 임계값 게시물에서 관련 안전 장치의 동작을 설명합니다.
이번 주에 할 일
이번 주에는 하나의 에이전트 워크로드를 Responses API와 gpt-6-astra로 옮겨 보세요.
-
temperature,top_p,logprobs를 제거합니다. - 추론 노력을
medium으로 설정합니다. - 동일한 입력을 Sol과 Astra에 전송합니다.
- 토큰 사용량과 경과 시간을 측정합니다.
- 작업당 비용과 성공률을 비교합니다.
Astra의 작업당 비용이 Sol과 같거나 낮다면 나머지 워크로드도 마이그레이션하세요. 그렇지 않더라도 실제 수치를 얻을 수 있으며, 이는 출시 벤치마크만 보는 것보다 훨씬 유용합니다.

Top comments (0)