OpenAI Ultrafast는 새로운 모델이 아니라 서비스 티어입니다. Responses API에서 gpt-6-astra 요청에 service_tier: "ultrafast"를 추가하면 API 토큰 생성 속도가 최대 6배 빨라집니다. Codex에서는 최대 8배, 즉 초당 300토큰까지 생성한다고 알려져 있습니다. 비용은 표준의 6배로, 100만 토큰당 입력 $60, 출력 $300입니다. 표준 요금은 입력 $10, 출력 $50입니다. 모델 ID는 바뀌지 않으므로 응답이 더 똑똑해지는 것은 아닙니다. 긴 출력을 기다리는 사용자나 지연 시간에 민감한 단계에 적합하며, 배치 또는 백그라운드 작업에는 일반적으로 적합하지 않습니다.
OpenAI는 2026년 9월 29일 DevDay에서 GPT-6 Astra용 Ultrafast를 광범위하게 출시했습니다. DevDay의 다른 모든 정보 보기에서 관련 발표를 확인할 수 있습니다. 이 글에서는 가용성, 요청 방법, 가격, 속도 제한, 그리고 자체 측정값으로 계산할 수 있는 손익분기 모델을 다룹니다. 모델 자체가 궁금하다면 GPT-6 Astra API 가이드를 참고하세요. 전환 전에는 Apidog에서 두 티어를 동일한 프롬프트로 측정하는 것이 좋습니다.
OpenAI Ultrafast 한눈에 보기
| 항목 | 세부 정보 |
|---|---|
| 이것은 무엇인가요 | OpenAI API에서 가장 빠른 서비스 티어 |
| 매개변수 | Responses create 또는 WebSocket response.create에 service_tier: "ultrafast"
|
| 모델 | 현재 GPT-6 Astra, GPT-6.1 Sol은 “출시 예정” |
| 속도 주장 | API에서 토큰 생성 최대 6배 빠름, Codex에서 최대 8배(초당 300토큰) |
| 가격(Astra) | 100만 토큰당 입력 $60, 캐시 $6, 캐시 쓰기 $75, 출력 $300 |
| 속도 제한 | 티어 1~3: 500K TPM, 티어 4: 1M TPM, 티어 5: 5M TPM |
| 처리 | 미국 데이터 상주 및 글로벌 처리만 지원 |
| 전송 | WebSockets 강력 권장 |
| ChatGPT 요금제 | Pro 500 및 Enterprise의 ChatGPT Work, Codex |
출처: OpenAI의 Ultrafast 모드 가이드 및 가격 페이지.
Ultrafast란 무엇이며 누가 사용할 수 있는가
OpenAI의 DevDay 요약은 Ultrafast를 프리미엄 속도 티어로 설명합니다. 가이드에 따르면 GPT-6 Astra Ultrafast는 모든 API 사용자에게 낮은 기본 속도 제한으로 제공되며, OpenAI 계정 팀이 있는 조직은 더 높은 한도를 요청할 수 있습니다.
가이드에는 계정 팀을 통한 GPT-5.6 Sol 미리 보기 액세스도 나열되어 있습니다. OpenAI는 8월 13일 GPT-5.6 Sol에서 Ultrafast를 처음 미리 보기로 공개했습니다. 이후 모델로는 GPT-6.1 Sol이 언급되었지만, 두 모델의 Ultrafast 가격은 공개되지 않았습니다.
ChatGPT에서는 Ultrafast Astra가 Pro 500 및 Enterprise의 ChatGPT Work와 Codex에서 실행됩니다. 다만 이는 앱 구독 기능이며 API 사용량에는 적용되지 않습니다. 스크립트, CI 작업, 에이전트는 API 키 기준 토큰 비용을 지불해야 합니다.
속도 수치를 해석할 때는 다음을 구분해야 합니다.
- API의 주장은 토큰 생성 속도 최대 6배입니다.
- Codex의 초당 300토큰은 최대 8배라는 주장에 해당합니다.
- OpenAI는 Ultrafast의 첫 번째 토큰 생성 시간(TTFT)을 공개하지 않았습니다.
- 초당 토큰 수가 높더라도 첫 토큰까지의 대기 시간이 짧아진다는 보장은 없습니다.
service_tier: "ultrafast" 활성화 방법
각 요청에서 model을 gpt-6-astra로 설정하고 service_tier에 ultrafast를 지정합니다.
HTTP 요청
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "Explain why the sky is blue in one sentence.",
"service_tier": "ultrafast"
}'
WebSocket 연결 재사용
OpenAI는 특히 연속적인 도구 호출이 많은 에이전트에서 WebSocket 사용을 강력히 권장합니다. HTTP 요청을 반복하면 연결 및 요청별 네트워크 오버헤드가 Ultrafast의 생성 속도 이점을 상쇄할 수 있습니다.
다음 예시는 하나의 연결에서 두 턴을 스트리밍합니다.
from openai import OpenAI
client = OpenAI()
previous_response_id: str | None = None
prompts = [
"Explain why the sky is blue in one sentence.",
"Now explain why sunsets look red.",
]
with client.responses.connect() as connection:
for prompt in prompts:
connection.response.create(
model="gpt-6-astra",
service_tier="ultrafast",
previous_response_id=previous_response_id,
input=prompt,
)
for event in connection:
if event.type == "response.output_text.delta":
print(event.delta, end="", flush=True)
elif event.type == "response.completed":
previous_response_id = event.response.id
print()
break
elif event.type in {"response.failed", "response.incomplete", "error"}:
raise RuntimeError(event.to_json())
else:
raise RuntimeError("Connection closed before the response finished.")
패키지를 설치하고 API 키를 설정합니다.
pip install --upgrade "openai[realtime]"
export OPENAI_API_KEY="your-api-key"
연결 제한과 재연결 전략은 OpenAI WebSocket 모드 가이드에서 확인할 수 있습니다.
Standard, Fast, Batch와 비교한 Ultrafast 가격
짧은 컨텍스트(입력 272K 토큰 이하)에서 gpt-6-astra의 100만 토큰당 가격은 다음과 같습니다.
| 티어 | 입력 | 캐시된 입력 | 캐시 쓰기 | 출력 | 표준 대비 |
|---|---|---|---|---|---|
| 표준 | $10.00 | $1.00 | $12.50 | $50.00 | 1배 |
| 배치 또는 Flex | $5.00 | $0.50 | $6.25 | $25.00 | 0.5배 |
| Fast | $20.00 | $2.00 | $25.00 | $100.00 | 2배 |
| Ultrafast | $60.00 | $6.00 | $75.00 | $300.00 | 6배 |
입력이 272K 토큰을 넘으면 Ultrafast 가격은 다음과 같이 증가합니다.
- 입력: $120
- 캐시된 입력: $12
- 캐시 쓰기: $150
- 출력: $450
Fast는 이전의 Priority 처리 티어이며, 2026년 7월 30일에 이름이 변경되었습니다.
중요한 점은 입력 토큰에도 6배 요금이 적용된다는 것입니다. Ultrafast의 속도 주장은 출력 토큰 생성에 관한 것이므로, 긴 프롬프트에서는 생성 속도 이점이 없는 입력 토큰에도 높은 비용을 지불하게 됩니다.
속도 제한 및 데이터 상주
GPT-6 Astra의 기본 Ultrafast 제한은 사용량 티어별로 다음과 같습니다.
| 사용량 티어 | 기본 제한 |
|---|---|
| 티어 1~3 | 분당 500,000 토큰 |
| 티어 4 | 분당 1,000,000 토큰 |
| 티어 5 | 분당 5,000,000 토큰 |
Ultrafast는 미국 데이터 상주 및 글로벌 처리만 지원합니다. 계약 또는 프로젝트 설정상 EU나 기타 지역 엔드포인트를 통해 트래픽을 라우팅해야 한다면 해당 프로젝트에서는 Ultrafast를 사용할 수 없습니다.
Ultrafast가 비용을 상쇄하는 시점: 손익분기 모델
아래 계산은 벤치마크가 아니라 정가를 기반으로 한 예시입니다. 실제 서비스에서는 Standard와 Ultrafast를 모두 측정한 뒤 자신의 수치로 바꾸어야 합니다.
여기서는 Standard Astra가 초당 40개의 출력 토큰을 스트리밍한다고 가정합니다.
사용자에게 직접 제공되는 답변
조건:
- 캐시되지 않은 입력 토큰: 5,000개
- 출력 토큰: 2,000개
- Standard 출력 속도: 초당 40토큰
계산:
- Standard: 입력 $0.05 + 출력 $0.10 = $0.15
- Ultrafast: 입력 $0.30 + 출력 $0.60 = $0.90
- 추가 비용: $0.75
- Standard 생성 시간:
2,000 / 40 = 50초 - Ultrafast 생성 시간:
50 / 6 ≈ 8.3초 - 절약 시간: 약 41.7초
- 절약된 초당 추가 비용:
$0.75 / 41.7 = $0.018 - 시간당 대기 시간 제거 비용: 약 $64.80
측정된 속도 향상이 최대치에 못 미치면 절약되는 시간 1초당 비용은 더 높아집니다.
| 측정된 속도 향상 | 절약된 시간(50초 기준) | 초당 추가 비용 | 시간당 비용 |
|---|---|---|---|
| 6배 | 41.7초 | $0.018 | $64.80 |
| 4배 | 37.5초 | $0.020 | $72.00 |
| 2배 | 25.0초 | $0.030 | $108.00 |
에이전트 루프
다음과 같은 에이전트 실행을 가정합니다.
- 총 20단계
- 단계당 입력 토큰: 20,000개
- 캐시된 입력: 18,000개
- 신규 입력: 2,000개
- 단계당 출력 토큰: 500개
- 캐시 쓰기 요금은 계산에서 제외
계산:
- Standard: 캐시된 입력 $0.018 + 신규 입력 $0.020 + 출력 $0.025 = 단계당 $0.063
- Standard 총비용: $1.26
- Ultrafast 총비용: $7.56
- 추가 비용: $6.30
- Standard 생성 시간: 약 250초
- 6배 속도 기준 Ultrafast 생성 시간: 약 41.7초
- 절약 시간: 약 208초
- 절약된 초당 추가 비용: 약 $0.030
- 시간당 비용: 약 $109
에이전트 루프에서는 입력 비용 비중이 크므로, 사용자 응답 하나를 생성하는 경우보다 비용 효율이 더 나빠질 수 있습니다. 입력 토큰은 생성 속도 향상 없이 6배 가격이 적용되기 때문입니다.
결론적으로 다음 질문에 “예”라고 답할 수 있을 때 Ultrafast를 고려할 수 있습니다.
- 이 대기 시간 동안 실제 사용자나 금전적 가치가 있는 작업이 막히는가?
- 절약되는 시간이 시간당 약 $65~$110 이상의 가치를 가지는가?
내부 코딩 에이전트에서 엔지니어가 대기 중이거나, 유료 사용자 흐름에서 고객이 로딩 화면을 보고 있다면 기준을 통과할 수 있습니다. 반면 크론 작업은 일반적으로 그렇지 않습니다.
Ultrafast가 비용을 상쇄하지 못하는 경우
아무도 기다리지 않는 경우
야간 평가, 백필, 보고서 생성은 Batch API 또는 Flex를 고려하세요. 입력 $5, 출력 $25로 Ultrafast 요율의 1/12입니다.백그라운드 에이전트
무인 실행 후 완료 상태만 알리는 에이전트라면 몇 분 빨라져도 비즈니스 결과가 크게 달라지지 않을 수 있습니다.짧은 출력
50토큰 분류처럼 출력이 짧으면 생성 시간을 줄일 공간이 거의 없습니다. HTTP에서는 연결 설정과 TTFT가 전체 지연의 대부분을 차지할 수 있습니다.긴 프롬프트
입력이 많은 호출은 속도 향상과 무관한 입력 토큰에도 6배 가격을 냅니다. 272K 입력을 넘으면 단가도 더 상승합니다.지역별 처리 요구사항
EU 엔드포인트가 필요한 프로젝트에서는 사용할 수 없습니다.TTFT가 병목인 호출
GPT-6 Sol 지연 시간 분석에서 설명하듯 긴 추론 실행은 첫 번째 가시 토큰 이전에 많은 시간이 소요될 수 있습니다. 지연이 이 구간에 집중된다면 Ultrafast가 TTFT도 줄이는지 먼저 측정하세요.
전환하기 전에 Apidog에서 TTFT 및 총 시간 측정
약 10분이면 예시 계산의 자리 표시자를 실제 서비스 측정값으로 바꿀 수 있습니다.
-
Apidog에서
OPENAI_API_KEY를 사용하는 환경을 만듭니다. 다음 요청을 추가합니다.
- Method:
POST - URL:
https://api.openai.com/v1/responses - Header:
Authorization: Bearer {{OPENAI_API_KEY}}
{
"model": "gpt-6-astra",
"input": "<your real production prompt>",
"service_tier": "ultrafast",
"stream": true
}
요청을 복제한 뒤 Standard 기준선을 위해
service_tier필드를 제거합니다. 프롬프트와 나머지 파라미터는 동일하게 유지합니다.두 요청을 모두 실행합니다. Apidog에서 서버 전송 이벤트 스트림을 이벤트별로 확인하고 다음 값을 기록합니다.
- 첫
response.output_text.delta도착 시간: TTFT - 스트림 종료 시간: 총 시간
- 최종
response.completed이벤트의usage블록: 비용 계산용 토큰 사용량
각 변형을 최소 10회 실행합니다. 단일 실행 대신 중앙값과 p95를 비교하세요.
에이전트 루프는 WebSocket 경로로도 테스트합니다.
- URL:
wss://api.openai.com/v1/responses -
stream을 제외한 동일한 필드로response.create메시지 전송 - 첫 응답의
previous_response_id를 포함해 두 번째 턴 전송
WebSocket 대 SSE 비교에서 열린 연결이 중요한 이유를 확인할 수 있습니다.
절약된 시간은 다음과 같이 계산합니다.
절약 시간 = Standard 중앙값 총 시간 - Ultrafast 중앙값 총 시간
그다음 usage 토큰을 각 티어 가격으로 계산하고, 추가 비용을 절약 시간으로 나누세요.
절약된 초당 추가 비용 = (Ultrafast 비용 - Standard 비용) / 절약 시간(초)
이 수치가 사용자 대기 시간 또는 엔지니어 작업 시간의 가치보다 낮을 때 Ultrafast 전환을 검토할 수 있습니다.
자주 묻는 질문(FAQ)
OpenAI Ultrafast는 무엇인가요?
표준 가격의 6배로 API 토큰을 최대 6배 빠르게 생성하는 Responses API 서비스 티어입니다. 요청마다 service_tier: "ultrafast"를 지정해 활성화합니다.
Ultrafast는 더 똑똑한 모델인가요?
아닙니다. 동일한 gpt-6-astra 모델 ID를 호출합니다. 서비스 티어는 속도와 가격만 바꾸며 모델 자체를 변경하지 않습니다.
GPT-6 Astra Ultrafast의 비용은 얼마인가요?
짧은 컨텍스트에서 100만 토큰당 입력 $60, 캐시된 입력 $6, 캐시 쓰기 $75, 출력 $300입니다. Standard는 각각 $10, $1, $12.50, $50입니다.
초당 300토큰은 어디에서 나온 수치인가요?
OpenAI가 Codex의 Ultrafast에 대해 제시한 최대치이며, 최대 8배라는 주장에 해당합니다. API에 대한 주장은 최대 6배입니다.
GPT-6.1 Sol은 Ultrafast를 지원하나요?
아직 아닙니다. OpenAI는 출시 예정이라고 밝혔습니다. 현재 상태는 DevDay 2026 요약에서 확인할 수 있습니다.
다음 단계
가장 느린 사용자 대면 요청 하나를 선택하세요. Standard와 Ultrafast로 각각 10회 실행한 뒤, 중앙값 기준 절약 시간과 추가 비용을 비교하세요.
두 변형의 요청 본문, 응답, 타이밍, usage 데이터를 한 프로젝트에서 관리하려면 Apidog를 다운로드하세요.
Top comments (0)