DEV Community

Cover image for 오픈AI 초고속: 6배 속도, 6배 가격. 언제 본전 뽑을까?
Rihpig
Rihpig

Posted on Originally published at apidog.com

오픈AI 초고속: 6배 속도, 6배 가격. 언제 본전 뽑을까?

OpenAI Ultrafast는 새로운 모델이 아니라 서비스 티어입니다. Responses API에서 gpt-6-astra 요청에 service_tier: "ultrafast"를 추가하면 API 토큰 생성 속도가 최대 6배 빨라집니다. Codex에서는 최대 8배, 즉 초당 300토큰까지 생성한다고 알려져 있습니다. 비용은 표준의 6배로, 100만 토큰당 입력 $60, 출력 $300입니다. 표준 요금은 입력 $10, 출력 $50입니다. 모델 ID는 바뀌지 않으므로 응답이 더 똑똑해지는 것은 아닙니다. 긴 출력을 기다리는 사용자나 지연 시간에 민감한 단계에 적합하며, 배치 또는 백그라운드 작업에는 일반적으로 적합하지 않습니다.

지금 Apidog를 사용해 보세요

OpenAI는 2026년 9월 29일 DevDay에서 GPT-6 Astra용 Ultrafast를 광범위하게 출시했습니다. DevDay의 다른 모든 정보 보기에서 관련 발표를 확인할 수 있습니다. 이 글에서는 가용성, 요청 방법, 가격, 속도 제한, 그리고 자체 측정값으로 계산할 수 있는 손익분기 모델을 다룹니다. 모델 자체가 궁금하다면 GPT-6 Astra API 가이드를 참고하세요. 전환 전에는 Apidog에서 두 티어를 동일한 프롬프트로 측정하는 것이 좋습니다.

OpenAI Ultrafast 한눈에 보기

항목 세부 정보
이것은 무엇인가요 OpenAI API에서 가장 빠른 서비스 티어
매개변수 Responses create 또는 WebSocket response.create에 service_tier: "ultrafast"
모델 현재 GPT-6 Astra, GPT-6.1 Sol은 “출시 예정”
속도 주장 API에서 토큰 생성 최대 6배 빠름, Codex에서 최대 8배(초당 300토큰)
가격(Astra) 100만 토큰당 입력 $60, 캐시 $6, 캐시 쓰기 $75, 출력 $300
속도 제한 티어 1~3: 500K TPM, 티어 4: 1M TPM, 티어 5: 5M TPM
처리 미국 데이터 상주 및 글로벌 처리만 지원
전송 WebSockets 강력 권장
ChatGPT 요금제 Pro 500 및 Enterprise의 ChatGPT Work, Codex

출처: OpenAI의 Ultrafast 모드 가이드 및 가격 페이지.

Ultrafast란 무엇이며 누가 사용할 수 있는가

OpenAI의 DevDay 요약은 Ultrafast를 프리미엄 속도 티어로 설명합니다. 가이드에 따르면 GPT-6 Astra Ultrafast는 모든 API 사용자에게 낮은 기본 속도 제한으로 제공되며, OpenAI 계정 팀이 있는 조직은 더 높은 한도를 요청할 수 있습니다.

가이드에는 계정 팀을 통한 GPT-5.6 Sol 미리 보기 액세스도 나열되어 있습니다. OpenAI는 8월 13일 GPT-5.6 Sol에서 Ultrafast를 처음 미리 보기로 공개했습니다. 이후 모델로는 GPT-6.1 Sol이 언급되었지만, 두 모델의 Ultrafast 가격은 공개되지 않았습니다.

ChatGPT에서는 Ultrafast Astra가 Pro 500 및 Enterprise의 ChatGPT Work와 Codex에서 실행됩니다. 다만 이는 앱 구독 기능이며 API 사용량에는 적용되지 않습니다. 스크립트, CI 작업, 에이전트는 API 키 기준 토큰 비용을 지불해야 합니다.

속도 수치를 해석할 때는 다음을 구분해야 합니다.

  • API의 주장은 토큰 생성 속도 최대 6배입니다.
  • Codex의 초당 300토큰은 최대 8배라는 주장에 해당합니다.
  • OpenAI는 Ultrafast의 첫 번째 토큰 생성 시간(TTFT)을 공개하지 않았습니다.
  • 초당 토큰 수가 높더라도 첫 토큰까지의 대기 시간이 짧아진다는 보장은 없습니다.

service_tier: "ultrafast" 활성화 방법

각 요청에서 model을 gpt-6-astra로 설정하고 service_tier에 ultrafast를 지정합니다.

HTTP 요청

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "Explain why the sky is blue in one sentence.",
    "service_tier": "ultrafast"
  }'
Enter fullscreen mode Exit fullscreen mode

WebSocket 연결 재사용

OpenAI는 특히 연속적인 도구 호출이 많은 에이전트에서 WebSocket 사용을 강력히 권장합니다. HTTP 요청을 반복하면 연결 및 요청별 네트워크 오버헤드가 Ultrafast의 생성 속도 이점을 상쇄할 수 있습니다.

다음 예시는 하나의 연결에서 두 턴을 스트리밍합니다.

from openai import OpenAI

client = OpenAI()
previous_response_id: str | None = None
prompts = [
    "Explain why the sky is blue in one sentence.",
    "Now explain why sunsets look red.",
]

with client.responses.connect() as connection:
    for prompt in prompts:
        connection.response.create(
            model="gpt-6-astra",
            service_tier="ultrafast",
            previous_response_id=previous_response_id,
            input=prompt,
        )

        for event in connection:
            if event.type == "response.output_text.delta":
                print(event.delta, end="", flush=True)
            elif event.type == "response.completed":
                previous_response_id = event.response.id
                print()
                break
            elif event.type in {"response.failed", "response.incomplete", "error"}:
                raise RuntimeError(event.to_json())
        else:
            raise RuntimeError("Connection closed before the response finished.")
Enter fullscreen mode Exit fullscreen mode

패키지를 설치하고 API 키를 설정합니다.

pip install --upgrade "openai[realtime]"
export OPENAI_API_KEY="your-api-key"
Enter fullscreen mode Exit fullscreen mode

연결 제한과 재연결 전략은 OpenAI WebSocket 모드 가이드에서 확인할 수 있습니다.

Standard, Fast, Batch와 비교한 Ultrafast 가격

짧은 컨텍스트(입력 272K 토큰 이하)에서 gpt-6-astra의 100만 토큰당 가격은 다음과 같습니다.

티어 입력 캐시된 입력 캐시 쓰기 출력 표준 대비
표준 $10.00 $1.00 $12.50 $50.00 1배
배치 또는 Flex $5.00 $0.50 $6.25 $25.00 0.5배
Fast $20.00 $2.00 $25.00 $100.00 2배
Ultrafast $60.00 $6.00 $75.00 $300.00 6배

입력이 272K 토큰을 넘으면 Ultrafast 가격은 다음과 같이 증가합니다.

  • 입력: $120
  • 캐시된 입력: $12
  • 캐시 쓰기: $150
  • 출력: $450

Fast는 이전의 Priority 처리 티어이며, 2026년 7월 30일에 이름이 변경되었습니다.

중요한 점은 입력 토큰에도 6배 요금이 적용된다는 것입니다. Ultrafast의 속도 주장은 출력 토큰 생성에 관한 것이므로, 긴 프롬프트에서는 생성 속도 이점이 없는 입력 토큰에도 높은 비용을 지불하게 됩니다.

속도 제한 및 데이터 상주

GPT-6 Astra의 기본 Ultrafast 제한은 사용량 티어별로 다음과 같습니다.

사용량 티어 기본 제한
티어 1~3 분당 500,000 토큰
티어 4 분당 1,000,000 토큰
티어 5 분당 5,000,000 토큰

Ultrafast는 미국 데이터 상주 및 글로벌 처리만 지원합니다. 계약 또는 프로젝트 설정상 EU나 기타 지역 엔드포인트를 통해 트래픽을 라우팅해야 한다면 해당 프로젝트에서는 Ultrafast를 사용할 수 없습니다.

Ultrafast가 비용을 상쇄하는 시점: 손익분기 모델

아래 계산은 벤치마크가 아니라 정가를 기반으로 한 예시입니다. 실제 서비스에서는 Standard와 Ultrafast를 모두 측정한 뒤 자신의 수치로 바꾸어야 합니다.

여기서는 Standard Astra가 초당 40개의 출력 토큰을 스트리밍한다고 가정합니다.

사용자에게 직접 제공되는 답변

조건:

  • 캐시되지 않은 입력 토큰: 5,000개
  • 출력 토큰: 2,000개
  • Standard 출력 속도: 초당 40토큰

계산:

  • Standard: 입력 $0.05 + 출력 $0.10 = $0.15
  • Ultrafast: 입력 $0.30 + 출력 $0.60 = $0.90
  • 추가 비용: $0.75
  • Standard 생성 시간: 2,000 / 40 = 50초
  • Ultrafast 생성 시간: 50 / 6 ≈ 8.3초
  • 절약 시간: 약 41.7초
  • 절약된 초당 추가 비용: $0.75 / 41.7 = $0.018
  • 시간당 대기 시간 제거 비용: 약 $64.80

측정된 속도 향상이 최대치에 못 미치면 절약되는 시간 1초당 비용은 더 높아집니다.

측정된 속도 향상 절약된 시간(50초 기준) 초당 추가 비용 시간당 비용
6배 41.7초 $0.018 $64.80
4배 37.5초 $0.020 $72.00
2배 25.0초 $0.030 $108.00

에이전트 루프

다음과 같은 에이전트 실행을 가정합니다.

  • 총 20단계
  • 단계당 입력 토큰: 20,000개
    • 캐시된 입력: 18,000개
    • 신규 입력: 2,000개
  • 단계당 출력 토큰: 500개
  • 캐시 쓰기 요금은 계산에서 제외

계산:

  • Standard: 캐시된 입력 $0.018 + 신규 입력 $0.020 + 출력 $0.025 = 단계당 $0.063
  • Standard 총비용: $1.26
  • Ultrafast 총비용: $7.56
  • 추가 비용: $6.30
  • Standard 생성 시간: 약 250초
  • 6배 속도 기준 Ultrafast 생성 시간: 약 41.7초
  • 절약 시간: 약 208초
  • 절약된 초당 추가 비용: 약 $0.030
  • 시간당 비용: 약 $109

에이전트 루프에서는 입력 비용 비중이 크므로, 사용자 응답 하나를 생성하는 경우보다 비용 효율이 더 나빠질 수 있습니다. 입력 토큰은 생성 속도 향상 없이 6배 가격이 적용되기 때문입니다.

결론적으로 다음 질문에 “예”라고 답할 수 있을 때 Ultrafast를 고려할 수 있습니다.

  1. 이 대기 시간 동안 실제 사용자나 금전적 가치가 있는 작업이 막히는가?
  2. 절약되는 시간이 시간당 약 $65~$110 이상의 가치를 가지는가?

내부 코딩 에이전트에서 엔지니어가 대기 중이거나, 유료 사용자 흐름에서 고객이 로딩 화면을 보고 있다면 기준을 통과할 수 있습니다. 반면 크론 작업은 일반적으로 그렇지 않습니다.

Ultrafast가 비용을 상쇄하지 못하는 경우

  • 아무도 기다리지 않는 경우

    야간 평가, 백필, 보고서 생성은 Batch API 또는 Flex를 고려하세요. 입력 $5, 출력 $25로 Ultrafast 요율의 1/12입니다.

  • 백그라운드 에이전트

    무인 실행 후 완료 상태만 알리는 에이전트라면 몇 분 빨라져도 비즈니스 결과가 크게 달라지지 않을 수 있습니다.

  • 짧은 출력

    50토큰 분류처럼 출력이 짧으면 생성 시간을 줄일 공간이 거의 없습니다. HTTP에서는 연결 설정과 TTFT가 전체 지연의 대부분을 차지할 수 있습니다.

  • 긴 프롬프트

    입력이 많은 호출은 속도 향상과 무관한 입력 토큰에도 6배 가격을 냅니다. 272K 입력을 넘으면 단가도 더 상승합니다.

  • 지역별 처리 요구사항

    EU 엔드포인트가 필요한 프로젝트에서는 사용할 수 없습니다.

  • TTFT가 병목인 호출

    GPT-6 Sol 지연 시간 분석에서 설명하듯 긴 추론 실행은 첫 번째 가시 토큰 이전에 많은 시간이 소요될 수 있습니다. 지연이 이 구간에 집중된다면 Ultrafast가 TTFT도 줄이는지 먼저 측정하세요.

전환하기 전에 Apidog에서 TTFT 및 총 시간 측정

약 10분이면 예시 계산의 자리 표시자를 실제 서비스 측정값으로 바꿀 수 있습니다.

  1. Apidog에서 OPENAI_API_KEY를 사용하는 환경을 만듭니다. 다음 요청을 추가합니다.
  • Method: POST
  • URL: https://api.openai.com/v1/responses
  • Header: Authorization: Bearer {{OPENAI_API_KEY}}
   {
     "model": "gpt-6-astra",
     "input": "<your real production prompt>",
     "service_tier": "ultrafast",
     "stream": true
   }
Enter fullscreen mode Exit fullscreen mode
  1. 요청을 복제한 뒤 Standard 기준선을 위해 service_tier 필드를 제거합니다. 프롬프트와 나머지 파라미터는 동일하게 유지합니다.

  2. 두 요청을 모두 실행합니다. Apidog에서 서버 전송 이벤트 스트림을 이벤트별로 확인하고 다음 값을 기록합니다.

  • 첫 response.output_text.delta 도착 시간: TTFT
  • 스트림 종료 시간: 총 시간
  • 최종 response.completed 이벤트의 usage 블록: 비용 계산용 토큰 사용량
  1. 각 변형을 최소 10회 실행합니다. 단일 실행 대신 중앙값과 p95를 비교하세요.

  2. 에이전트 루프는 WebSocket 경로로도 테스트합니다.

  • URL: wss://api.openai.com/v1/responses
  • stream을 제외한 동일한 필드로 response.create 메시지 전송
  • 첫 응답의 previous_response_id를 포함해 두 번째 턴 전송

WebSocket 대 SSE 비교에서 열린 연결이 중요한 이유를 확인할 수 있습니다.

절약된 시간은 다음과 같이 계산합니다.

절약 시간 = Standard 중앙값 총 시간 - Ultrafast 중앙값 총 시간
Enter fullscreen mode Exit fullscreen mode

그다음 usage 토큰을 각 티어 가격으로 계산하고, 추가 비용을 절약 시간으로 나누세요.

절약된 초당 추가 비용 = (Ultrafast 비용 - Standard 비용) / 절약 시간(초)
Enter fullscreen mode Exit fullscreen mode

이 수치가 사용자 대기 시간 또는 엔지니어 작업 시간의 가치보다 낮을 때 Ultrafast 전환을 검토할 수 있습니다.

자주 묻는 질문(FAQ)

OpenAI Ultrafast는 무엇인가요?

표준 가격의 6배로 API 토큰을 최대 6배 빠르게 생성하는 Responses API 서비스 티어입니다. 요청마다 service_tier: "ultrafast"를 지정해 활성화합니다.

Ultrafast는 더 똑똑한 모델인가요?

아닙니다. 동일한 gpt-6-astra 모델 ID를 호출합니다. 서비스 티어는 속도와 가격만 바꾸며 모델 자체를 변경하지 않습니다.

GPT-6 Astra Ultrafast의 비용은 얼마인가요?

짧은 컨텍스트에서 100만 토큰당 입력 $60, 캐시된 입력 $6, 캐시 쓰기 $75, 출력 $300입니다. Standard는 각각 $10, $1, $12.50, $50입니다.

초당 300토큰은 어디에서 나온 수치인가요?

OpenAI가 Codex의 Ultrafast에 대해 제시한 최대치이며, 최대 8배라는 주장에 해당합니다. API에 대한 주장은 최대 6배입니다.

GPT-6.1 Sol은 Ultrafast를 지원하나요?

아직 아닙니다. OpenAI는 출시 예정이라고 밝혔습니다. 현재 상태는 DevDay 2026 요약에서 확인할 수 있습니다.

다음 단계

가장 느린 사용자 대면 요청 하나를 선택하세요. Standard와 Ultrafast로 각각 10회 실행한 뒤, 중앙값 기준 절약 시간과 추가 비용을 비교하세요.

두 변형의 요청 본문, 응답, 타이밍, usage 데이터를 한 프로젝트에서 관리하려면 Apidog를 다운로드하세요.

Top comments (0)