Claude Opus 5는 2026년 7월 24일에 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25로 출시되었습니다. 이는 Anthropic이 Opus 4.8에 적용한 요율과 같고, Fable 5 비용의 정확히 절반입니다.
하지만 실제 인보이스는 기본 입출력 요율만으로 결정되지 않습니다. 캐시 쓰기와 적중, 배치 요율, 고속 모드, 지역별 승수, 그리고 토큰 수를 늘릴 수 있는 동작 변화까지 함께 고려해야 합니다. 자체 트래픽의 실제 수치를 확인하려면 Apidog에서 요청을 보내고 모든 응답의 usage 블록을 확인하세요.
Claude Opus 5 전체 가격표
아래 요율은 Anthropic의 가격 책정 문서를 기준으로 하며, 모델 ID claude-opus-5에 적용됩니다.
| 토큰 카테고리 | 백만 토큰당 가격 |
|---|---|
| 입력(표준) | $5.00 |
| 출력(표준) | $25.00 |
| 프롬프트 캐시 쓰기, 5분 TTL | $6.25 |
| 프롬프트 캐시 쓰기, 1시간 TTL | $10.00 |
| 캐시 적중 및 갱신 | $0.50 |
| 배치 API 입력 | $2.50 |
| 배치 API 출력 | $12.50 |
| 고속 모드 입력 | $10.00 |
| 고속 모드 출력 | $50.00 |
실무에서 기억할 포인트는 다음과 같습니다.
- 캐시 적중 비용은 표준 입력의 10분의 1입니다. 반복되는 시스템 프롬프트나 저장소 컨텍스트에서는 가장 큰 비용 절감 수단입니다.
- 5분 TTL 캐시 쓰기는 표준 입력의 1.25배, 1시간 TTL 쓰기는 2배입니다.
- 배치 API는 입력과 출력 모두 50% 할인됩니다.
- 고속 모드는 표준 가격의 정확히 2배이며, 약 2.5배 빠른 출력 속도를 제공합니다. 연구 미리보기이고 자체 API에서만 사용할 수 있으며 Bedrock, Google Cloud, Microsoft Foundry에서는 지원되지 않습니다. 배치 API와도 결합할 수 없습니다.
- 긴 컨텍스트 프리미엄은 없습니다. 최대 100만 토큰 컨텍스트 창까지 입력 토큰은 동일한 $5 요율로 청구됩니다.
단일 Messages API 요청의 최대 비용도 계산할 수 있습니다. 입력 100만 토큰과 최대 출력 128k 토큰을 사용하면 다음과 같습니다.
입력: 1,000,000 × $5 / 1,000,000 = $5.00
출력: 128,000 × $25 / 1,000,000 = $3.20
총액: $8.20
output-300k-2026-03-24 베타 헤더를 사용하는 배치 API에서는 최대 출력이 300k까지 늘어나며, 출력 비용은 최대 $3.75입니다.
기준점: Opus 4.8과 동일, Fable 5의 절반
| 모델 | 입력 / 백만 토큰 | 출력 / 백만 토큰 |
|---|---|---|
| Claude Opus 5 | $5.00 | $25.00 |
| Claude Opus 4.8 | $5.00 | $25.00 |
| Claude Fable 5 | $10.00 | $50.00 |
| Claude Sonnet 5 — 2026년 8월 31일까지 소개 요금 | $2.00 | $10.00 |
| Claude Sonnet 5 — 2026년 9월 1일부터 | $3.00 | $15.00 |
이 표에서 확인할 수 있는 실무적 결론은 두 가지입니다.
Opus 4.8에서 Opus 5로 업그레이드해도 토큰당 가격은 증가하지 않습니다.
단, 실제 토큰 볼륨은 달라질 수 있으므로 비용이 항상 같다고 가정하면 안 됩니다. 기존 모델 ID를 사용 중이라면 Opus 4.8 가격 분석도 참고하세요.Opus 5는 Fable 5의 절반 가격입니다.
Anthropic은 Opus 5가 CursorBench 3.2에서 Fable 5 최고 성능의 0.5% 이내이며, OSWorld 2.0에서는 작업당 약 3분의 1 비용으로 이를 능가한다고 주장합니다. 이는 Opus 5 출시 게시물에 나온 공급업체 자체 수치이며, 2026년 7월 25일 기준 독립적으로 재현된 결과는 아닙니다. 확정된 결과가 아니라 벤더 주장으로 해석해야 합니다.
가격 차이가 실제로 가치 있는 구간은 Opus 5 vs Fable 5 비교에서, 상위 계층의 세부 가격은 Fable 5 가격 페이지에서 확인할 수 있습니다.
실제 사례 1: 단일 요청 비용 계산
8,000 입력 토큰과 1,200 출력 토큰을 사용하는 요약 요청을 가정해 보겠습니다.
입력: 8,000 / 1,000,000 × $5.00 = $0.040
출력: 1,200 / 1,000,000 × $25.00 = $0.030
총액: 호출당 $0.070
월 10,000회 호출하면 다음과 같습니다.
| 모델 | 호출당 비용 | 월 비용 |
|---|---|---|
| Opus 5 | $0.070 | $700 |
| Fable 5 | $0.140 | $1,400 |
| Sonnet 5 소개 요금 | $0.028 | $280 |
출력은 입력보다 약 7배 적지만, 이 예시에서 전체 비용의 약 43%를 차지합니다. 출력 토큰 단가가 입력의 5배이기 때문입니다.
Opus 5에서는 이 차이가 더 중요합니다. 사고 토큰(thinking tokens)은 출력으로 청구되고, 적응형 사고(adaptive thinking)가 기본적으로 활성화되기 때문입니다.
실제 사례 2: 캐싱을 적용한 긴 에이전트 세션
다음과 같은 코딩 에이전트를 가정합니다.
- 시스템 프롬프트 및 저장소 컨텍스트: 120,000 토큰
- 세션 턴 수: 40회
- 턴당 새 대화 입력: 1,500 토큰
- 턴당 출력: 2,500 토큰
프롬프트 캐싱 없이 실행
매 턴마다 전체 컨텍스트를 다시 전송합니다.
| 항목 | 토큰 수 | 요율 | 비용 |
|---|---|---|---|
| 입력 — 120,000 × 40 + 60,000 신규 | 4,860,000 | $5.00 | $24.30 |
| 출력 — 2,500 × 40 | 100,000 | $25.00 | $2.50 |
| 총액 | $26.80 |
120,000 토큰 접두사에 5분 캐시 적용
| 항목 | 토큰 수 | 요율 | 비용 |
|---|---|---|---|
| 캐시 쓰기, 1회 | 120,000 | $6.25 | $0.75 |
| 캐시 읽기, 39회 턴 | 4,680,000 | $0.50 | $2.34 |
| 새 입력 — 1,500 × 40 | 60,000 | $5.00 | $0.30 |
| 출력 — 2,500 × 40 | 100,000 | $25.00 | $2.50 |
| 총액 | $5.89 |
캐시를 적용하면 비용은 78% 감소합니다.
캐싱 없음: $26.80
5분 캐시 적용: $5.89
절감액: $20.91
캐시 적용 후에는 출력이 전체 비용의 약 42%를 차지합니다. 즉, 컨텍스트 재전송을 제거한 다음에는 출력 길이와 사고 토큰을 최적화하는 것이 다음 단계입니다.
5분 TTL에서는 캐시 읽기가 TTL을 갱신합니다. 따라서 턴 간격이 5분 미만인 세션은 한 번의 캐시 쓰기로 활성 상태를 유지할 수 있습니다. 에이전트가 더 오래 유휴 상태라면 1시간 TTL을 사용해야 합니다.
이 경우 캐시 쓰기 비용은 $0.75에서 $1.20으로 증가하고 총 비용은 $6.34가 됩니다. 그래도 캐싱하지 않은 경우보다 약 76% 저렴합니다.
실제 사례 3: 배치 처리
동기 응답이 필요하지 않은 작업은 배치 API로 보내는 것이 기본값이어야 합니다.
각 문서가 1,200 입력 토큰과 150 출력 토큰을 사용하고, 총 50,000개 문서를 처리한다고 가정합니다.
| 경로 | 입력 비용 | 출력 비용 | 총액 |
|---|---|---|---|
| 표준 | 60백만 토큰 × $5.00 = $300.00 | 7.5백만 토큰 × $25.00 = $187.50 | $487.50 |
| 배치 | 60백만 토큰 × $2.50 = $150.00 | 7.5백만 토큰 × $12.50 = $93.75 | $243.75 |
동일한 모델과 동일한 토큰을 사용해도 배치 처리로 $243.75를 절약합니다.
분류, 데이터 강화, 평가 실행, 백필, 야간 요약처럼 비동기 처리가 가능한 작업을 표준 엔드포인트에서 실행하면 예산의 절반을 더 지출하게 됩니다.
실제 사례 4: 고속 모드 비용
고속 모드는 약 2.5배 빠른 출력 속도를 위해 입출력 요율을 두 배로 올립니다.
앞선 단일 요청 예시를 고속 모드에서 실행하면 다음과 같습니다.
입력: 8,000 / 1,000,000 × $10.00 = $0.080
출력: 1,200 / 1,000,000 × $50.00 = $0.060
총액: 호출당 $0.140
표준 모드의 정확히 두 배입니다.
고속 모드는 사용자가 토큰 스트리밍을 직접 기다리는 인터랙티브 UI에는 유용할 수 있습니다. 반면 백그라운드 작업에는 비용을 정당화하기 어렵습니다. 배치 API와 결합할 수 없으므로, 고속 모드와 배치는 설계상 상호 배타적인 비용 레버입니다.
실제 청구서를 움직이는 네 가지 레버
1. 프롬프트 캐시 최소값이 512 토큰으로 감소
Opus 4.8의 캐시 가능 최소값은 1,024 토큰이었습니다. Opus 5에서는 512 토큰입니다.
이제 짧은 시스템 프롬프트, 공통 정책, 도구 안내문처럼 이전에는 캐싱할 수 없었던 재사용 접두사에도 캐시 제어 블록을 적용할 수 있습니다.
손익분기점은 다음과 같습니다.
- 5분 TTL: 약 1.3회 요청에서 손익분기점. 두 번째 호출부터 이득.
- 1시간 TTL: 약 2.1회 요청에서 손익분기점. 세 번째 호출부터 이득.
예를 들어, 700 토큰 시스템 프롬프트를 한 번의 버스트에서 1,000번 재사용한다고 가정합니다.
캐싱 없음:
700 × 1,000 / 1,000,000 × $5.00 = $3.50
5분 캐시:
캐시 쓰기: 700 / 1,000,000 × $6.25 = $0.0044
캐시 읽기: 700 × 999 / 1,000,000 × $0.50 ≈ $0.3497
총액: 약 $0.354
이 프롬프트는 Opus 4.8에서는 캐시 최소값 미만이어서 캐싱할 수 없었습니다.
2. 배치 API 50% 할인
배치 할인은 단순한 가격 옵션이 아니라 아키텍처 분류 기준입니다.
다음 작업은 우선 배치 실행 가능 여부를 검토하세요.
- 평가 실행
- 데이터 백필
- 야간 리포트 생성
- 콘텐츠 분류
- 대량 문서 요약
- 데이터 강화 파이프라인
동기 응답이 정말 필요한 요청만 표준 API에 남기는 방식이 비용 최적화에 가장 효과적입니다.
3. effort: low와 medium 사용 가능
output_config.effort는 모델의 사고량을 제어합니다. 사고 토큰은 출력 토큰으로 청구되며, Opus 5에서는 출력 토큰 100만 개당 $25입니다.
Anthropic은 Opus 5의 low와 medium이 이전 Opus 모델보다 의미 있게 강해졌다고 설명합니다. 기본값은 high이며, 코딩 및 에이전트 작업에는 xhigh가 권장되는 시작점입니다.
예를 들어 다음과 같은 측정값이 나왔다고 가정해 보겠습니다.
xhigh 사고 토큰: 평균 8,000
low 사고 토큰: 평균 1,500
차이: 6,500 출력 토큰
작업당 절감액은 다음과 같습니다.
6,500 / 1,000,000 × $25 = $0.1625
100,000개 작업에서는 총 $16,250 절감입니다.
다만 이 수치는 예시일 뿐입니다. 실제 사고 토큰 차이와 품질 차이는 프롬프트에 따라 달라집니다. 기존 Opus 4.8 설정을 그대로 옮기지 말고, 자체 평가 세트에서 각 effort 수준을 비교하세요. 자세한 테스트 방법은 노력 매개변수 가이드를 참고할 수 있습니다.
또한 effort를 낮춰도 보이는 응답 길이가 자동으로 줄어들지는 않습니다. 사고 토큰을 줄이는 설정일 뿐입니다. 더 짧은 결과물이 필요하다면 프롬프트에서 응답 형식과 최대 길이를 명시해야 합니다.
4. 도구 사용 시스템 프롬프트 오버헤드 감소
도구 정의를 전송하면 API는 비용이 청구되는 시스템 프롬프트를 삽입합니다.
Opus 5의 auto 또는 none 도구 선택 오버헤드는 286 토큰입니다.
| 모델 | 도구 사용 시스템 프롬프트 오버헤드 |
|---|---|
| Opus 5 | 286 토큰 |
| Opus 4.8 | 290 토큰 |
| Opus 4.7 | 675 토큰 |
Opus 4.8과 비교하면 4토큰 차이입니다. 백만 요청 기준 약 $20 수준이므로 거의 영향이 없습니다.
하지만 Opus 4.7과 비교하면 389토큰 차이입니다.
389 / 1,000,000 × $5 = 요청당 $0.001945
백만 요청당: $1,945
아직 Opus 4.7을 사용하고 있다면 실제 비용 차이가 될 수 있습니다. 전체 Claude 라인업에 적용되는 비용 절감 방법은 Claude API 청구서 절감 가이드에서 확인할 수 있습니다.
사람들이 놓치는 두 가지 항목
inference_geo: "us"는 1.1배 승수
규정 준수나 데이터 상주 요건 때문에 추론을 미국 전용 인프라로 고정하면, 모든 토큰 카테고리에 1.1배가 적용됩니다.
| 항목 | 기본 요율 | 미국 고정 요율 |
|---|---|---|
| 표준 입력 | $5.00 | $5.50 |
| 표준 출력 | $25.00 | $27.50 |
| 캐시 적중 | $0.50 | $0.55 |
| 배치 입력 | $2.50 | $2.75 |
| 배치 출력 | $12.50 | $13.75 |
앞선 단일 요청 예시를 월 10,000회 실행하면 비용은 $700에서 $770으로 증가합니다. 월 $50,000 규모라면 $5,000 항목이므로, 실제로 지역 고정이 필요한지 설정 전에 검토해야 합니다.
Priority Tier는 Opus 5에서 지원되지 않음
Opus 4.8은 Priority Tier를 유지하지만, Opus 5는 지원하지 않습니다.
용량 계획이나 지연 시간 SLO가 Priority Tier 약정에 의존한다면, 이 항목은 마이그레이션의 실제 제약 조건입니다. 주요 API 차이는 Opus 4.8에서 Opus 5로의 마이그레이션 가이드에서 확인하세요.
인보이스에 반영되는 동작 변경 사항
토큰당 요율은 청구서의 절반일 뿐입니다. 실제 토큰 볼륨이 나머지 절반을 결정하며, Opus 5에서는 다음 동작 변화가 비용에 영향을 줄 수 있습니다.
사고가 기본 활성화됩니다.
Opus 4.8에서thinking필드가 없는 요청은 사고 과정 없이 실행되었습니다. Opus 5에서는 같은 요청도 적응형 사고를 실행하며, 해당 토큰은 출력으로 청구됩니다. 또한max_tokens는 사고와 응답 모두에 적용되므로 일부 워크로드는 잘릴 수 있습니다.하위 에이전트 위임이 늘어날 수 있습니다.
Opus 5는 하위 에이전트에 더 쉽게 위임할 수 있으며, 각 하위 에이전트의 토큰도 별도로 청구됩니다. 비용 민감 워크로드에서는 위임 횟수와 범위를 제한하세요.프롬프트 없이도 자체 검증할 수 있습니다.
기존 프롬프트에 “작업을 다시 확인하세요” 같은 지시가 있다면 제거 여부를 검토하세요. Anthropic의 프롬프트 가이드는 과도한 검증 지시가 불필요한 토큰 소비를 만들 수 있다고 안내합니다.
이 변화들은 토큰당 가격을 바꾸지 않지만, 최종 청구 금액은 바꿉니다.
Apidog로 실제 지출 확인
가장 빠른 검증 방법은 모든 API 응답의 usage 객체를 수집하고 비교하는 것입니다.
usage에는 다음 값이 별도로 포함됩니다.
{
"input_tokens": 0,
"output_tokens": 0,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
이 값을 기준으로 실제 비용을 계산하면 됩니다.
표준 입력 비용 =
input_tokens / 1,000,000 × 5.00
출력 비용 =
output_tokens / 1,000,000 × 25.00
캐시 쓰기 비용 =
cache_creation_input_tokens / 1,000,000 × 6.25
캐시 읽기 비용 =
cache_read_input_tokens / 1,000,000 × 0.50
Apidog에서 Messages 엔드포인트로 "model": "claude-opus-5" 요청을 만든 뒤, 다음 검사를 자동화하세요.
- 동일한 프롬프트를 각
effort수준으로 복제하고 사고 토큰 및 품질을 비교합니다. -
usage.cache_read_input_tokens가 0보다 큰지 검증해 캐시 손상을 테스트 실패로 감지합니다. - API 키는 요청 본문이 아니라 환경 변수로 관리해 개발 키가 프로덕션 규모 배치를 실행하지 않도록 합니다.
- SSE 스트림을 모니터링해 긴 생성 과정에서 출력 토큰이 어디에 사용되는지 확인합니다.
Apidog 다운로드 후 Opus 5 API 가이드와 함께 위 검사를 적용할 수 있습니다.
$5 / $25로 실제로 얻는 것
Opus 5는 강력한 가격 대비 성능 위치를 차지하지만 Claude 스택의 최상위 모델은 아닙니다.
Fable 5는 Anthropic에서 가장 널리 출시된 모델로 남아 있으며, Opus 5는 사이버 보안 익스플로잇 및 자율 생물학 연구에서 여전히 Mythos 5에 뒤처집니다. Anthropic도 이 구분을 명확히 합니다.
따라서 Opus 5의 위치는 다음처럼 정리할 수 있습니다.
- 최첨단급 기능
- 최첨단 가격의 절반
- 단, 더 상위의 명명된 성능 한계 존재
자세한 구분은 Mythos 등급 설명에서 확인할 수 있습니다.
대부분의 팀에는 “Opus 5가 최고 성능 모델보다 좋은가?”보다 다음 질문이 더 중요합니다.
이 작업에 Opus가 필요한가, 아니면 Sonnet 5가 더 낮은 비용으로 충분한가?
Sonnet 5는 소개 요금 기준 $2/$10이며, 2026년 9월 1일부터는 $3/$15입니다. 예산을 확정하기 전에 동일한 평가 세트에서 두 모델을 모두 실행하세요.
전체 사양과 가용성은 Claude Opus 5 개요 및 Anthropic의 모델 개요에서 확인할 수 있습니다.
자주 묻는 질문
Claude Opus 5는 얼마입니까?
표준 API 기준 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다. 캐시 적중은 $0.50, 배치는 $2.50 / $12.50, 고속 모드는 $10 / $50입니다.
Claude Opus 5가 Opus 4.8보다 비쌉니까?
토큰당 가격은 동일합니다. 하지만 사고가 기본 활성화되고 기본 응답이 더 길어질 수 있으므로, 실제 청구서는 증가할 수 있습니다. 가격표만 비교하지 말고 실제 토큰 볼륨을 측정해야 합니다.
100만 토큰 컨텍스트 창에 긴 컨텍스트 추가 요금이 있습니까?
아니요. 100만 토큰 컨텍스트 창은 기본이자 최대이며, 긴 입력에 대한 프리미엄 계층은 없습니다.
Claude Opus 5를 가장 저렴하게 실행하는 방법은 무엇입니까?
재사용 접두사에는 캐시를 적극 적용하고, 비동기 작업은 배치 API로 보내며, 자체 평가를 통과하는 가장 낮은 effort 수준을 사용하세요. 자세한 내용은 무료 및 최저 비용 경로 가이드를 참고하세요.
지역 고정(regional pin)에 추가 비용이 듭니까?
예. inference_geo: "us"를 설정하면 캐시 적중과 배치를 포함한 모든 토큰 카테고리에 1.1배 승수가 적용됩니다.


Top comments (0)