DEV Community

Cover image for 클로드 오푸스 5 벤치마크: 숫자가 말하는 진실
Rihpig
Rihpig

Posted on • Originally published at apidog.com

클로드 오푸스 5 벤치마크: 숫자가 말하는 진실

Anthropic은 2026년 7월 24일 Claude Opus 5를 출시하며 강력한 벤치마크 결과를 발표했습니다. 일부 평가에서는 Opus 4.8보다 두 배 이상 높은 점수를 기록했고, 다른 평가에서는 차세대 최고 모델보다 약 세 배 앞섰다고 주장했습니다. OSWorld 2.0에서는 Fable 5를 넘어섰으며 비용은 3분의 1 수준이라고 밝혔습니다.

지금 Apidog 사용해 보기

이 수치가 틀렸다는 뜻은 아닙니다. 다만 공급업체 벤치마크를 읽을 때는 무엇을 측정했고, 무엇을 공개하지 않았는지 함께 확인해야 합니다. 이 글에서는 공개된 Opus 5 벤치마크 주장을 표로 정리하고, 각 수치의 해석 범위와 한계, Anthropic이 명시한 제약, 그리고 Apidog에서 직접 실행할 수 있는 평가 계획을 다룹니다.

모델 자체(claude-opus-5, 1M 컨텍스트, 최대 128k 출력, 2026년 5월 지식 차단)에 대한 정보는 Claude Opus 5는 무엇인가에서 확인할 수 있습니다. 주요 출처는 Anthropic의 Claude Opus 5 출시 게시물입니다.

하나의 표로 보는 모든 공개된 주장

다음은 Anthropic이 출시 시점에 발표한 벤치마크 주장입니다. 점수 자체보다 비교 대상과 측정 조건이 더 중요한 항목도 많습니다.

벤치마크 Anthropic의 주장 표현 방식 비교 대상
Frontier-Bench v0.1 다른 모든 모델 능가, 작업당 더 낮은 비용으로 Opus 4.8 점수의 두 배 이상 비율 + 비용 주장 Opus 4.8 및 기타 모델
ARC-AGI 3 차세대 최고 모델 점수의 약 3배 비율 이름 없는 차세대 최고 모델
OSWorld 2.0 Fable 5를 능가하며 비용은 3분의 1 서수 + 비용 주장 Fable 5
CursorBench 3.2 Fable 5 최고 성능의 0.5% 이내, 가격은 절반 격차 + 비용 주장 Fable 5
Zapier AutomationBench 통과율이 차세대 최고 모델의 약 1.5배 비율 이름 없는 차세대 최고 모델
유기 화학 Opus 4.8보다 10.2점 증가 절대 차이 Opus 4.8
단백질 분석 Opus 4.8보다 7.7점 증가 절대 차이 Opus 4.8
사이버 보안 공격 Mythos 5에 뒤처짐 서수 Mythos 5
자율 생물학 연구 Mythos 5에 뒤처짐 서수 Mythos 5

출처는 Anthropic의 출시 게시물과 모델 문서입니다. 이 글을 작성하는 시점까지 해당 결과에 대한 제3자 재현 결과는 발표되지 않았습니다.

Opus 5 벤치마크 비교

먼저 확인할 점은 두 가지입니다.

  • 9개 주장 중 절대적인 점수 변화를 공개한 것은 유기 화학과 단백질 분석뿐입니다.
  • Anthropic은 Opus 5가 뒤처지는 사이버 보안 공격 및 자율 생물학 연구 결과도 함께 공개했습니다.

비율로 표현된 점수를 해석하는 방법

Frontier-Bench, ARC-AGI 3, AutomationBench, CursorBench는 절대 점수보다 비율 또는 격차 중심으로 표현됩니다. 구현 결정을 내리기 전에는 다음을 확인해야 합니다.

비율은 기준 점수를 숨깁니다

ARC-AGI 3의 “차세대 최고 모델의 약 3배”는 기준 모델 점수에 따라 의미가 달라집니다.

  • 기준 모델이 8%라면 3배는 24%입니다.
  • 기준 모델이 25%라면 3배는 75%입니다.

두 경우 모두 “3배”라는 표현은 맞지만, 제품 적용 가능성은 크게 다릅니다. Anthropic은 기준 점수와 비교 모델 이름을 공개하지 않았습니다.

낮은 점수 구간에서는 배수 증가가 쉬울 수 있습니다

Frontier-Bench v0.1의 “Opus 4.8 점수의 두 배 이상”도 같은 방식으로 읽어야 합니다.

이전 모델 점수가 한 자릿수 또는 낮은 10%대였다면, 두 배라는 표현은 절대 점수 기준으로는 제한적인 증가일 수 있습니다. 반대로 기존 점수가 40%였다면 두 배 증가는 매우 이례적입니다.

특히 v0.1 벤치마크는 공개된 장기 실적, 커뮤니티 재현, 포화 구간 데이터가 부족할 수 있으므로 직접 검증이 필요합니다.

“차세대 최고 모델”의 이름이 공개되지 않았습니다

ARC-AGI 3와 AutomationBench의 비교 대상은 구체적으로 명시되지 않았습니다. Fable 5인지, Mythos 5인지, 다른 모델인지는 알 수 없습니다.

비율을 평가할 때는 최소한 다음 정보를 확보해야 합니다.

  1. 비교 모델 ID
  2. 정확한 모델 버전
  3. 프롬프트와 도구 설정
  4. effort 또는 추론 설정
  5. 반복 횟수와 집계 방식

CursorBench의 0.5%는 단위를 확인해야 합니다

CursorBench 3.2의 “Fable 5 최고 성능의 0.5% 이내”는 다음 중 어느 의미인지 명확하지 않습니다.

  • 0.5 퍼센트포인트 차이
  • 0.5% 상대 차이
  • 여러 실행 중 최고 점수 기준 차이

또한 “최고 성능”은 기본 설정이 아니라 최적화된 effort 또는 토큰 한도 설정에서 얻은 결과일 수 있습니다. 코딩 벤치마크는 기본 설정과 최대 설정의 차이가 클 수 있습니다.

Fable 5 벤치마크 분석에서 해당 모델의 수치 구성 방식을 확인할 수 있습니다.

반면 유기 화학 +10.2점, 단백질 분석 +7.7점은 기준선이 Opus 4.8로 명시된 절대 차이입니다. 시작 점수는 공개되지 않았지만, 개선 폭 자체는 명확합니다.

작업당 비용은 설정에 따라 달라집니다

Anthropic은 Frontier-Bench, OSWorld 2.0, CursorBench에서 성능과 비용을 함께 주장합니다.

  • Frontier-Bench: 작업당 비용이 더 낮음
  • OSWorld 2.0: 비용이 3분의 1
  • CursorBench 3.2: 가격이 절반

정가 기준 절반이라는 주장은 검증 가능합니다. Opus 5의 가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러이며 Opus 4.8과 동일합니다. Fable 5의 10달러/50달러와 비교하면 정확히 절반입니다.

가격 정보는 Anthropic의 가격 책정 페이지에서 확인할 수 있습니다. 캐시 쓰기, 배치 처리율, 빠른 모드 프리미엄을 포함한 계산은 Opus 5 가격 분석을 참고하세요.

하지만 작업당 비용은 정가와 다릅니다. 실제 비용은 다음 요소에 따라 달라집니다.

  • 입력 및 출력 토큰 수
  • output_config.effort 수준
  • thinking 활성화 여부
  • 에이전트 루프의 턴 수
  • 하위 에이전트 생성 수
  • 프롬프트 캐시 읽기 및 쓰기
  • 재시도와 실패한 도구 호출

Anthropic의 프롬프트 지침에 따르면 Opus 5는 Opus 4.8보다 기본 응답을 길게 생성하고, 하위 에이전트 위임과 작업 범위 확장을 더 자주 수행할 수 있습니다. 따라서 벤치마크용으로 조정된 실행 구성이 프로덕션 구성과 같다고 가정하면 안 됩니다.

작업당 비용과 모델 설정

정가가 절반이라는 사실은 변하지 않습니다. 그러나 실제 워크로드에서의 작업당 비용 비율은 별도로 측정해야 합니다. Opus 5 대 Fable 5 비교는 가격 차이가 실제로 이점이 되는 조건을 다룹니다.

Anthropic이 직접 명시한 한계

출시 자료에서 중요한 정보는 승리한 항목만이 아닙니다. Anthropic은 Opus 5가 다음 작업에서 여전히 Mythos 5에 뒤처진다고 명시합니다.

  • 사이버 보안 공격
  • 자율 생물학 연구

Fable 5도 “가장 유능한 광범위하게 출시된 모델”이라는 명칭을 유지합니다.

Anthropic이 명시한 Opus 5 한계

즉, Opus 5는 Claude 스택 전체의 최상단 모델이라는 주장보다는, 최첨단급 기능을 더 낮은 정가로 제공한다는 포지션에 가깝습니다.

최첨단 보안 연구나 자율 과학 작업을 다룬다면 Mythos급 모델이 여전히 기준이 될 수 있습니다. 관련 내용은 Mythos급 모델 설명Fable 5 대 Mythos 5에서 확인할 수 있습니다.

운영상의 제약도 있습니다. Anthropic은 Opus 5가 사이버 카테고리 요청을 거부할 때 Opus 4.8로 자동 대체되는 옵션을 출시했습니다.

fallbacks: "default"
Enter fullscreen mode Exit fullscreen mode

이 옵션은 다음 베타 헤더 뒤에서 사용할 수 있습니다.

server-side-fallback-2026-07-01
Enter fullscreen mode Exit fullscreen mode

거부율이 높은 워크로드라면 대체 경로가 실제 성공률, 비용, 응답 일관성에 미치는 영향을 별도로 테스트해야 합니다.

벤치마크가 알려주지 않는 프로덕션 문제

벤치마크는 주로 작업 완료도를 측정합니다. 하지만 실제 마이그레이션에서는 다음 항목도 검증해야 합니다.

  • 마이그레이션 시 행동 변화

    Opus 5는 프롬프트 없이도 자체 작업을 검증할 수 있습니다. Opus 4.8에서 사용하던 “답변을 다시 확인해” 같은 지시가 남아 있으면 과도한 검증과 토큰 낭비가 발생할 수 있습니다. Anthropic의 Opus 5 프롬프트 가이드는 이러한 중복 지시를 제거하라고 안내합니다.

  • 출력 길이

    기본 응답과 생성 결과물이 Opus 4.8보다 길어질 수 있습니다. effort를 낮춰도 가시적인 응답 길이가 자동으로 줄어들지는 않습니다. 짧은 결과가 필요하다면 프롬프트에서 명시적으로 길이를 제한해야 합니다.

  • thinking 비활성화 시 실패 모드

    thinking: {type: "disabled"} 설정에서는 도구 호출이 실행 가능한 구조화된 호출 대신 일반 텍스트로 나타날 수 있습니다. 내부 XML 태그가 출력에 노출될 가능성도 있으므로 에이전트 루프에서 별도 검증이 필요합니다.

  • effort 재조정

    Opus 5의 effort 수준은 이전 모델과 동일하게 해석하면 안 됩니다. Anthropic은 Opus 4.8 설정을 그대로 복사하기보다 다시 스윕할 것을 권장합니다. effort 매개변수 가이드를 참고하세요.

  • 400 오류 조합

    thinking: {type: "disabled"}xhigh 또는 max effort를 함께 사용하면 요청당 400 오류가 발생할 수 있습니다. 이는 벤치마크 문제가 아니라 마이그레이션 구현 문제입니다. Opus 4.8에서 Opus 5로의 마이그레이션 가이드에서 세부 사항을 확인할 수 있습니다.

직접 테스트해야 할 항목

공급업체 벤치마크는 가설로 취급하고, 실제 워크로드에서 검증하세요. 다음 절차는 하루 안에 실행할 수 있는 최소 평가 계획입니다.

1. 실제 이력에서 작업 세트를 구성합니다

20~50개의 실제 작업을 선택합니다.

  • 해결된 지원 티켓
  • 병합된 PR
  • 운영 장애 분석 기록
  • 고객 문의 스레드
  • 내부 자동화 요청

합성 프롬프트보다 실제 입력이 좋은 이유는 서식 문제, 모호성, 예외 케이스, 도메인 용어가 포함되기 때문입니다.

2. 모델 구성을 고정하고 기록합니다

각 실행에 대해 다음 값을 저장하세요.

{
  "model": "claude-opus-5",
  "output_config": {
    "effort": "medium"
  },
  "thinking": {
    "type": "enabled"
  },
  "max_tokens": 8192
}
Enter fullscreen mode Exit fullscreen mode

비교 중에는 한 번에 하나의 변수만 변경해야 합니다. 모델 ID, 프롬프트, 도구, 최대 토큰, effort가 동시에 바뀌면 결과를 해석할 수 없습니다.

3. 토큰당 비용 대신 해결된 작업당 비용을 계산합니다

응답의 usage 블록에서 다음 값을 기록합니다.

  • 입력 토큰
  • 출력 토큰
  • 캐시 읽기 토큰
  • 캐시 쓰기 토큰
  • 총 비용
  • 승인 검사 통과 여부

그 다음 다음과 같이 계산합니다.

해결된 작업당 비용 = 총 실행 비용 / 승인 검사를 통과한 작업 수
Enter fullscreen mode Exit fullscreen mode

이 수치가 프로덕션 비용에 가장 가까운 비교 기준입니다.

4. effort 스윕을 실행합니다

동일한 작업 세트를 다음 effort 수준으로 실행하세요.

low
medium
high
xhigh
Enter fullscreen mode Exit fullscreen mode

각 수준에서 다음을 비교합니다.

측정값 확인할 내용
통과율 작업이 실제 승인 기준을 충족하는가
총비용 입력, 출력, 캐시 비용을 포함하는가
지연 시간 사용자 대기 시간 또는 자동화 처리 시간이 허용 범위인가
평균 턴 수 에이전트가 작업 완료까지 몇 번 도구를 호출하는가
출력 길이 UI, PR 코멘트, 티켓 시스템에 적합한가
실패율 도구 호출 오류, 400 오류, 거부를 포함하는가

5. 단일 턴이 아니라 에이전트 루프를 테스트합니다

OSWorld, CursorBench, AutomationBench는 에이전트 기반 평가입니다. 단일 턴 응답만 비교하면 실제 동작을 재현하기 어렵습니다.

실제 도구를 연결하고 다음을 기록하세요.

  • 총 턴 수
  • 도구 호출 수
  • 도구 호출 형식
  • 재시도 횟수
  • 최종 성공 여부
  • 중간 단계에서의 거부 또는 중단 여부

6. 현재 사용 중인 모델과 같은 하니스에서 비교합니다

현재 Opus 4.8, Sonnet 5 또는 다른 모델을 사용 중이라면 동일한 입력과 동일한 평가 기준으로 실행하세요.

다른 조직의 절대 점수보다 중요한 것은 다음입니다.

내 워크로드에서 새 모델이 기존 모델보다
더 많은 작업을, 더 낮은 비용으로,
허용 가능한 지연 시간 안에 해결하는가?
Enter fullscreen mode Exit fullscreen mode

7. 거부율을 별도로 기록합니다

사이버 관련 요청은 Opus 4.8보다 더 자주 거부될 수 있습니다. 대체 모델을 구성하기 전 다음을 측정하세요.

  • 전체 요청 수
  • 거부 요청 수
  • 대체 실행 수
  • 대체 후 성공률
  • 대체로 인한 추가 지연 시간
  • 대체로 인한 추가 비용

이전 모델 출시의 비교 방법론은 Sonnet 5 벤치마크 문서에서 확인할 수 있습니다. 요청 구조는 Opus 5 API 가이드를 참고하세요.

Apidog에서 평가 실행하기

위 평가는 인증 헤더, JSON 요청 본문, 스트리밍 응답, usage 블록 분석을 포함하는 HTTP 요청 모음입니다. Apidog를 사용하면 이를 컬렉션과 환경 변수로 구성해 반복 실행할 수 있습니다.

Apidog에서 API 평가 구성하기

실용적인 설정 절차는 다음과 같습니다.

  1. Anthropic Messages 엔드포인트 요청을 하나 생성합니다.
  2. API 키를 요청 본문에 넣지 말고 환경 변수로 저장합니다.
  3. effort별로 요청을 복제해 low부터 xhigh까지 동일한 프롬프트를 실행합니다.
  4. 필요하다면 스트리밍을 켜고 SSE 이벤트를 검사합니다.
  5. 도구 호출이 일반 텍스트가 아니라 구조화된 페이로드로 반환되는지 확인합니다.
  6. usage 필드에 대한 어설션 또는 후처리를 추가해 모든 실행에서 토큰 수를 저장합니다.
  7. 전체 요청을 컬렉션으로 저장해 다음 모델 출시에서는 모델 ID만 교체합니다.

기본 요청은 다음과 같습니다.

curl https://api.anthropic.com/v1/messages \
  --header "x-api-key: $ANTHROPIC_API_KEY" \
  --header "anthropic-version: 2023-06-01" \
  --header "content-type: application/json" \
  --data '{
    "model": "claude-opus-5",
    "max_tokens": 8192,
    "output_config": {"effort": "medium"},
    "messages": [
      {"role": "user", "content": "Fix the failing test in this diff."}
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

실행마다 한 필드만 변경하고 나머지 조건은 고정하세요. 그리고 매 응답의 usage 블록을 반드시 기록하세요. 환경 변수와 어설션이 설정된 컬렉션으로 이 패턴을 반복하려면 Apidog를 다운로드할 수 있습니다.

솔직한 요약

Opus 5의 벤치마크 주장은 강력합니다. Anthropic은 이전 Opus 모델 대비 큰 개선 폭과 변동 없는 정가를 제시했습니다.

동시에 다음 사실도 유지됩니다.

  • 공개된 결과는 2026년 7월 25일 기준 공급업체 주도 수치입니다.
  • 제3자 재현 결과는 공개되지 않았습니다.
  • 주요 결과는 절대 점수보다 비율로 표현됩니다.
  • 일부 고위험 연구 영역에서는 Mythos 5에 뒤처진다고 명시합니다.
  • 실제 작업당 비용은 모델 가격표가 아니라 구성과 에이전트 동작에 따라 달라집니다.

따라서 상단의 표는 Anthropic이 제시한 가설로 사용하세요. 이후 실제 백로그, 실제 도구, 실제 승인 기준으로 자체 수치를 수집해야 합니다. 모델 마이그레이션의 결정은 출시 차트가 아니라 운영 워크로드에서 내려집니다.

변경된 기능 전반은 Opus 5 핵심 가이드에서 확인할 수 있습니다.

자주 묻는 질문

Claude Opus 5 벤치마크는 독립적으로 검증되었습니까?

아니요. 2026년 7월 25일 기준 공개된 Opus 5 벤치마크 결과는 Anthropic이 제공한 것입니다. 제3자 연구소나 독립 평가 기관의 재현 결과는 발표되지 않았습니다. 공급업체 보고 수치로 해석해야 합니다.

Opus 5의 가장 큰 벤치마크 주장은 무엇입니까?

Frontier-Bench v0.1에서 Anthropic은 Opus 5가 더 낮은 작업당 비용으로 Opus 4.8 점수의 두 배 이상을 기록했다고 주장합니다. 다만 기본 점수는 공개되지 않았고, Frontier-Bench v0.1은 확립된 장기 실적이 없는 새 벤치마크입니다.

Claude Opus 5가 가장 유능한 Claude 모델입니까?

아니요. Fable 5는 여전히 “가장 유능한 광범위하게 출시된” 모델이라는 명칭을 유지합니다. Anthropic은 Opus 5가 사이버 보안 공격과 자율 생물학 연구에서 Mythos 5에 뒤처진다고 명시합니다.

과학 작업에서 Opus 5는 Opus 4.8보다 얼마나 더 좋습니까?

Anthropic은 Opus 4.8 대비 유기 화학에서 10.2점, 단백질 분석에서 7.7점 증가를 보고합니다. 두 수치는 비율이 아닌 절대 차이로 표현되어 해석하기 쉽지만, 기준 점수는 공개되지 않았습니다.

Opus 5가 Fable 5를 능가합니까?

Anthropic의 수치에 따르면 OSWorld 2.0에서는 Fable 5를 비용 3분의 1로 능가하고, CursorBench 3.2에서는 Fable 5 최고 성능의 0.5% 이내에 절반 가격으로 도달합니다. 다만 Fable 5는 여전히 전반적인 기능 면에서 우위를 유지합니다. 전체 비교를 참고하세요.

무엇을 직접 벤치마크해야 합니까?

자체 백로그에서 가져온 실제 작업 20~50개를 사용하세요. 여러 effort 수준에서 해결된 작업당 비용을 측정하고, 실제 도구를 연결한 다중 턴 에이전트 루프를 실행하며, 현재 사용 중인 모델과 같은 하니스에서 비교해야 합니다.

Top comments (0)