Anthropic은 2026년 9월 1일 Claude Fable 5.1을 출시하고, 9가지 테스트에서 Fable 5, Opus 5, GPT-5.6 Sol과 비교한 벤치마크를 공개했습니다. 가장 주목받은 결과는 Terminal-Bench-Science였습니다. Fable 5.1은 52.6%로, Fable 5의 24.7%를 크게 앞섰습니다. CursorBench에서는 Opus 5보다 3.4점 높았지만, Opus 5는 가격이 두 배 더 비싼 모델입니다.
이 글은 공개된 수치를 출처와 함께 정리하고, 각 벤치마크가 측정하는 항목과 모델 간 격차의 크기를 설명합니다. 또한 출시 보도에서 상대적으로 덜 다뤄진 두 가지 사실도 살펴봅니다.
- 모든 결과는 공급업체가 직접 실행한 수치입니다.
- 유일하게 두 모델의 결과가 모두 공개된 에이전트 코딩 테스트에서는 Mythos 5.1이 Fable 5.1보다 높은 점수를 기록했습니다.
따라서 출시 표는 결론이 아니라 자체 평가를 시작할 기준으로 봐야 합니다. 주요 출처는 Anthropic의 출시 게시물이며, 모델 개요는 Claude Fable 5.1이 무엇인지에서 확인할 수 있습니다.
전체 표
| 벤치마크 | 측정 항목 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 터미널에서의 에이전트 과학 연구 | 52.6% | 24.7% | 29.0% | 22.4% |
| Terminal-Bench 4.0 | 터미널에서의 에이전트 코딩 | 55.8% | 42.0% | 52.3% | 37.3% |
| GDPval-AA v2 | 경제적으로 가치 있는 지식 작업 (Elo) | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0 (부분 점수) | 실제 데스크톱 작업에서의 컴퓨터 사용 | 77.9% | 72.9% | 75.4% | 보고되지 않음 |
| OSWorld 2.0 (엄격) | 동일, 전체 작업 완료만 | 41.7% | 36.1% | 39.6% | 보고되지 않음 |
| Humanity’s Last Exam (도구 없음) | 전문가 수준 추론 질문 | 60.9% | 57.8% | 56.6% | 보고되지 않음 |
| Humanity’s Last Exam (도구 사용) | 동일, 검색 및 코드 포함 | 65.0% | 63.8% | 63.6% | 보고되지 않음 |
| AutomationBench | 엔드투엔드 비즈니스 워크플로 | 31.4% | 17.1% | 26.9% | 19.6% |
| CursorBench 3.2.0 | IDE 스타일 코딩 작업 | 73.4% | 70.5% | 70.0% | 67.2% |
Anthropic은 Mythos 5.1에 대해서는 Terminal-Bench 4.0의 60.9%만 공개했습니다. VentureBeat 보도에 따르면, 가장 어려운 브라우저 에이전트 작업에서 Fable 5.1은 82%, Opus 5는 74%, Fable 5는 57%를 기록했습니다. 이 수치는 출시 게시물이 아닌 언론 보도에서 나온 것이므로 신뢰도와 비중을 다르게 두어야 합니다.
큰 격차
Terminal-Bench-Science 0.1
Fable 5.1: 52.6% — Fable 5: 24.7%, Opus 5: 29.0%
과학 도구를 사용할 수 있는 터미널에서 다단계 연구를 수행하는 에이전트 능력을 측정합니다. Fable 5.1은 이전 모델의 두 배 이상, Opus 5의 거의 두 배에 해당하는 점수를 기록했습니다.
Anthropic이 강조한 “장기적 문제 해결” 능력이 측정 가능한 결과로 나타난 가장 분명한 사례입니다. 다만 버전 0.1 벤치마크이므로 작업 세트가 초기 단계이며, 데이터셋이 성숙하면 점수가 변동할 수 있습니다.
AutomationBench
Fable 5.1: 31.4% — Fable 5: 17.1%, Opus 5: 26.9%
여러 애플리케이션에 걸친 엔드투엔드 비즈니스 워크플로를 측정합니다. 모든 모델의 절대 점수는 낮지만, Fable 5.1은 Fable 5의 거의 두 배를 기록했고 Opus 5보다 4.5점 앞섰습니다.
다중 애플리케이션 비즈니스 작업을 자동화하려는 제품이라면 이 결과를 중요하게 볼 만합니다.
Terminal-Bench 4.0
Fable 5.1: 55.8% — Fable 5: 42.0%, Opus 5: 52.3%
에이전트 코딩 성능을 측정합니다. Fable 5.1은 Fable 5보다 13.8점 상승했고, Opus 5보다 3.5점 앞섰습니다.
Opus 5는 이미 7월에 Fable 5를 추월했습니다. 이번 결과는 에이전트 코딩에서 Fable 티어가 다시 Opus 티어보다 앞섰다는 의미지만, 6월보다 격차는 줄었습니다. 7월 수치는 Opus 5 벤치마크 분석에서 확인할 수 있습니다.
GDPval-AA v2
Fable 5.1: 1853 — Fable 5: 1723, Opus 5: 1824
문서, 스프레드시트, 슬라이드와 같은 경제적으로 가치 있는 지식 작업을 Elo 점수로 평가합니다. Fable 5보다 130 Elo 높지만, Opus 5와의 차이는 29 Elo로 비교적 작습니다.
작은 격차
CursorBench 3.2.0
Fable 5.1: 73.4% — Fable 5: 70.5%, Opus 5: 70.0%
IDE 스타일 코딩 작업을 측정합니다.
Fable 5.1은 두 모델보다 약 3점 앞섰습니다. 개발자에게 가장 직접적으로 중요한 벤치마크 중 하나이지만, 여기서의 우위는 가장 얇습니다.
작업이 “내 편집기에서 나를 도와줘”에 가깝다면 출시 표만으로는 두 배 가격을 정당화하기 어렵습니다.
OSWorld 2.0
Fable 5.1: 77.9% / 41.7% — Opus 5: 75.4% / 39.6%
실제 데스크톱 환경에서 컴퓨터 사용 능력을 평가합니다. 앞의 점수는 부분 점수, 뒤의 점수는 작업 전체를 완료한 경우만 인정하는 엄격한 점수입니다.
Fable 5.1은 Opus 5보다 두 점, Fable 5보다 다섯 점 앞섰습니다. 그러나 실사용 관점에서 큰 차이는 아닙니다. 특히 엄격한 점수에서는 어떤 모델도 작업의 절반을 완전히 완료하지 못했습니다.
컴퓨터 사용은 여전히 최첨단 모델의 가장 취약한 영역입니다.
Humanity’s Last Exam
도구 없음: Fable 5.1 60.9% — Opus 5 56.6%
도구 사용: Fable 5.1 65.0% — Opus 5 63.6%
전문가 수준의 추론 질문을 평가합니다. 도구 없이 실행하면 Fable 5.1이 Opus 5보다 4.3점 앞서지만, 검색과 코드 실행을 허용하면 격차는 1.4점으로 줄어듭니다.
도구 없는 결과는 순수 추론 능력에 가깝고, 도구 사용 결과는 실제 사용 방식에 더 가깝습니다.
Fable 5.1 대 GPT-5.6 Sol
Anthropic은 GPT-5.6 Sol과 비교할 수 있는 네 가지 행을 공개했으며, Fable 5.1은 모두 앞섰습니다.
- Terminal-Bench-Science: 30.2점 차이
- Terminal-Bench 4.0: 18.5점 차이
- AutomationBench: 11.8점 차이
- CursorBench: 6.2점 차이
- GDPval-AA: 1853 대 1711
다만 두 가지를 기억해야 합니다.
- 이 결과는 Anthropic이 경쟁사 모델을 직접 실행한 수치입니다.
- 9개 행 중 5개 행에는 GPT-5.6 Sol 결과가 없습니다. 누락 이유는 Anthropic이 명시하지 않았습니다.
이전 비교는 GPT-5.6 Sol 대 Fable 5 비교에서 확인할 수 있습니다. 이번 결과에서 Fable 5.1은 Fable 5가 보였던 모든 격차를 더 크게 벌렸습니다.
출시 보도에서 놓친 점
모든 수치는 공급업체 실행 결과다
경쟁사 열을 포함한 모든 벤치마크를 Anthropic이 직접 실행했습니다. 출시 시점에 독립적인 연구소가 결과를 재현한 것은 아닙니다.
Anthropic의 벤치마크는 일반적으로 신뢰할 수 있었지만, CursorBench와 OSWorld처럼 격차가 작은 테스트는 실행 환경이나 점수 산정 방식이 달라지면 결과가 뒤집힐 수 있습니다.
Mythos 5.1이 진정한 상한선에 가깝다
Anthropic의 시스템 카드와 출시 게시물에 따르면 Fable 5.1과 Mythos 5.1은 “안전 장치 수준만 다른 동일한 모델”입니다.
Terminal-Bench 4.0에서 Mythos 5.1은 60.9%로 Fable 5.1의 55.8%보다 5점 높았습니다. 이 차이는 에이전트 코딩에서 안전 장치가 만들어내는 비용으로 볼 수 있습니다. 즉, “Anthropic의 가장 유능한 널리 출시된 모델”보다 더 높은 성능을 내는 형제 모델이 존재합니다.
접근 권한에 관한 내용은 Mythos 5.1 대 Fable 5.1 비교에서 다룹니다.
노력 수준이 공개되지 않았다
Anthropic의 노력 수준 문서에 따르면 Fable 5.1의 성능 향상은 xhigh와 max에서 가장 큽니다.
그러나 출시 게시물에는 각 점수가 어떤 노력 수준에서 산출되었는지, 비교 모델이 어떤 설정으로 실행되었는지 나와 있지 않습니다. 노력 수준이 모델 품질과 비용을 결정하는 주요 요소인 만큼, 결과를 재현하려면 중요한 정보입니다.
다국어 성능은 정체됐다
Anthropic은 다국어 성능이 향상되지 않았으며 Fable 5와 동등하다고 밝혔습니다. 영어가 아닌 작업에서는 출시 표가 체감 성능 향상을 과장할 수 있습니다.
안전 장치 수치는 별도의 평가다
Anthropic은 Fable 5와 비교해 다음과 같이 보고했습니다.
- 악의 없는 요청에서 생물학적 오탐 85% 감소
- Claude Code 세션당 사이버 개입 약 60% 감소
이 수치는 Anthropic의 자체 트래픽을 기반으로 하므로 외부에서 재현할 수 없습니다. 다만 Fable 5에서 거부를 자주 경험한 사용자에게는 다른 기능보다 더 중요한 변화일 수 있습니다.
직접 테스트할 내용
출시 표는 어디를 살펴봐야 하는지 알려줍니다. 실제 도입 여부는 자체 평가로 결정해야 합니다.
다음 네 가지 테스트를 실행해 보세요.
장기 에이전트 작업 실행
자체 제품의 장기 에이전트 작업을 Fable 5.1은high, Opus 5는xhigh, Fable 5는high로 설정해 완료할 때까지 실행합니다. Terminal-Bench-Science와 AutomationBench에 가까운 테스트이며, 두 배의 가격이 가치 있는지 판단하는 데 유용합니다.어려운 코딩 프롬프트 10개 비교
동일한 노력 수준으로 Fable 5.1과 Opus 5에 가장 어려운 코딩 프롬프트 10개를 실행합니다. 결과가 비슷하다면 CursorBench 결과처럼 Opus 5가 더 적합할 수 있습니다.노력 수준 스윕
일상적인 작업을 Fable 5.1에서low부터max까지 실행합니다. Anthropic은medium이 Fable 5와 비슷하고,low에서는 작업당 비용이 Opus 5와 경쟁할 수 있다고 주장합니다. 이 주장을 직접 검증하세요.거부율 비교
Fable 5와 Fable 5.1에서 악의 없는 보안 또는 생명과학 프롬프트를 실행하고 거부 횟수를 비교합니다. Anthropic이 보고한 60% 및 85% 감소 주장을 검증하는 테스트입니다.
이 테스트는 Apidog에서 model과 effort를 환경 변수로 사용해 요청으로 구성할 수 있습니다. stop_reason과 답변에 예상 문자열이 포함되는지에 대한 어설션을 추가한 뒤, 모델별로 컬렉션을 실행하세요.
실행 기록을 사용하면 새로운 인프라 없이 재현 가능한 평가 표를 만들 수 있습니다. 시작하려면 Apidog를 다운로드하세요. 요청 형식은 API 워크스루에서 확인할 수 있습니다.
벤치마크가 결정에 미치는 영향
- 장기 에이전트, 연구, 자동화: 격차가 크고 일관적입니다. Fable 5.1이 적합한 모델이며, 가격 분석에 따르면 더 저렴한 캐시 읽기 비용이 이러한 워크로드의 가격 차이를 줄여줍니다.
- IDE 코딩, 지식 Q&A, 도구 지원 추론: Opus 5와의 차이는 1~4점입니다. 더 높은 노력 수준에서 평가를 통과하지 못하는 경우가 아니라면 Opus 5를 계속 사용하는 편이 합리적입니다. 자세한 내용은 Fable 5.1 대 Opus 5 비교를 참고하세요.
- Fable 5 사용자: 모든 행에서 성능이 개선됐고 가격은 변하지 않았으며 오탐율은 감소했습니다. Fable 5.1 대 Fable 5 비교에서 마이그레이션 비용을 확인할 수 있습니다.
자주 묻는 질문
Claude Fable 5.1의 최고 벤치마크 결과는 무엇인가요?
Terminal-Bench-Science 0.1의 52.6%입니다. Fable 5의 24.7%보다 두 배 이상 높고, Opus 5의 29.0%와 GPT-5.6 Sol의 22.4%도 앞섭니다. 모든 수치는 Anthropic이 제공했습니다.
Fable 5.1은 코딩에서 Opus 5와 어떻게 비교되나요?
Anthropic의 결과에 따르면 다음과 같습니다.
- Terminal-Bench 4.0: 55.8% 대 52.3%
- CursorBench 3.2.0: 73.4% 대 70.0%
두 테스트 모두 Fable 5.1이 약 3점 앞서는 실질적이지만 좁은 우위입니다.
Fable 5.1이 GPT-5.6 Sol보다 나은가요?
Anthropic이 두 모델의 결과를 모두 공개한 벤치마크에서는 Fable 5.1이 6~30점 차이로 앞섰습니다. 다만 GPT-5.6 Sol 수치는 Anthropic이증됐나요?
출시 시점에는 검증되지 않았습니다. 모든 수치는 Anthropic이 실행한 결과이므로, 자체 워크로드에서 확인해야 할 주장으로 받아들이는 것이 좋습니다.
Mythos 5.1의 점수는 어떻게 되나요?
Anthropic은 Terminal-Bench 4.0에서 60.9%를 공개했습니다. Fable 5.1의 55.8%보다 5점 높은 결과입니다. 두 모델은 안전 장치 수준만 다르고 동일한 모델입니다.
이 점수들은 어떤 노력 수준에서 산출됐나요?
Anthropic은 공개하지 않았습니다. Anthropic의 지침에 따르면 Fable 5.1의 성능 향상은 xhigh와 max에서 가장 크므로, 높은 노력 수준에서 측정됐다고 가정하고 낮은 설정에서는 점수가 낮아질 가능성을 고려해야 합니다.




Top comments (0)