2주 동안 Qwen 3.8에 관한 정보에는 공백이 있었습니다. 7월 언론 시사회에서는 최첨단 모델을 약속했지만 점수는 공개하지 않아, 초기 보도는 분위기에 의존할 수밖에 없었습니다. 이는 2026년 8월 3일에 바뀌었습니다. 알리바바의 Qwen 3.8-Max 공식 출시 게시물에는 Claude Opus 4.8, Fable 5, GPT-5.6 Sol, 이전 버전인 Qwen3.7-Max와 비교한 전체 벤치마크 표와 Gemini 3.1 Pro 및 GPT-5.6 Sol을 포함한 별도 멀티모달 표가 포함되어 있습니다.
표에는 실제 강점, 분명한 약점, 그리고 헤드라인에서 빠지기 쉬운 방법론적 세부 사항이 함께 담겨 있습니다. 이 글에서는 결과를 해석하고, 공급업체 표를 그대로 받아들이지 않고 직접 API 평가를 수행하는 방법까지 정리합니다. 매개변수, 가격, 접근 방식 등 모델 개요가 먼저 필요하다면 Qwen 3.8-Max 설명을 참고하세요.
먼저 전제부터 명확히 하겠습니다. 아래 점수는 모두 알리바바가 발표한 표에서 가져왔고, 리더보드 데이터 기준일은 2026년 8월 3일입니다. 작성 시점에는 독립 평가 결과가 없었습니다. 따라서 모든 숫자는 공급업체가 제시한 주장으로 해석해야 합니다.
표, 한눈에 보기
알리바바가 발표한 주요 텍스트 모델 결과입니다. 모든 항목에서 점수가 높을수록 좋습니다.
| 벤치마크 | Qwen 3.8-Max | Claude Opus 4.8 | Fable 5 | GPT-5.6 Sol | Qwen3.7-Max |
|---|---|---|---|---|---|
| 터미널 벤치 2.1 | 86.6 | 84.6 | 84.6 | 88.8 | 74.5 |
| SWE-bench Pro | 67.7 | 69.2 | 80.0 | 64.6 | 60.6 |
| PaperBench | 93.0 | 80.3 | 88.8 | 90.5 | 64.8 |
| GPQA Diamond | 92.6 | 92.0 | 92.6 | 94.1 | 92.4 |
| IFBench | 82.8 | 62.2 | 63.5 | 72.7 | 79.1 |
| HLE(인류의 마지막 시험) | 43.6 | 45.7 | 53.3 | 47.2 | 41.4 |
출처는 알리바바의 공급업체 실행 표입니다. 여기서 “공급업체 실행”이라는 표현은 특히 중요합니다. 아래에서 방법론적 영향을 자세히 다룹니다.
Qwen 3.8-Max가 강한 영역
PaperBench: 가장 강한 플래그십 결과
PaperBench는 모델이 연구 논문의 결과를 재현할 수 있는지 평가합니다. Qwen 3.8-Max는 93.0점을 기록해 GPT-5.6 Sol(90.5), Fable 5(88.8), Opus 4.8(80.3)을 앞섰습니다.
또한 Qwen3.7-Max의 64.8점에서 28점 이상 상승했습니다. 세대 간 격차가 큰 만큼, 독립 평가에서도 같은 결과가 유지되는지 확인할 필요가 있습니다. 유지된다면 장기 연구 작업과 논문 재현 작업에서 중요한 신호가 될 수 있습니다.
IFBench: 지시 따르기
IFBench에서 Qwen 3.8-Max는 82.8점을 기록했습니다. 비교 대상 중 가장 가까운 비-Qwen 모델은 GPT-5.6 Sol의 72.7점이며, Fable 5는 63.5점, Opus 4.8은 62.2점입니다.
Qwen3.7-Max도 이미 79.1점이었습니다. 따라서 지시 따르기는 이번 버전에서 새로 생긴 특성이라기보다 Qwen 계열의 지속적인 강점으로 보입니다.
실무에서는 다음처럼 검증할 수 있습니다.
- JSON만 반환해야 하는 요청
- 필수 필드가 있는 구조화된 출력
- 다단계 제약 조건
- 금지된 형식이나 필드가 있는 응답
- 긴 시스템 프롬프트와 사용자 프롬프트의 우선순위 처리
터미널 벤치 2.1: Claude보다 근소하게 앞섬
알리바바의 터미널 벤치 2.1 실행에서 Qwen 3.8-Max는 86.6점을 기록했습니다. Opus 4.8과 Fable 5는 모두 84.6점입니다. 다만 GPT-5.6 Sol은 88.8점으로 더 높습니다.
즉, 이 결과는 압도적 1위가 아니라 GPT-5.6 Sol에 이은 2위입니다. 그래도 에이전트형 터미널 작업에서 Anthropic의 두 플래그십을 앞섰다는 점은 주목할 만합니다.
멀티모달 성능
별도 멀티모달 표에서 Qwen 3.8-Max는 강한 결과를 보입니다.
- MathVision: 95.2
- LogicVista: 91.9
- OSWorld-Verified: 86.1
- OCR 관련 행: 표 전반에서 선두권
다만 Opus 4.8과 Fable 5는 해당 멀티모달 비교에서 직접 경쟁하지 않으므로, 텍스트 모델 표와 같은 방식으로 해석하면 안 됩니다. Gemini 3.1 Pro와 GPT-5.6 Sol 대비 시각 추론 및 문서 인텔리전스가 주요 차별점으로 제시됩니다.
이번 여름의 다른 오픈소스 모델과 비교한다면 양식 차이도 확인해야 합니다. 예를 들어 Kimi K3는 텍스트 전용입니다. 자세한 비교는 Qwen 3.8 vs Kimi K3에서 확인할 수 있습니다.
Qwen 3.8-Max가 약한 영역
알리바바는 불리한 행도 표에 남겼습니다. 특히 다음 세 가지를 확인해야 합니다.
HLE: 43.6점
Humanity’s Last Exam(HLE)에서 Qwen 3.8-Max는 43.6점입니다.
| 모델 | HLE 점수 |
|---|---|
| Fable 5 | 53.3 |
| GPT-5.6 Sol | 47.2 |
| Claude Opus 4.8 | 45.7 |
| Qwen 3.8-Max | 43.6 |
| Qwen3.7-Max | 41.4 |
Qwen3.7-Max보다 높지만, 비교한 4대 플래그십 중에서는 최하위입니다. HLE는 벤치마크 특화 튜닝에 비교적 강하게 저항하는 평가로 알려져 있으므로, 이 행은 단순히 무시하기 어렵습니다.
SWE-bench Pro: Fable 5와 큰 격차
SWE-bench Pro에서 Qwen 3.8-Max는 67.7점을 기록했습니다.
| 모델 | SWE-bench Pro 점수 |
|---|---|
| Fable 5 | 80.0 |
| Claude Opus 4.8 | 69.2 |
| Qwen 3.8-Max | 67.7 |
| GPT-5.6 Sol | 64.6 |
| Qwen3.7-Max | 60.6 |
Qwen3.7-Max보다 개선된 것은 분명합니다. 하지만 Fable 5와는 12점 이상 차이가 나며, Opus 4.8에도 소폭 뒤집니다.
“터미널 벤치에서 Claude를 앞섰다”와 “SWE-bench Pro에서 Fable 5에 크게 뒤처진다”는 둘 다 사실입니다. 제품 선택 시에는 어떤 코딩 작업을 수행하는지가 더 중요합니다.
DeepSWE 및 심층 소프트웨어 엔지니어링
DeepSWE도 알리바바 자체 표에서 Qwen 3.8-Max가 프론티어 모델에 뒤처지는 행입니다. 전체 패턴은 비교적 일관적입니다.
- 터미널 기반 에이전트 작업: 경쟁력 있음
- 심층적인 소프트웨어 엔지니어링 평가: 상대적으로 약함
- 문서·OCR·시각 추론: 강점
요약하면 Qwen 3.8-Max는 여러 에이전트 행에서 Opus 4.8을 앞서고, 핵심 코딩 평가에서는 Fable 5에 뒤처지며, 멀티모달과 문서 인텔리전스에서 강점을 보입니다. 이는 전반적인 절대 승리라기보다 작업 유형에 따라 선택해야 하는 모델에 가깝습니다.
표를 읽을 때 놓치기 쉬운 4가지
벤치마크 숫자를 활용하려면 점수만 비교하지 말고 실행 조건도 확인해야 합니다.
1. 모든 숫자는 공급업체가 실행했습니다
알리바바는 자사 모델과 경쟁사 모델을 모두 평가했습니다. 이는 일반적인 출시 관행이지만, 다음 항목이 결과에 영향을 줄 수 있습니다.
- 벤치마크 버전
- 프롬프트 전략
- 샘플링 설정
- 재시도 정책
- 도구 호출 구성
- 에이전트 하네스
이것이 곧 부정행위를 뜻하지는 않습니다. 다만 동일한 모델도 실행 구성에 따라 결과가 달라질 수 있다는 뜻입니다.
2. 다수의 코딩 행이 Claude Code 하네스를 사용했습니다
알리바바는 대부분의 코딩 벤치마크를 Claude Code 하네스에서 실행했고, Qwen 3.8-Max는 Anthropic 호환 API를 통해 연결했습니다.
이는 두 가지 의미가 있습니다.
- 동일한 널리 쓰이는 하네스에서 모델을 비교했다는 점에서는 공정할 수 있습니다.
- 해당 점수는 “Qwen 자체 실행 점수”가 아니라 “Claude Code 하네스 내에서 실행된 Qwen 점수”입니다.
에이전트 평가는 하네스에 민감합니다. 따라서 실제 배포 환경이 Claude Code, 자체 에이전트, OpenAI SDK 기반 도구 중 무엇인지에 따라 별도 평가가 필요합니다.
3. 일부 벤치마크는 Qwen 팀이 만들었습니다
QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench는 Qwen 팀이 만든 평가입니다.
자체 개발 벤치마크가 무의미한 것은 아닙니다. 공개 벤치마크가 놓치는 실제 기능을 측정할 수도 있습니다. 그러나 자체 벤치마크의 높은 점수는 SWE-bench Pro 같은 외부 공개 평가의 높은 점수와는 다른 종류의 증거입니다.
숫자를 인용할 때는 먼저 다음을 구분하세요.
- 공개·외부 벤치마크인가?
- 공급업체 자체 벤치마크인가?
- 실제 사용자 작업 부하를 반영하는가?
- 재현 가능한 실행 설정이 공개되었는가?
4. Fable 5 결과의 각주
알리바바 표에는 Fable 5 결과가 폴백을 포함할 수 있다는 각주가 있습니다. 기술적 원인이 무엇이든, 이 결과가 해당 모델의 단일하고 깨끗한 실행을 완전히 반영하지 않을 가능성을 의미합니다.
작은 각주는 벤치마크 표에서 매우 중요합니다. 특히 경쟁 모델 비교에서는 반드시 읽어야 합니다.
이 문제는 알리바바만의 사례가 아닙니다. Anthropic, OpenAI, Google도 각자 방법론적 선택이 포함된 자체 실행 표를 공개합니다. Kimi K3 벤치마크 분석에서도 비슷한 패턴을 확인할 수 있습니다.
핵심은 단순합니다. 공급업체 표는 측정값 자체가 아니라, 특정 조건에서 제시된 주장입니다.
다음 벤치마크 표를 검토하는 체크리스트
2026년 8월 3일 기준으로 Qwen 3.8-Max의 독립 평가는 아직 없습니다. Artificial Analysis나 커뮤니티 리더보드의 결과가 나오면 공급업체 표와의 차이를 비교할 수 있습니다.
그전까지는 아래 체크리스트를 사용하세요.
누가 평가를 실행했는가?
공급업체가 실행한 경쟁사 점수는 특히 실행 조건을 확인해야 합니다.어떤 하네스와 설정을 사용했는가?
에이전트 평가는 하네스, 도구 정의, 재시도 설정에 영향을 받습니다.공급업체가 만든 벤치마크인가?
자체 개발 평가는 유용할 수 있지만 외부 공개 평가와 구분해야 합니다.각주가 있는가?
폴백, 제한된 모델 접근, 비표준 구성 같은 정보는 각주에 숨어 있는 경우가 많습니다.빠진 행은 무엇인가?
공급업체가 공개하지 않은 결과도 정보가 될 수 있습니다. 이전 세대와 비교해 사라진 벤치마크가 있는지 확인하세요. 예를 들어 이전 세대 모델 비교와 대조할 수 있습니다.두 번째 출처를 기다릴 수 있는가?
며칠 또는 일주일 뒤 나오는 독립 결과가 초기 출시 표보다 더 실용적인 판단 근거가 될 수 있습니다.
직접 평가를 실행하는 방법
벤치마크 표를 읽는 것보다 좋은 방법은 자신의 작업 부하로 직접 평가하는 것입니다.
Qwen 3.8-Max는 알리바바 클라우드 모델 스튜디오에서 사용할 수 있으며, 공식 모델 페이지에는 모델 ID가 qwen3.8-max로 등록되어 있습니다. OpenAI 호환 및 Anthropic 호환 API를 지원하므로, 현재 사용 중인 평가 도구와 연결해 비교할 수 있습니다.
권장 평가 구성
Apidog에서 다음과 같이 구성할 수 있습니다.
- 모델 스튜디오의 채팅 완료 엔드포인트에
qwen3.8-max요청을 만듭니다. - 기준 모델용 요청을 하나 더 만듭니다. 예: Qwen3.7-Max, Kimi K3, Claude, GPT 엔드포인트
- 실제 프로덕션 프롬프트 20~30개를 테스트 시나리오로 저장합니다.
- 응답에 필요한 조건을 어설션으로 추가합니다.
- 유효한 JSON인지
- 필수 필드가 존재하는지
- 금지된 필드가 없는지
- 응답 시간이 임계값 이하인지
- 특정 형식이나 키워드를 만족하는지
- 두 시나리오를 같은 조건에서 연속 실행합니다.
- 통과율, 응답 시간, 실패 응답을 모델별로 비교합니다.
예를 들어 구조화된 JSON 응답을 기대한다면 다음과 같은 검증 기준을 둘 수 있습니다.
{
"assertions": [
{
"type": "json-schema",
"required": ["summary", "risk_level", "actions"]
},
{
"type": "response-time",
"operator": "<=",
"value": 5000
}
]
}
이 방식의 핵심은 PaperBench나 HLE 점수 대신, 실제로 배포할 프롬프트와 응답 계약을 기준으로 모델을 평가하는 것입니다.
Qwen 3.8-Max 평가 시 확인할 사항
Qwen 관련 평가에서는 특히 다음 두 가지를 분리해 확인하세요.
- 기본값이
reasoning_effort: xhigh인 경우, 실제 배포할 추론 수준에서 비용과 지연 시간을 측정합니다. - Anthropic 호환 엔드포인트를 사용할 계획이라면 OpenAI 호환 엔드포인트와 별도로 테스트합니다.
알리바바의 코딩 벤치마크 다수가 Anthropic 호환 프로토콜을 통해 실행되었으므로, 프로토콜과 하네스가 달라지면 실제 결과도 달라질 수 있습니다.
Apidog를 무료로 다운로드한 뒤 두 모델 엔드포인트를 환경으로 구성하면, 독립 리더보드 결과를 기다리는 동안에도 자체 1차 데이터를 만들 수 있습니다.
자주 묻는 질문
Qwen 3.8 벤치마크 숫자는 독립적으로 검증되었습니까?
아니요. 2026년 8월 3일 기준으로 공개된 숫자는 모두 알리바바 자체 표에서 가져온 것입니다. 작성 시점에는 Artificial Analysis와 커뮤니티 리더보드가 Qwen 3.8-Max 점수를 아직 공개하지 않았습니다. 독립 결과가 나오기 전까지는 공급업체 주장으로 해석해야 합니다.
Qwen 3.8-Max의 가장 좋은 벤치마크 결과는 무엇입니까?
주요 텍스트 표에서는 PaperBench의 93.0점이 가장 강한 결과입니다. GPT-5.6 Sol(90.5), Fable 5(88.8), Opus 4.8(80.3)을 앞섭니다. 멀티모달 표에서는 MathVision 95.2점과 OCR 관련 행이 주요 강점으로 제시됩니다.
Qwen 3.8-Max는 어디에서 명확히 약합니까?
HLE에서 43.6점을 기록해 비교한 4대 플래그십 중 최하위입니다. SWE-bench Pro에서는 67.7점으로 Fable 5의 80.0점보다 낮으며, DeepSWE에서도 상대적으로 뒤처집니다. 알리바바 표 기준으로 심층 소프트웨어 엔지니어링과 광범위한 지식 평가는 약점입니다.
Qwen 3.8은 Qwen 3.7-Max보다 얼마나 개선되었습니까?
알리바바 표에서는 세대 간 개선 폭이 큽니다.
- 터미널 벤치 2.1: 74.5 → 86.6
- SWE-bench Pro: 60.6 → 67.7
- PaperBench: 64.8 → 93.0
다만 업그레이드 가치 여부는 벤치마크 점수만이 아니라 가격, 응답 시간, 멀티모달 요구 사항, 실제 프롬프트 성능에 따라 판단해야 합니다. 자세한 선택 기준은 Qwen 3.8 vs Qwen 3.7 비교에서 확인할 수 있습니다.

Top comments (0)