Alibaba는 2026년 8월 초 Qwen 3.8-Max를 공식 출시했습니다. 이 모델은 2.4조 매개변수 규모의 MoE(Mixture-of-Experts) 모델이지만 토큰당 95B 매개변수만 활성화하며, 최대 100만 토큰 컨텍스트에서 100만 토큰당 입력 $2 / 출력 $6의 단일 가격을 제공합니다. 또한 일주일 내 가중치를 Hugging Face와 ModelScope에 공개하겠다고 약속했습니다. 지금까지 Qwen-Max급 모델이 오픈 가중치를 공개한 적은 없었다는 점에서 중요한 변화입니다.
공식 발표에서 Alibaba는 Qwen 3.8-Max를 현재까지 가장 유능한 Qwen 모델이라고 소개합니다. 공급업체 벤치마크에는 강력한 결과와 일부 패배 항목도 함께 공개되어 있습니다.
이 글에서는 다음을 다룹니다.
- Qwen 3.8-Max의 아키텍처와 주요 사양
- 벤치마크 수치를 해석하는 방법
- Kimi K3, Fable 5, GPT-5.6 Sol과의 차이
- OpenAI 호환 및 Anthropic 호환 API 호출 방법
- 실제 워크로드에서 모델을 검증하는 방법
API 기반으로 개발한다면 OpenAI 및 Anthropic 호환 엔드포인트를 모두 지원한다는 점이 중요합니다. Apidog 같은 프로토콜 인식 API 클라이언트를 사용하면 동일한 API 키로 두 프로토콜을 테스트할 수 있습니다.
Qwen 3.8-Max 한눈에 보기
| 사양 | Qwen 3.8-Max |
|---|---|
| 개발사 | Alibaba (Qwen 팀) |
| 출시일 | 2026년 8월 초 (Model Studio 정식 출시, 8월 3일) |
| 아키텍처 | MoE, Qwen 3.5 기반으로 구축 |
| 총 매개변수 | 2.4T |
| 활성 매개변수 | 95B (약 4% 활성화) |
| 컨텍스트 창 | 1,000,000 토큰 |
| 최대 출력 | 65,536 토큰 |
| 모달리티 | 텍스트 + 이미지 입력, 텍스트 출력 |
| 추론 제어 |
reasoning_effort: xhigh(기본), medium, low |
| API 모델 ID | qwen3.8-max |
| 가격 | 100만 토큰당 입력 $2 / 출력 $6, 전체 컨텍스트에 걸쳐 단일 요금 |
| 공개 가중치 | 다음 주(~8월 10일) 공개 약속; 2026년 8월 초 현재 다운로드 불가 |
| API 프로토콜 | OpenAI 호환 및 Anthropic 호환 |
표의 정보는 Alibaba 출시 자료와 Model Studio 가격 책정 페이지를 기준으로 합니다.
Qwen 3.8-Max는 무엇인가
Qwen 3.8-Max는 Alibaba Qwen 제품군의 새 플래그십 모델이며, Qwen 3.5 아키텍처를 기반으로 합니다. 라인업 최상단에서 Qwen 3.7-Max를 대체합니다.
Alibaba의 표에서는 이전 모델 대비 다음과 같은 향상이 제시됩니다.
- Terminal Bench 2.1:
74.5 → 86.6 - PaperBench:
64.8 → 93.0
기존 모델에서 전환을 검토한다면 Qwen 3.8 vs Qwen 3.7 Max 비교를 확인하세요.
핵심은 매개변수 분할입니다. 총 2.4T 매개변수 중 각 순방향 패스에서 활성화되는 매개변수는 95B입니다. 활성화 비율은 약 4%이며, MoE 설계 덕분에 대규모 모델을 입력 $2 / 출력 $6에 제공할 수 있습니다.
비교 기준으로 Kimi K3는 총 2.8T 매개변수와 활성 104B 매개변수를 사용합니다. 수치상 Qwen 3.8-Max는 총 규모와 활성 규모 모두 더 작습니다.
입력은 텍스트와 이미지를 지원하고 출력은 텍스트입니다. Alibaba 블로그에서는 200페이지 이상의 PDF 이해, “메모리 그래프” 기반의 100시간 분량 비디오 이해도 시연합니다. 다만 공개 API 구성에서는 텍스트와 이미지만 입력 모달리티로 명시되어 있으므로, 비디오 이해 기능은 별도 API 입력 형식이라기보다 데모 기능으로 보는 것이 안전합니다.
추론 동작은 다음 매개변수로 제어합니다.
-
reasoning_effort:xhigh(기본),medium,low enable_thinkingpreserve_thinking
주의할 점은 사고 모드와 비사고 모드의 기본 요금은 같더라도, 사고 토큰이 출력 토큰으로 계산된다는 것입니다. 따라서 기본값인 xhigh를 사용하면 단순한 출력 길이만 기준으로 계산한 예상 비용보다 실제 비용이 커질 수 있습니다.
최초의 오픈 가중치 Max급 Qwen
이번 출시의 핵심 전략 중 하나는 Max급 모델의 오픈 가중치 공개 약속입니다.
Alibaba는 여러 Qwen 모델을 오픈 소스화해 왔지만 Max 등급 가중치를 공개한 적은 없었습니다. Qwen 3.8-Max는 Hugging Face와 ModelScope에 “다음 주” 공개될 예정이며, 시점은 대략 8월 10일경으로 예상됩니다.
다만 구현 및 도입 전에 다음 두 가지를 고려해야 합니다.
가중치는 아직 다운로드할 수 없습니다.
2026년 8월 초 현재 공개는 약속 단계입니다. Kimi K3도 출시 11일 후 가중치를 공개한 사례가 있으므로 일정 지연 가능성을 고려해야 합니다.2.4T 모델 자체 호스팅은 다중 노드 프로젝트입니다.
강한 양자화를 적용하더라도 일반 워크스테이션에서 실행하는 수준은 아닙니다. 대부분의 팀에는 로컬 배포보다 서드파티 호스팅 제공업체를 통한 접근이 현실적입니다.
정가 API 비용을 줄이는 것이 목적이라면, 현재는 Qwen Chat과 Model Studio 무료 할당량을 활용하는 방법이 실용적입니다. 자세한 내용은 Qwen 3.8을 무료로 사용하는 방법을 참고하세요.
벤치마크 결과: 승리와 패배를 함께 보기
Alibaba는 Qwen 3.8-Max를 Claude Opus 4.8, Fable 5, GPT-5.6 Sol, Qwen 3.7-Max와 비교한 벤치마크 표를 공개했습니다.
수치를 해석할 때는 다음을 전제로 두어야 합니다.
- 결과는 공급업체가 직접 실행했습니다.
- 다수의 코딩 항목은 모든 모델에 Claude Code 하네스를 사용했습니다.
- QwenSWEBench, QwenQoderBench, CoWorkBench, RecreationBench는 Alibaba 내부 개발 벤치마크입니다.
- 작성 시점에는 Artificial Analysis 같은 외부 기관의 독립 수치가 없습니다.
강점을 보인 항목
PaperBench: 93.0
GPT-5.6 Sol(90.5), Fable 5(88.8), Opus 4.8(80.3)을 앞섭니다.IFBench: 82.8
해당 항목 최고 점수이며 Sol의 72.7보다 높습니다.Terminal Bench 2.1: 86.6
Opus 4.8 및 Fable 5(각 84.6)를 앞서며 Sol(88.8)에만 뒤집니다.멀티모달 및 문서 인텔리전스
MathVision 95.2, LogicVista 91.9, OSWorld-Verified 86.1, OCR 관련 항목에서 강점을 보입니다.
약점을 보인 항목
SWE-bench Pro: 67.7
Fable 5의 80.0에 크게 뒤처지고, Opus 4.8의 69.2보다도 낮습니다. 다만 Sol의 64.6보다는 높습니다.HLE: 43.6
Fable 5(53.3), Sol(47.2), Opus 4.8(45.7)보다 낮은 점수입니다.
실무적으로는 다음처럼 해석할 수 있습니다.
- 문서 이해, OCR, 이미지 기반 워크플로우에서는 우선 테스트할 가치가 있습니다.
- 핵심 소프트웨어 엔지니어링 작업에서는 Fable 5와 직접 비교해야 합니다.
- 과학 추론은 경쟁력 있는 수준입니다. GPQA Diamond에서 92.6점으로 Fable 5와 동률이고 Sol의 94.1에 근접합니다.
하네스 세부 정보와 독립 검증 시 확인할 항목은 Qwen 3.8 벤치마크 분석에서 확인할 수 있습니다.
Alibaba는 추가 쇼케이스도 공개했습니다.
- 공개 저장소에서 16일간 자율 코딩: 265개 커밋, 127개 풀 리퀘스트
- 원본 논문의 AIME24 결과를 넘어선 논문 재현
- Tianchi 콘테스트에서 24시간 내 526개 인간 팀 중 458개 팀 초과
이 결과들은 통제된 독립 평가가 아니라 공급업체 데모입니다. 기능 가능성을 확인하는 자료로 활용하되, 도입 결정은 자체 저장소와 자체 태스크에서 재현 테스트로 검증해야 합니다. 코딩 워크로드 검증 방법은 코딩을 위한 Qwen 3.8에서 다룹니다.
Kimi K3, Fable 5, GPT-5.6 Sol과 비교
Kimi K3 대비
두 모델은 중국 연구소가 공개한 대형 MoE 모델이라는 점에서 자연스러운 비교 대상입니다.
| 항목 | Qwen 3.8-Max | Kimi K3 |
|---|---|---|
| 총 매개변수 | 2.4T | 2.8T |
| 활성 매개변수 | 95B | 104B |
| 모달리티 | 텍스트 + 이미지 | 텍스트 전용 |
| 가중치 상태 | 공개 예정 | 공개됨 |
| 입력 가격 | $2 / 1M 토큰 | $3 / 1M 토큰 |
| 출력 가격 | $6 / 1M 토큰 | $15 / 1M 토큰 |
| 캐시 적중 | 명시된 입력 캐시 할인 | $0.30 |
직접적인 독립 일대일 평가는 아직 없습니다. 현재는 각 공급업체가 자체 벤치마크 표를 제공하는 상태입니다. 항목별 비교는 Qwen 3.8 vs Kimi K3, Kimi 모델 개요는 Kimi K3는 무엇인가에서 확인할 수 있습니다.
Fable 5 대비
Alibaba 자체 표 기준으로 Fable 5는 핵심 코딩 벤치마크에서 우위에 있습니다.
- SWE-bench Pro:
67.7 vs 80.0 - HLE:
43.6 vs 53.3
Qwen 3.8-Max의 차별점은 다음과 같습니다.
- 더 낮은 가격
- 1M 토큰 컨텍스트
- 공개 예정인 오픈 가중치
- 더 강한 멀티모달 및 문서 인텔리전스 성능
GPT-5.6 Sol 대비
GPT-5.6 Sol은 다음 항목에서 우위입니다.
- Terminal Bench:
88.8 vs 86.6 - GPQA:
94.1 vs 92.6 - HLE:
47.2 vs 43.6
반면 Qwen 3.8-Max는 다음 항목에서 앞섭니다.
- PaperBench:
93.0 vs 90.5 - IFBench:
82.8 vs 72.7
가격 측면에서 Qwen의 $2/$6은 GPT-5.6 Terra의 $2/$12 출력 요금보다 낮고, Sol 등급 접근은 더 비쌉니다.
Claude Opus 5의 가격은 $5/$25입니다. 공급업체 벤치마크의 신뢰도와 별개로, Alibaba는 플래그십 모델을 대규모 처리량 워크로드에서도 검토할 수 있는 가격으로 책정했습니다.
가격: 1M 토큰 전체에서 입력 $2 / 출력 $6
가격 구조는 간단합니다.
- 입력: 100만 토큰당
$2 - 출력: 100만 토큰당
$6 - 컨텍스트 길이: 0~1M 토큰까지 동일 요금
- 사고 모드 여부: 기본 단가는 동일
긴 컨텍스트 모델은 보통 프롬프트 길이에 따라 가격 구간이 올라가지만, Qwen 3.8-Max는 1M 컨텍스트 전체에서 단일 요금을 적용합니다.
Qwen 3.7-Max의 정가는 입력 $2.5 / 출력 $7.5였으므로, Qwen 3.8-Max는 정가 기준 더 저렴합니다. 다만 Qwen 3.7-Max가 50% 할인 프로모션 중이라면 $1.25 / $3.75가 되어 비용 중심 워크로드에서는 여전히 비교 대상이 됩니다.
컨텍스트 캐시 요금은 다음과 같습니다.
- 캐시 적중: 입력 요금의 10%
- 명시적 캐시 생성: 입력 요금의 125%
테스트용 무료 할당량도 제공됩니다.
- 1M 토큰
- 싱가포르 지역 한정
- 90일 유효
작업별 비용 계산과 사고 토큰 비용을 포함한 분석은 Qwen 3.8 가격 가이드에서 확인할 수 있습니다.
Qwen 3.8-Max에 접근하는 방법
현재 접근 방법은 다섯 가지입니다.
1. Qwen Chat
소비자용 앱으로 API 키가 필요 없습니다. 빠르게 모델의 응답 스타일과 멀티모달 기능을 확인하는 데 적합합니다.
2. Alibaba Cloud Model Studio(DashScope) API
home.qwencloud.com에서 API 키를 발급받고 환경 변수로 설정합니다.
export DASHSCOPE_API_KEY="your_api_key"
모델 ID는 다음과 같습니다.
qwen3.8-max
OpenAI 호환 엔드포인트는 지역별로 제공됩니다.
# 베이징
https://dashscope.aliyuncs.com/compatible-mode/v1
# 싱가포르
https://dashscope-intl.aliyuncs.com/compatible-mode/v1
# 미국 버지니아
https://dashscope-us.aliyuncs.com/compatible-mode/v1
Model Studio 모델 페이지에서는 이 모델을 권장 스택 상단에 표시합니다.
OpenAI 호환 cURL 예시
curl https://dashscope-intl.aliyuncs.com/compatible-mode/v1/chat/completions \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "qwen3.8-max",
"messages": [
{
"role": "user",
"content": "다음 API 오류 로그를 분석하고 가능한 원인을 알려줘."
}
],
"reasoning_effort": "medium"
}'
3. Anthropic 호환 엔드포인트
Anthropic Messages 프로토콜을 사용하려면 다음 엔드포인트를 사용할 수 있습니다.
https://dashscope-intl.aliyuncs.com/apps/anthropic
Claude용으로 구축된 도구에서 기본 URL과 모델 이름을 바꾸는 방식으로 Qwen을 테스트할 수 있습니다.
4. 코딩 하네스
Alibaba는 다음 에이전트에 대한 공식 구성을 발표했습니다.
- Claude Code
- Codex
- Qoder
- Qwen Code
- OpenClaw
Claude Code를 예로 들면 환경 변수를 설정합니다.
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
export ANTHROPIC_API_KEY="$DASHSCOPE_API_KEY"
Alibaba가 다수의 코딩 벤치마크를 Claude Code 하네스에서 실행했다는 점을 고려하면, 이 구성은 공급업체 수치를 자체 환경에서 검증하기 위한 출발점이 될 수 있습니다.
5. 공개 가중치
가중치는 Hugging Face와 ModelScope에 공개될 예정이지만, 2026년 8월 초 기준으로는 다운로드할 수 없습니다.
2~4번 방식의 Python 및 cURL 예시는 Qwen 3.8 API 가이드에서 확인할 수 있습니다.
이중 프로토콜 API 테스트
같은 모델이 OpenAI 호환과 Anthropic 호환 형태로 제공되면, 실제로는 다음을 확인해야 합니다.
- 두 프로토콜에서 동일한 프롬프트가 유사하게 동작하는가?
- 스트리밍 이벤트 형식은 어떻게 다른가?
-
reasoning_content는 어떤 순서와 길이로 전달되는가? -
reasoning_effort를 바꿨을 때 출력 품질과 비용은 어떻게 달라지는가? - 지역별 엔드포인트의 지연 시간은 어떤 차이가 있는가?
Apidog에서는 지역별 기본 URL을 환경으로 저장하고, 요청 본문을 수정하지 않은 채 지역만 전환할 수 있습니다. 또한 동일 프롬프트를 OpenAI 호환 엔드포인트와 Anthropic 프로토콜 엔드포인트로 전송해 응답을 비교할 수 있습니다.
권장 테스트 절차는 다음과 같습니다.
- 베이징, 싱가포르, 버지니아 기본 URL을 각각 환경 변수로 저장합니다.
- 동일한 시스템 프롬프트와 사용자 프롬프트를 준비합니다.
- OpenAI 호환 요청과 Anthropic Messages 요청을 각각 생성합니다.
- SSE 스트림에서 최종 답변 전
reasoning_content이벤트를 검사합니다. -
xhigh,medium,low설정별 응답 시간, 출력 토큰, 품질을 기록합니다. -
qwen3.8-max,qwen3.7-max,kimi-k3에 동일 프롬프트를 실행해 비교합니다.
엔드포인트 연결을 시작하려면 Apidog를 무료로 다운로드하세요.
Qwen 3.8-Max의 라인업 내 위치
Qwen 3.8-Max는 Qwen 3.7-Max 및 플러스 등급 모델보다 상위에 위치합니다.
간단한 선택 기준은 다음과 같습니다.
| 요구 사항 | 권장 선택 |
|---|---|
| 멀티모달, 문서 이해, 고급 에이전트 작업 | Qwen 3.8-Max |
| 비용 효율적인 플래그십, 프로모션 가격 활용 | Qwen 3.7-Max |
| 일반적인 일상 작업, 낮은 비용 우선 | 플러스 등급 모델 |
더 자세한 모델 선택 기준은 최고의 Qwen 모델 가이드에서 확인할 수 있습니다.
자주 묻는 질문
Qwen 3.8은 오픈 소스인가요?
아직은 아닙니다. Alibaba는 2026년 8월 초 출시 시점에 “다음 주” Hugging Face와 ModelScope에 가중치를 공개하겠다고 약속했습니다. 공개되면 최초의 오픈 가중치 Max급 Qwen이 됩니다.
그전까지는 API 또는 Qwen Chat으로 접근할 수 있습니다. 무료 접근 방법은 Qwen 3.8을 무료로 사용하는 방법을 참고하세요.
Qwen 3.8-Max의 가격은 얼마인가요?
입력 100만 토큰당 $2, 출력 100만 토큰당 $6입니다. 최대 1M 컨텍스트 전체에 단일 요금이 적용됩니다.
캐시 적중은 입력 요금의 10%로 청구됩니다. 사고 토큰은 출력 토큰으로 계산되며 기본 추론 노력은 xhigh이므로, 추론 집약적 작업에서는 표시 가격보다 높은 예산을 잡는 것이 안전합니다.
Qwen 3.8-Max가 Kimi K3보다 좋은가요?
직접적인 독립 일대일 평가는 아직 없습니다.
사양상 Qwen 3.8-Max는 더 작고(2.4T/활성 95B 대 2.8T/104B), K3가 텍스트 전용인 것과 달리 멀티모달입니다. 출력 가격도 Qwen이 더 낮습니다($6 대 $15).
반면 K3는 가중치가 이미 공개되었다는 장점이 있습니다.
Claude Code에서 Qwen 3.8-Max를 사용할 수 있나요?
가능합니다. Anthropic 호환 DashScope 엔드포인트를 ANTHROPIC_BASE_URL로 지정하고, ANTHROPIC_MODEL=qwen3.8-max를 설정하면 됩니다.
export ANTHROPIC_BASE_URL="https://dashscope-intl.aliyuncs.com/apps/anthropic"
export ANTHROPIC_MODEL="qwen3.8-max"
Alibaba는 Codex, Qoder, Qwen Code, OpenClaw용 공식 구성도 제공합니다.
다음 단계
Qwen 3.8-Max는 단순한 발표가 아니라 다음 요소를 갖춘 플래그십 출시입니다.
- 세 API 지역에서의 정식 제공
- 공개 가격
- 승패를 모두 포함한 공급업체 벤치마크
- OpenAI 및 Anthropic 호환 API
- 공개 예정인 오픈 가중치
핵심 코딩 벤치마크에서는 Fable 5를 앞서지 못했지만, 여러 에이전트 항목에서는 Opus 4.8을 능가하고 문서 및 멀티모달 작업에서 강점을 보입니다. 가격은 입력 $2 / 출력 $6입니다.
도입 판단은 벤치마크 표만으로 내리지 않는 것이 좋습니다. 무료 할당량으로 API 키를 발급하고, 두 프로토콜 엔드포인트를 연결한 뒤, 실제 서비스에서 사용하는 프롬프트와 데이터로 직접 비교하세요.
시작점으로 Qwen 3.8 API 설정 가이드를 확인하고, 가중치 공개 여부는 8월 10일경 다시 확인하세요.

Top comments (0)