DEV Community

Cover image for Qwen 3.8 vs Qwen 3.7 Max: 무엇이 달라졌을까
Rihpig
Rihpig

Posted on • Originally published at apidog.com

Qwen 3.8 vs Qwen 3.7 Max: 무엇이 달라졌을까

Alibaba는 2026년 8월 초 Qwen 3.8-Max를 출시했습니다. 이미 프로덕션에서 qwen3.7-max를 사용 중이라면, 모델 ID만 바꾸기 전에 성능·비용·멀티모달 요구 사항을 함께 검토해야 합니다. Qwen 3.8-Max는 에이전트 및 연구 벤치마크 성능, 이미지 입력, 더 낮은 정가, 그리고 Max 클래스 최초의 개방형 가중치 약속을 제공합니다.

오늘 Apidog 사용해 보기

다만 “새 모델이므로 무조건 업그레이드”는 올바른 결론이 아닙니다. Qwen 3.7-Max에는 현재 50% 한정 할인 프로모션이 적용되어 있어, 실사용 단가만 보면 3.8-Max보다 저렴합니다. 또한 일부 벤치마크는 크게 상승했지만, 일부 지식 평가에서는 차이가 거의 없습니다.

새 모델의 개요는 Qwen 3.8-Max 설명, 이전 플래그십의 배경은 Qwen 3.7의 특징에서 확인할 수 있습니다.

아래 벤치마크는 공식 Qwen 3.8 출시 게시물의 Alibaba 자체 표를 기준으로 합니다. 독립 검증 결과는 아직 제한적이지만, 두 모델이 같은 벤더 실행 환경에서 평가됐으므로 두 모델 간 상대적 차이를 판단하는 자료로는 유용합니다. 코딩 관련 항목 대부분은 Claude Code 하네스에서 실행됐으며, 일부는 Qwen 자체 벤치마크입니다.

요약

변경 사항 Qwen 3.7-Max Qwen 3.8-Max
Terminal Bench 2.1 74.5 86.6
SWE-bench Pro 60.6 67.7
PaperBench 64.8 93.0
IFBench 79.1 82.8
GPQA Diamond 92.4 92.6
HLE 41.4 43.6
정가(100만 토큰당) $2.5 입력 / $7.5 출력 $2 입력 / $6 출력
현재 가격(할인) $1.25 입력 / $3.75 출력 $2 입력 / $6 출력
이미지 입력 아니요
공개된 아키텍처 미공개 총 2.4조, 활성 MoE 950억
개방형 가중치 미출시 “다음 주”(~8월 10일) 약속됨
컨텍스트 창 100만 토큰 100만 토큰

벤치마크 차이: 실제 성능 향상 지점

핵심 개선은 모델이 계획하고, 도구를 실행하고, 결과를 수정하는 에이전트 작업과 장기 연구 작업에 집중돼 있습니다.

Qwen 3.8-Max 벤치마크 비교

Terminal Bench 2.1: 74.5 → 86.6

터미널 기반 에이전트 작업에서 12점 상승했습니다. Alibaba 표에서는 Claude Opus 4.8과 Fable 5가 각각 84.6점이며, Qwen 3.8-Max는 이 항목에서 두 모델보다 높습니다. GPT-5.6 Sol은 88.8점으로 앞섭니다.

업그레이드 우선순위가 높은 경우

  • 터미널 명령을 실행하는 코딩 에이전트
  • 여러 단계의 디버깅 및 수정 루프
  • 파일 탐색, 테스트 실행, 오류 수정이 이어지는 자동화 작업

SWE-bench Pro: 60.6 → 67.7

실제 소프트웨어 엔지니어링 작업에서 7점 상승했습니다. 의미 있는 향상이지만, 같은 표에서 Fable 5는 80.0점입니다. 따라서 이 수치는 선두 추월보다는 격차 축소에 가깝습니다.

실무 판단: SWE-bench Pro가 핵심 KPI라면, 업그레이드 전 실제 리포지토리 이슈와 테스트 세트로 평가해야 합니다.

PaperBench: 64.8 → 93.0

AI 연구 논문 재현 능력에서 28점 상승했습니다. 표에서 가장 큰 변화이며, Alibaba의 비교 대상 중에서도 가장 높은 결과입니다.

업그레이드 우선순위가 높은 경우

  • 논문 구현 및 재현
  • 긴 기술 문서 분석
  • 다단계 과학적 추론
  • 실험 계획과 결과 검증을 반복하는 연구 에이전트

IFBench: 79.1 → 82.8

지시 따르기 성능은 약 4점 향상됐습니다. 3.7-Max도 이미 강한 점수를 기록했으므로, 약점 보완보다는 기존 강점의 확장으로 볼 수 있습니다.

GPQA Diamond: 92.4 → 92.6

차이는 0.2점으로 사실상 변동이 없습니다. 대학원 수준 과학 QA가 주요 작업이라면, 품질만을 이유로 업그레이드할 근거는 약합니다.

HLE: 41.4 → 43.6

Humanity's Last Exam에서는 2점 상승했지만, 같은 표에서 Fable 5는 53.3점, GPT-5.6 Sol은 47.2점입니다. Qwen 3.8-Max가 여러 영역에서 격차를 좁혔지만, 가장 어려운 추론 평가에서는 여전히 차이가 있습니다.

벤치마크 기준 결론

작업 유형 권장 판단
터미널 에이전트 3.8-Max 우선 테스트
연구 재현·긴 기술 작업 3.8-Max 우선 테스트
이미지·스크린샷 처리 3.8-Max 필요
일반 QA·요약·채팅 3.7-Max 할인 유지 검토
GPQA 유사 지식 QA 품질상 업그레이드 이득 제한적
고난도 추론 평가 제3자 벤치마크 확인 권장

하네스와 자체 벤치마크 정보를 포함한 상세 비교는 Qwen 3.8 벤치마크 분석을 참고하세요.

아키텍처: Alibaba가 공개한 수치

Qwen 3.8-Max는 Qwen 3.5 아키텍처 기반의 MoE(Mixture of Experts) 모델입니다.

  • 총 매개변수: 2.4조
  • 순방향 패스당 활성 매개변수: 950억
  • 활성화 비율: 약 4%

즉, 총 2.4조 매개변수 전체가 모든 요청에서 계산되는 구조가 아니라, 요청당 약 950억 활성 매개변수를 기준으로 동작합니다. 서비스 비용과 용량 계획을 계산할 때 중요한 정보입니다.

반면 Alibaba는 Qwen 3.7-Max에 대해 매개변수 수, 활성화 비율, 전문가 구성 같은 비교 가능한 아키텍처 수치를 공개하지 않았습니다. 3.8-Max는 모델 스튜디오 모델 문서와 출시 게시물에서 이 정보를 제공하므로, 용량 및 비용 모델링의 불확실성이 줄었습니다.

개방형 가중치 모델과 비교하면 Kimi K3는 총 2.8조, 활성 1,040억 매개변수입니다. Qwen 3.8-Max는 두 수치 모두 더 작습니다.

멀티모달: 3.7-Max에는 없는 기능

Qwen 3.7-Max는 텍스트 모델입니다. Qwen 3.8-Max는 이미지 입력을 기본 지원합니다.

Alibaba의 멀티모달 표에서 언급된 주요 점수는 다음과 같습니다.

  • MathVision: 95.2
  • LogicVista: 91.9
  • OSWorld-Verified: 86.1

3.7-Max는 이미지를 처리하지 않으므로, 같은 표에 직접 비교 열이 없습니다.

이미지 입력이 필요한 경우

기존에는 별도의 비전 모델로 라우팅해야 했던 다음 작업을 3.8-Max에서 텍스트 요청과 같은 모델 ID로 처리할 수 있습니다.

  • 스크린샷 이해
  • 문서 이미지 분석
  • UI 자동화
  • 차트 및 표 추출

출시 게시물에는 긴 문서 및 비디오 이해도 시연되지만, 특정 입력 형식과 지원 범위는 실제 사용 전 API 문서에서 확인해야 합니다.

가격: 정가는 3.8-Max가 낮고, 현재 실가격은 3.7-Max가 낮음

Qwen 3.8-Max의 가격은 전체 100만 토큰 컨텍스트에 걸쳐 단일 티어입니다.

모델 입력 100만 토큰당 출력 100만 토큰당
Qwen 3.7-Max 정가 $2.5 $7.5
Qwen 3.7-Max 현재 프로모션 $1.25 $3.75
Qwen 3.8-Max $2 $6

정가만 비교하면 Qwen 3.8-Max는 이전 모델보다 20% 저렴합니다. 그러나 현재 3.7-Max의 50% 한정 프로모션을 적용하면 3.7-Max가 3.8-Max보다 약 38% 저렴합니다.

전체 요금은 공식 모델 스튜디오 가격 페이지에서 확인할 수 있습니다.

비용 계산 시 확인할 두 가지

  1. 프로모션 종료 가능성

Alibaba는 3.7-Max 할인을 한정 기간 프로모션으로 명시했지만 종료 날짜는 공개하지 않았습니다. 현재 할인 가격을 장기 예산 기준으로 사용하면 안 됩니다. 정가 기준 대체 모델은 3.7-Max가 아니라 $2 / $6의 3.8-Max입니다.

  1. 추론 토큰 비용

Qwen 3.8-Max는 기본적으로 reasoning_effort: xhigh를 사용하며, 추론 토큰은 출력 토큰으로 청구됩니다. 따라서 요청당 실제 비용은 표면적인 입력·출력 가격보다 높아질 수 있습니다.

비용, 캐시 경제성, 작업당 비용 산정은 Qwen 3.8 가격 가이드에서 확인할 수 있습니다.

Max 모델이 예산에 맞지 않는다면, qwen3.7-plus는 현재 $0.4 입력 / $1.6 출력(20% 할인 중)으로 비용 효율적인 대안입니다. Plus vs Max 비교도 함께 검토하세요.

개방형 가중치: Max 클래스 최초

기존 Qwen Max 클래스 모델은 개방형 가중치를 제공하지 않았습니다. Qwen 3.7-Max도 해당하지 않으며, Alibaba가 이를 제공할 것이라는 신호도 없었습니다.

Qwen 3.8-Max는 출시 게시물에서 Hugging Face와 ModelScope에 “다음 주”, 즉 약 8월 10일경 가중치를 제공하겠다고 약속했습니다.

이 글의 기준 시점인 2026년 8월 3일에는 아직 다운로드할 수 없습니다. 따라서 현재는 제공 완료가 아니라 공개 약속 단계로 취급해야 합니다.

실무적으로는 다음을 고려해야 합니다.

  • 2.4조 매개변수 모델의 자체 호스팅은 양자화 상태에서도 다중 노드 프로젝트가 될 수 있습니다.
  • 대부분의 팀에는 자체 운영보다 서드파티 호스팅 접근성과 가격 경쟁 효과가 더 현실적인 영향입니다.
  • 조달 또는 규정 준수 요구 사항상 개방형 가중치가 필수라면, 3.7-Max보다 3.8-Max가 더 적합한 후보입니다.

변하지 않은 것

컨텍스트 창: 둘 다 100만 토큰

두 모델 모두 100만 토큰 컨텍스트 창을 제공합니다. 긴 컨텍스트가 3.7-Max를 선택한 이유였다면, 3.8-Max로 전환해도 이 조건은 유지됩니다.

접근 경로: 모델 ID 교체가 기본

두 모델 모두 Alibaba Cloud Model Studio의 OpenAI 호환 엔드포인트를 통해 제공됩니다. 기본 전환은 모델 ID만 바꾸는 방식입니다.

{
  "model": "qwen3.7-max"
}
Enter fullscreen mode Exit fullscreen mode
{
  "model": "qwen3.8-max"
}
Enter fullscreen mode Exit fullscreen mode

3.8-Max는 추가로 Anthropic 호환 API 표면도 제공합니다. 해당 프로토콜을 지원하는 툴링을 사용한다면 Apidog 같은 클라이언트에서 함께 테스트할 수 있습니다.

추론 제어: 3.8-Max에서는 명시적으로 설정

3.8-Max는 다음 추론 관련 파라미터를 문서화해 지원합니다.

  • reasoning_effort
  • enable_thinking
  • preserve_thinking

reasoning_effort는 기본적으로 xhigh이며, 중간 및 낮은 수준도 제공합니다. 비용 또는 응답 시간을 관리해야 한다면 요청에 값을 명시적으로 설정해 테스트하세요.

{
  "model": "qwen3.8-max",
  "reasoning_effort": "xhigh",
  "messages": [
    {
      "role": "user",
      "content": "이 코드의 테스트 실패 원인을 분석해줘."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

업그레이드 판단: 세 가지 경로

1. 지금 3.8-Max로 업그레이드

다음 작업이 중심이라면 우선 전환 테스트를 권장합니다.

  • 터미널 기반 에이전트
  • 기술 작업 및 연구 재현
  • 다단계 과학적 추론
  • 스크린샷, UI, 문서 이미지 처리

Terminal Bench 2.1의 74.5 → 86.6, PaperBench의 64.8 → 93.0은 실제 워크플로에서 체감할 가능성이 큰 변화입니다. 이미지 입력과 더 낮은 정가도 추가 이점입니다.

2. 3.7-Max 프로모션 유지

다음과 같은 일반 텍스트 중심 작업이라면, 현재 할인 가격을 활용할 수 있습니다.

  • Q&A
  • 요약
  • 일반 채팅
  • 이미 품질 기준을 충족하는 기존 프롬프트 워크플로

GPQA Diamond는 0.2점 차이이므로, 유사한 지식 QA 작업에서는 품질상 전환 근거가 약합니다. 다만 프로모션 종료일은 공개되지 않았으므로, 매월 가격 상태를 확인하는 알림을 설정하는 편이 안전합니다.

3. qwen3.7-plus로 다운티어

가격 민감도가 높고 작업이 일상적이라면 qwen3.7-plus를 고려하세요.

  • 분류
  • 정보 추출
  • 템플릿 기반 콘텐츠 생성
  • 구조화된 변환 작업

$0.4 / $1.6의 qwen3.7-plus는 입력 기준으로 3.8-Max보다 5배 저렴합니다. Max 클래스의 에이전트 및 추론 성능이 필요하지 않은 요청에 플래그십 모델을 사용하는 것은 불필요한 비용일 수 있습니다.

결정 전에 전환을 테스트하세요

벤더 벤치마크는 상대 비교에는 유용하지만, 실제 프롬프트·도구 호출·응답 형식·지연 시간까지 예측하지는 못합니다. 가장 낮은 비용의 검증 방법은 동일한 실제 요청을 두 모델에 병렬 실행하는 것입니다.

다음 절차로 테스트할 수 있습니다.

  1. Model Studio OpenAI 호환 엔드포인트를 대상으로 컬렉션을 만듭니다.
  2. 모델 ID를 변수로 분리합니다.
  3. qwen3.7-maxqwen3.8-max 환경을 각각 만듭니다.
  4. 대표적인 프로덕션 프롬프트를 저장합니다.
  5. 두 환경에서 같은 요청을 실행합니다.
  6. 출력 품질, 응답 시간, 토큰 사용량, 실패율을 비교합니다.

예를 들어 모델 이름을 환경 변수로 분리하면 요청 본문을 재사용할 수 있습니다.

{
  "model": "{{qwen_model}}",
  "messages": [
    {
      "role": "user",
      "content": "{{prompt}}"
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

환경별 변수는 다음처럼 설정합니다.

# qwen-3.7-max 환경
qwen_model=qwen3.7-max
Enter fullscreen mode Exit fullscreen mode
# qwen-3.8-max 환경
qwen_model=qwen3.8-max
Enter fullscreen mode Exit fullscreen mode

Apidog에서는 하나의 컬렉션에 두 환경을 연결하고, 환경 전환만으로 동일 요청을 비교할 수 있습니다. 대표 요청을 테스트 시나리오로 저장해 두면 Alibaba의 모델 업데이트나 프로모션 가격 변경 시에도 같은 기준으로 다시 검증할 수 있습니다.

프로덕션 구성을 변경하기 전 Apidog를 무료로 다운로드하고 실제 트래픽 패턴으로 비교를 실행하세요.

자주 묻는 질문

Qwen 3.8-Max는 Qwen 3.7-Max보다 저렴합니까?

정가 기준으로는 그렇습니다. Qwen 3.8-Max는 100만 토큰당 입력 $2 / 출력 $6이며, Qwen 3.7-Max의 정가는 $2.5 / $7.5입니다.

현재 실가격 기준으로는 아닙니다. 3.7-Max의 한정 기간 50% 프로모션 가격은 $1.25 / $3.75이므로, 3.8-Max보다 약 38% 저렴합니다. 다만 종료일은 공개되지 않았습니다. 자세한 내용은 Qwen 3.8 가격 가이드를 참고하세요.

qwen3.7-max에서 qwen3.8-max로 전환하려면 코드를 변경해야 하나요?

기본 텍스트 사용 사례에서는 대체로 모델 ID 교체만 필요합니다. 두 모델은 동일한 OpenAI 호환 Model Studio 엔드포인트를 사용합니다.

다만 3.8-Max는 기본적으로 xhigh 추론 수준을 사용하고 추론 토큰이 출력으로 청구되므로, reasoning_effort를 명시적으로 설정해 비용과 지연 시간을 검증하는 것이 좋습니다. 이미지 입력은 3.8-Max 전용 기능이며 표준 이미지 입력 메시지 형식이 필요합니다.

Qwen 3.7-Max는 개방형 가중치를 제공합니까?

아니요. Alibaba의 이전 사례를 기준으로 향후 제공될 가능성도 낮습니다. Qwen 3.8-Max는 개방형 가중치를 약속한 최초의 Max 클래스 모델이며, 2026년 8월 10일경 Hugging Face와 ModelScope에서 공개될 예정입니다. 8월 3일 기준으로는 아직 다운로드할 수 없습니다.

Qwen 3.8-Max가 이제 Claude나 GPT보다 낫습니까?

평가 항목에 따라 다릅니다. 또한 여기서 언급한 수치는 Alibaba 자체 표 기준입니다.

Alibaba의 표에서 Qwen 3.8-Max는 Terminal Bench 2.1에서 Opus 4.8과 Fable 5보다 높고, PaperBench와 IFBench에서는 비교 대상 전체를 앞섭니다. 반면 SWE-bench Pro에서는 Fable 5보다 낮고(67.7 대 80.0), HLE에서도 최상위 모델보다 낮습니다.

독립적인 벤치마크 결과가 충분히 나오기 전까지는, 자신의 실제 작업 부하로 직접 평가한 결과를 최종 기준으로 삼는 것이 안전합니다.

Top comments (0)