DEV Community

Cover image for Qwen 3.8 요금제 설명: 1M 컨텍스트 기준 입력 $2 / 출력 $6
Rihpig
Rihpig

Posted on • Originally published at apidog.com

Qwen 3.8 요금제 설명: 1M 컨텍스트 기준 입력 $2 / 출력 $6

알리바바는 2026년 8월 초에 Qwen 3.8-Max를 출시했고, 가격 책정에 대한 공식 답도 나왔습니다. 7월 미리 보기 기간에 언급된 “10% 미리 보기 가격” 프로모션은 종료되었습니다. 정식 출시 시점의 공식 Model Studio 가격 페이지에는 qwen3.8-max입력 100만 토큰당 $2, 출력 100만 토큰당 $6으로 표시됩니다. 컨텍스트 창 전체인 100만 토큰에 단일 고정 계층이 적용됩니다.

지금 Apidog를 사용해 보세요

이 고정 계층이 핵심입니다. 많은 최첨단 모델은 프롬프트가 특정 컨텍스트 길이를 넘으면 토큰당 요금을 올립니다. Qwen 3.8-Max는 5,000토큰을 보내든 900,000토큰을 보내든 입력 $2/출력 $6 요금을 유지합니다.

이 글에서는 고정 계층 구조, Qwen 3.7-Max·Kimi K3·Claude Opus 5·GPT-5.6 Terra와의 가격 비교, 캐싱 할인, 무료 할당량, 그리고 실제 비용 계산 방법을 다룹니다. 모델 자체의 개요는 Qwen 3.8이 무엇이며 왜 중요한지에서 먼저 확인할 수 있습니다.

정가만으로는 비용을 정확히 예측할 수 없습니다. Qwen 3.8-Max는 기본적으로 xhigh 추론 수준을 사용하며, 사고 토큰은 출력 토큰으로 청구됩니다. 따라서 실제 요청을 보내고 토큰 사용량을 측정해야 합니다. Apidog에서는 테스트 응답의 토큰 사용량을 확인할 수 있어, 예상 비용을 실제 사용량 기반으로 계산할 수 있습니다.

정식 출시(GA) 가격: 입력 $2, 출력 $6, 단일 계층

2026년 8월 3일 기준으로 Model Studio 가격 페이지에서 확인되는 qwen3.8-max 요금은 다음과 같습니다.

항목 가격(100만 토큰당)
입력 $2.00
출력(사고 토큰 포함) $6.00
캐시된 입력(캐시 적중) 입력 요금의 10%
명시적 캐시 생성 입력 요금의 125%
컨텍스트 계층 단일 계층, 0~100만 토큰
사고 토큰과 비사고 토큰 동일한 단가로 청구

구현 시 확인할 핵심 사항은 세 가지입니다.

  1. 긴 프롬프트 할증료가 없습니다. 100만 토큰 컨텍스트 창 전체가 단일 계층으로 처리됩니다.
  2. 사고 토큰은 출력으로 청구됩니다. reasoning_effort가 높을수록 출력 비용이 커질 수 있습니다.
  3. 요청당 최대 출력은 65,536토큰입니다. 최대 출력만 계산하면 요청 하나당 약 $0.39까지 발생할 수 있습니다.

공식 Qwen 3.8 발표에 따르면 이 모델은 총 2.4조 파라미터 중 950억 개 활성 파라미터, 100만 토큰 컨텍스트 창, 멀티모달 입력을 제공합니다.

100만 토큰에 걸친 고정 요금제가 이례적인 이유

컨텍스트 길이에 따라 가격을 나누는 방식은 일반적입니다. 짧은 컨텍스트에는 낮은 단가를 적용하고, 임계값을 넘는 긴 컨텍스트에는 더 높은 단가를 적용합니다.

알리바바의 다른 모델도 이 패턴을 따릅니다. 같은 Model Studio 가격 페이지에서 qwen3-max, qwen3-coder-plus 등은 컨텍스트 길이 계층에 따라 토큰당 가격이 올라갑니다. 반면 Qwen 3.8-Max는 0<토큰≤1M 단일 행으로 표시됩니다.

이 차이는 장문 컨텍스트 워크로드에서 중요합니다.

  • 대규모 문서 분석
  • 전체 코드베이스를 넣는 에이전트
  • 긴 검색 결과를 결합하는 RAG 파이프라인
  • 반복적으로 긴 시스템 프롬프트를 전송하는 도구 호출

계층형 모델에서는 30만~80만 토큰 요청이 더 비싼 요금 구간으로 진입할 수 있습니다. Qwen 3.8-Max에서는 비용이 선형적입니다.

총 비용 = (입력 토큰 / 1,000,000 × $2)
        + (출력 토큰 / 1,000,000 × $6)
Enter fullscreen mode Exit fullscreen mode

정가 기준으로 Qwen 3.7-Max보다 저렴함

Qwen 3.8-Max는 이전 플래그십의 정가보다 낮은 가격으로 출시되었습니다.

  • Qwen 3.7-Max 정가: 입력 $2.5 / 출력 $7.5
  • Qwen 3.8-Max: 입력 $2 / 출력 $6

입력과 출력 모두 정가 기준 20% 낮습니다. 동시에 더 큰 컨텍스트 창, 멀티모달 입력, 개선된 벤치마크 점수를 제공합니다.

다만 Qwen 3.7-Max에는 현재 50% 할인 프로모션이 적용되어 $1.25/$3.75까지 내려갈 수 있습니다. Qwen 3.8의 100만 토큰 컨텍스트, 멀티모달 입력, 에이전트 개선 기능이 필요하지 않다면 프로모션 기간에는 Qwen 3.7-Max가 더 저렴할 수 있습니다.

프로모션 가격을 장기 비용 모델의 기준으로 삼지는 않는 편이 좋습니다. 예산 작업에는 Qwen 3.7-Plus도 선택지입니다. 이 모델은 자체 20% 프로모션과 함께 $0.4/$1.6 가격대에 있습니다.

솔직한 섹션: 사고 토큰은 출력으로 청구됩니다

Qwen 3.8-Max는 reasoning_effort 매개변수로 다음 수준을 지원합니다.

  • xhigh
  • medium
  • low

기본값은 가장 적극적인 xhigh입니다. 사고 모드에서는 모델이 최종 답변 전에 내부 추론 토큰을 생성하며, 이 토큰도 출력 토큰과 동일하게 100만 토큰당 $6로 청구됩니다.

즉, 화면에 800토큰의 답변만 보여도 실제로는 수천 개의 사고 토큰이 사용되었을 수 있습니다.

실무에서는 작업 유형별로 추론 수준을 분리하세요.

작업 유형 권장 접근
분류, 추출, 포맷 변환 medium 또는 low 테스트
단순 요약, 정형 응답 생성 medium 또는 low 테스트
복잡한 분석, 다단계 문제 해결 xhigh 사용량 측정 후 적용
비용 민감한 대량 처리 실제 usage 데이터를 기준으로 제한 설정

특히 출력은 입력보다 3배 비싸고, 사고 토큰도 출력으로 집계됩니다. 비용 최적화에서는 입력 길이뿐 아니라 출력·추론 토큰을 함께 추적해야 합니다.

컨텍스트 캐싱: 적중 시 10%, 생성 시 125%

동일한 프롬프트 접두사를 반복적으로 전송한다면 컨텍스트 캐싱이 비용 구조를 바꿉니다. 대표적인 대상은 다음과 같습니다.

  • 긴 시스템 프롬프트
  • 안정적인 제품 문서
  • 도구 정의와 JSON 스키마
  • 반복되는 정책 또는 가이드라인
  • 자주 참조하는 코드 컨텍스트

가격은 다음과 같습니다.

  • 캐시 적중: 일반 입력 요금의 10%, 즉 100만 토큰당 $0.20
  • 명시적 캐시 생성: 일반 입력 요금의 125%, 즉 100만 토큰당 $2.50

캐시 생성에는 일반 입력보다 25% 높은 일회성 비용이 들지만, 이후 캐시 적중마다 입력 비용의 90%를 절약합니다. 접두사를 두 번 이상 재사용하면 캐싱의 경제성이 빠르게 좋아집니다.

무료 할당량 세부 정보: 100만 토큰, 싱가포르, 90일

Model Studio는 qwen3.8-max에 무료 할당량을 제공합니다. 평가 환경을 구성할 때 다음 조건을 확인하세요.

  • 크기: 100만 토큰
  • 지역: 싱가포르만 해당
  • 엔드포인트: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
  • 기간: 활성화일로부터 90일

이 할당량은 베이징 또는 미국 버지니아 리전에는 적용되지 않습니다. 또한 사고 토큰도 출력 토큰처럼 할당량을 소진합니다. xhigh에서 어려운 추론 작업을 반복하면 예상보다 빠르게 무료 토큰이 줄어들 수 있습니다.

무료 접근 경로를 비교하려면 Qwen 3.8을 무료로 사용하는 방법을 참고하세요.

Qwen 3.8 가격 비교

다음 표는 100만 토큰당 정가 기준입니다. 프로모션 가격은 기간이 제한되므로 별도로 표시했습니다.

모델 입력 출력 참고 사항
Qwen 3.8-Max $2.00 $6.00 100만 컨텍스트 전체 고정, 캐시 적중 10%
Qwen 3.7-Max $2.50 $7.50 현재 50% 할인: $1.25/$3.75
Qwen 3.7-Plus $0.40 $1.60 현재 20% 할인
Kimi K3 $3.00 $15.00 캐시 적중 $0.30
Claude Opus 5 $5.00 $25.00
GPT-5.6 Terra $2.00 $12.00

비교 시 다음을 확인하세요.

  • Kimi K3 대비: Qwen 3.8-Max는 입력이 3분의 1 더 저렴하고, 출력은 60% 더 저렴합니다. 캐시 적중 가격도 Qwen은 $0.20, K3는 $0.30입니다. K3 API 구현은 Kimi K3 API 가이드에서 확인할 수 있습니다.
  • Claude Opus 5 대비: 입력은 60%, 출력은 76% 더 저렴합니다.
  • GPT-5.6 Terra 대비: 입력 가격은 동일하게 $2이지만, Qwen의 출력은 절반 가격입니다.

가격만으로 품질을 판단할 수는 없습니다. 하지만 요금표만 비교하면 Qwen 3.8-Max는 이 라인업에서 가장 낮은 비용의 최첨단 플래그십 모델입니다.

작업 예시: 실제 작업 비용은 얼마인가

예시 1: 5만 토큰 에이전트 세션

에이전트 실행이 다음 토큰을 사용한다고 가정합니다.

  • 입력: 38,000토큰
  • 출력: 12,000토큰

계산은 다음과 같습니다.

입력: 38,000 × $2 / 1,000,000 = $0.076
출력: 12,000 × $6 / 1,000,000 = $0.072
총액: 약 $0.15
Enter fullscreen mode Exit fullscreen mode

여기에 xhigh 추론으로 사고 토큰 8,000개가 추가되면 출력은 총 20,000토큰이 됩니다.

출력: 20,000 × $6 / 1,000,000 = $0.12
입력 포함 총액: 약 $0.20
Enter fullscreen mode Exit fullscreen mode

사고 토큰만으로 세션 비용이 약 33% 증가합니다.

예시 2: 80만 토큰 장문 문서 분석

800,000토큰 문서를 컨텍스트에 넣고, 5,000토큰의 구조화된 요약을 생성한다고 가정합니다.

입력: 800,000 × $2 / 1,000,000 = $1.60
출력: 5,000 × $6 / 1,000,000 = $0.03
총액: 약 $1.63
Enter fullscreen mode Exit fullscreen mode

이 요청은 긴 컨텍스트를 사용하지만, 80만 토큰 전체에 같은 입력 단가가 적용됩니다.

예시 3: 캐시된 10만 토큰 시스템 프롬프트를 하루 50회 호출

애플리케이션이 시스템 프롬프트, 제품 문서, 도구 정의를 포함한 100,000토큰 접두사를 하루 50회 사용한다고 가정합니다.

캐싱을 사용하지 않으면 다음과 같습니다.

100,000 × $2 / 1,000,000 = 호출당 $0.20
$0.20 × 50회 = 하루 $10.00
Enter fullscreen mode Exit fullscreen mode

명시적 캐시를 사용하면 다음과 같습니다.

캐시 생성:
100,000 × $2.50 / 1,000,000 = $0.25

49회 캐시 적중:
100,000 × $0.20 / 1,000,000 × 49 = $0.98

일일 총액:
$0.25 + $0.98 = 약 $1.23
Enter fullscreen mode Exit fullscreen mode

이 경우 접두사 입력 비용만 기준으로 약 88%를 절약합니다.

측정된 사용량으로 비용 추정하기

앞의 계산은 가정된 토큰 수를 사용합니다. 실제 비용은 프롬프트 구성, 모델 응답 길이, 사고 토큰 수에 따라 달라집니다. 특히 추론 토큰은 프롬프트 길이만으로 예측하기 어렵습니다.

권장 워크플로우는 다음과 같습니다.

  1. 작업 유형을 분류합니다.
    • 분류
    • 문서 요약
    • 코드 생성
    • 에이전트 실행
    • RAG 질의
  2. 작업 유형마다 대표 요청 10개를 준비합니다.
  3. low, medium, xhigh에서 동일 요청을 실행합니다.
  4. 각 응답의 usage 객체에서 입력·출력·추론 토큰을 기록합니다.
  5. 평균 토큰 사용량에 $2/$6을 곱해 작업별 비용을 계산합니다.
  6. 품질이 유지되는 범위에서 더 낮은 reasoning_effort를 선택합니다.

간단한 비용 계산 코드는 다음처럼 작성할 수 있습니다.

def estimate_cost(input_tokens: int, output_tokens: int) -> float:
    input_cost = input_tokens / 1_000_000 * 2
    output_cost = output_tokens / 1_000_000 * 6
    return input_cost + output_cost

cost = estimate_cost(
    input_tokens=38_000,
    output_tokens=20_000,  # 보이는 출력 + 사고 토큰
)

print(f"예상 비용: ${cost:.4f}")
Enter fullscreen mode Exit fullscreen mode

엔드포인트 설정, 리전별 기본 URL, OpenAI 호환 및 Anthropic 호환 프로토콜은 Qwen 3.8 API 가이드에서 확인할 수 있습니다.

Apidog에서는 리전별 기본 URL을 환경 변수로 저장하고, 각 reasoning_effort 수준에서 동일한 요청을 실행할 수 있습니다. 응답 검사기에서 토큰 사용량을 비교하고, 같은 프롬프트를 qwen3.7-max 또는 Kimi K3에 보내 A/B 테스트하면 비용과 결과 품질을 함께 검증할 수 있습니다.

Apidog를 무료로 다운로드하면 실제 작업별 토큰 사용량과 비용 추정치를 빠르게 만들 수 있습니다.

결론

Qwen 3.8-Max의 $2/$6 가격은 최첨단 플래그십 모델 기준으로 공격적입니다.

  • Qwen 3.7-Max 정가보다 낮음
  • GPT-5.6 Terra 출력 가격의 절반
  • Claude Opus 5보다 낮은 입력·출력 비용
  • 전체 100만 토큰 컨텍스트에 단일 고정 계층 적용
  • 캐시 적중 입력은 일반 입력 가격의 10%

다만 기본 xhigh 추론은 출력 비용을 높일 수 있으며, Qwen 3.7-Max 할인과 싱가포르 무료 할당량은 기간 제한 조건을 가질 수 있습니다.

프로덕션 적용 전에는 실제 워크로드를 기준으로 토큰을 측정하고, 작업별로 reasoning_effort를 조정하며, 반복 프롬프트에는 캐싱을 적용하세요. 그러면 정가표와 실제 청구서 사이의 차이를 크게 줄일 수 있습니다.

자주 묻는 질문

Qwen 3.8은 긴 프롬프트에 더 많은 비용이 드나요?

아니요. 공식 가격은 0~100만 토큰을 하나의 계층으로 나열합니다. 따라서 90만 토큰 프롬프트도 짧은 프롬프트와 같은 입력 100만 토큰당 $2 요금이 적용됩니다.

이는 Model Studio 모델 목록의 일부 모델처럼 컨텍스트 길이에 따라 가격이 올라가는 계층형 모델과 다릅니다.

Qwen 3.8에서 사고 토큰에 추가 비용이 드나요?

별도의 사고 토큰 요금은 없습니다. 사고 모드와 비사고 모드 모두 입력 $2, 출력 $6 요금이 적용됩니다.

다만 사고 토큰은 출력 토큰으로 계산됩니다. reasoning_effort 기본값이 xhigh이므로, 추론이 많은 요청은 보이는 답변 길이보다 실제 비용이 더 높을 수 있습니다. 간단한 작업에서는 medium 또는 low를 테스트하고, 응답의 usage 객체로 실제 토큰 사용량을 확인하세요.

Qwen 3.8을 무료로 사용해 볼 수 있는 방법이 있나요?

네. Model Studio는 싱가포르 리전 엔드포인트에서만 사용할 수 있고 90일 동안 유효한 100만 토큰 무료 할당량을 제공합니다. Qwen Chat도 브라우저에서 무료 접근을 제공합니다.

두 경로의 조건과 설정 방법은 Qwen 3.8을 무료로 사용하는 방법에서 확인할 수 있습니다.

이전의 “10% 미리 보기 가격”이 아직 유효한가요?

아니요. 이는 2026년 7월 언론 보도에서 언급된 미리 보기 기간 프로모션이었습니다. 정식 출시 후 표준 $2/$6 요금표로 대체되었습니다. 현재 가격 확인에는 Model Studio 가격 페이지를 기준으로 사용하세요.

Top comments (0)