대부분의 모델 출시는 코딩 능력을 비슷한 방식으로 설명합니다. HumanEval 점수와 이진 탐색 같은 짧은 코드 예시를 제시하는 방식입니다. 알리바바는 Qwen 3.8-Max에서 다른 주장을 합니다. 단순히 “좋은 함수를 작성한다”가 아니라, 몇 주 동안 소프트웨어 프로젝트를 스스로 운영하고, 이슈를 열고, PR을 병합하며, 사람 개입 없이 기능을 배포할 수 있다는 주장입니다.
이는 대담한 주장입니다. 따라서 이 글에서는 출시 시점에 알리바바가 공개한 세 가지 코딩 쇼케이스를 검토하고, 관련 벤치마크 수치와 함께 실제 개발 환경에서 qwen3.8-max를 사용하는 방법을 정리합니다. 대상 도구는 Claude Code, Codex, Qoder, Qwen Code, OpenClaw이며, 생성된 코드가 호출하는 API를 테스트하는 방법도 다룹니다.
모델 자체가 낯설다면 먼저 Qwen 3.8 개요를 확인하세요. 총 2.4T 매개변수, 활성 95B, 1M 토큰 컨텍스트 창, 출시 후 일주일 내 오픈 웨이트 제공 계획이 언급되어 있습니다. 이 글은 코딩 워크플로에 집중하며, 모든 내용은 2026년 8월 3일 기준입니다.
알리바바의 실제 주장
공식 Qwen 3.8 출시 게시물은 스니펫 생성보다 긴 작업의 자율성에 초점을 둡니다. 알리바바는 Qwen 3.8-Max를 다음과 같은 작업을 수행할 수 있는 모델로 포지셔닝합니다.
- 장기 엔지니어링 작업의 컨텍스트 유지
- 작업 계획 수립 및 며칠에 걸친 실행
- 실행 중 발생한 오류 복구
- 검토 가능한 결과물 생성
다음 세 가지 요소가 일반적인 출시일 마케팅과 차별화됩니다.
데모 실행 기간이 길다
16일 실행은 20분짜리 에이전트 벤치마크와 다릅니다. 이 규모에서는 오류 복구, 컨텍스트 관리, 작업 드리프트 방지가 중요합니다.하나의 데모 저장소가 공개되어 있다
커밋, 이슈, PR, 코드 품질을 직접 확인할 수 있습니다.경쟁사 하네스를 사용했다
알리바바는 대부분의 코딩 벤치마크를 Claude Code 하네스에서 실행했다고 밝혔고, 동일한 설정을 위한 공식 구성을 공개했습니다.
모든 수치는 알리바바의 출시 자료에서 가져온 것입니다. 2026년 8월 초 기준 독립 검증은 아직 없습니다. 아래 쇼케이스는 감사 결과가 아닌 벤더 데모로 해석해야 합니다.
세 가지 코딩 쇼케이스
oh-my-cli: 16일간의 자율 개발
가장 주목할 만한 데모입니다. 알리바바는 Qwen 3.8-Max에 명령줄 도구 구축 작업을 맡기고 무인 실행했다고 설명합니다.
2026년 7월 30일 기준 공개 수치는 다음과 같습니다.
- 실행 기간: 16일
- 커밋: 265개
- 풀 리퀘스트: 127개
- 이슈: 151개
저장소는 qwen-code-dev-bot/oh-my-cli에 공개되어 있습니다. 이 데모를 평가할 때는 숫자만 보지 말고 다음을 직접 확인하세요.
- PR이 연결된 이슈를 실제로 해결하는가?
- 이슈가 실질적인 버그나 기능 요청인가, 아니면 작업량을 부풀린 것인가?
- 모델이 만든 회귀(regression)를 이후 커밋에서 어떻게 처리하는가?
- 테스트와 문서 변경이 코드 변경과 함께 이루어지는가?
- PR 설명과 실제 변경 사항이 일치하는가?
장기 자율 실행의 신뢰성은 단일 벤치마크 점수보다 이러한 이력에서 더 잘 드러납니다.
논문 재현 실행: 앱 코드가 아닌 연구 코드
두 번째 데모는 머신러닝 논문 재현입니다. 알리바바의 설명에 따르면 이 실행은 다음 규모로 진행되었습니다.
- 실행 시간: 약 125시간
- 생성 코드: 약 7,600줄
- GPU 훈련 라운드: 33회
알리바바는 모델이 논문의 6가지 발견을 재현했으며, AIME24에서 논문에 보고된 결과보다 2.7점 높은 점수를 기록했다고 주장합니다.
연구 재현은 일반 애플리케이션 개발과 다른 난점이 있습니다.
- 환경 의존성 문제
- 문서에 명확히 적히지 않은 하이퍼파라미터
- 장시간 훈련 후에야 드러나는 작은 구현 오류
- 재현 불가능한 랜덤성 및 데이터 전처리 차이
이 데모는 아래에서 다룰 PaperBench 점수와 직접 연결됩니다.
톈츠 대회: 인간 팀과의 24시간 대결
세 번째 쇼케이스에서는 모델이 알리바바의 톈츠 플랫폼에서 24시간 제한의 데이터 과학 경쟁에 참여했습니다.
알리바바가 공개한 결과는 다음과 같습니다.
- 제출 횟수: 45회
- 최종 정확도: 0.853
- 비교 대상: 526개 인간 팀 중 458개 팀보다 높은 순위
중요한 점은 모델이 우승하지 않았다는 것입니다. 그러나 참가자의 약 87%를 앞섰으며, 제출 결과를 바탕으로 빠르게 반복하는 능력을 보여줍니다.
다만 톈츠는 알리바바의 자체 플랫폼입니다. 데모가 실제로 실행되었더라도, 벤더가 장소와 환경을 통제했다는 점은 고려해야 합니다.
데모 뒤의 코딩 벤치마크
알리바바는 출시 시점에 전체 벤치마크 표를 공개했습니다. 아래는 코딩과 직접 관련된 항목입니다. 모든 수치는 알리바바가 직접 실행한 결과입니다.
| 벤치마크 | Qwen 3.8-Max | 최고 경쟁자 (알리바바 표 기준) |
|---|---|---|
| Terminal Bench 2.1 | 86.6 | 88.8 (GPT-5.6 Sol) |
| SWE-bench Pro | 67.7 | 80.0 (Fable 5) |
| PaperBench | 93.0 | 90.5 (GPT-5.6 Sol) |
실무 관점에서는 다음처럼 해석할 수 있습니다.
Terminal Bench 2.1: 86.6
터미널 기반 에이전트 작업에서 Claude Opus 4.8 및 Fable 5(알리바바 표 기준 각각 84.6)보다 높습니다. 이는oh-my-cli같은 CLI 중심 장기 에이전트 작업을 뒷받침하는 수치입니다.SWE-bench Pro: 67.7
저장소 규모의 버그 수정에서는 선두 모델보다 크게 낮습니다. 같은 표에서 Fable 5는 80.0점입니다. 기존 코드베이스의 이슈를 해결하는 작업에서는 별도 검증과 코드 리뷰가 특히 필요합니다.PaperBench: 93.0
비교 세트에서 가장 높은 수치이며, 논문 재현 쇼케이스를 뒷받침합니다.
또 하나의 중요한 세부 사항이 있습니다. 알리바바는 경쟁 모델을 포함한 대부분의 코딩 벤치마크를 Claude Code 하네스에서 실행했다고 밝혔습니다. 또한 표의 각주는 Fable 5 결과에 폴백이 포함될 수 있다고 명시합니다.
에이전트 벤치마크는 하네스에 따라 결과가 크게 달라질 수 있습니다. 따라서 벤더가 특정 하네스에서 실행한 점수는 참고 데이터이지 최종 결론은 아닙니다.
오늘날 Qwen 3.8로 실제로 코딩하는 방법
Qwen 3.8-Max는 알리바바 클라우드 Model Studio에서 GA 상태이며, 출시 시점에 다섯 가지 코딩 도구용 공식 설정이 공개되었습니다.
시작 전에 DashScope API 키가 필요합니다.
- home.qwencloud.com에서 API 키를 준비합니다.
- 사용하는 도구에 맞는 엔드포인트와 환경 변수를 설정합니다.
- 작은 작업부터 실행해 응답 형식, 비용, 도구 호출 동작을 확인합니다.
- 장기 에이전트 실행 전에는 샌드박스와 모의 API 환경을 준비합니다.
가격은 공식 Model Studio 가격 페이지에 따르면 1M 컨텍스트 전체에서 다음과 같이 고정되어 있습니다.
- 입력 토큰 100만 개당 2달러
- 출력 토큰 100만 개당 6달러
Claude Code 설정
Qwen 3.8-Max는 Anthropic 호환 API 엔드포인트를 제공합니다. Claude Code에서 다음 환경 변수를 설정하세요.
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
설정 후 일반적인 방식으로 Claude Code를 실행하면 요청이 Claude 대신 Qwen 3.8-Max로 라우팅됩니다.
claude
알리바바가 이 하네스에서 대부분의 코딩 벤치마크를 실행했다고 밝혔기 때문에, 공개된 벤치마크 환경과 가장 가까운 구성을 원한다면 이 설정부터 시도할 수 있습니다.
Codex 설정
Codex에서는 공급자(provider) 항목을 구성합니다.
model = "qwen3.8-max"
model_provider = "qwencloud"
[model_providers.qwencloud]
name = "QwenCloud"
base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"
env_key = "DASHSCOPE_API_KEY"
context_window = 1000000
API 키를 환경 변수로 설정합니다.
export DASHSCOPE_API_KEY=your-dashscope-api-key
Claude Code 설정은 Anthropic 호환 엔드포인트를 사용하고, Codex 설정은 OpenAI 호환 엔드포인트를 사용합니다. 모델과 키는 같지만 프로토콜 형식이 다릅니다.
Qoder, Qwen Code, OpenClaw 설정
나머지 도구는 다음 기준으로 구성합니다.
Qoder CLI
알리바바의 에이전트 코딩 도구입니다. 모델 선택 메뉴 또는 구성에서qwen3.8-max를 선택합니다.Qwen Code
Qwen 팀의 오픈 소스 CLI입니다. API 키를 설정한 뒤 모델을 선택합니다.
export DASHSCOPE_API_KEY=your-dashscope-api-key
이전 Qwen 코딩 모델을 사용한 적이 있다면, 일반적으로 모델 ID만 변경하면 됩니다.
-
OpenClaw
공식 구성에서는 모델 ID와 함께
maxTokens를65536으로 설정합니다.
{
"model": "qwen3.8-max",
"maxTokens": 65536
}
도구별 최신 구성은 출시 게시물의 공식 문서를 우선 확인하세요. CLI와 SDK는 시간이 지남에 따라 설정 키나 공급자 이름이 바뀔 수 있습니다.
추론 노력 수준을 작업에 맞게 설정하기
Qwen 3.8-Max는 reasoning_effort에 다음 세 가지 값을 지원합니다.
-
xhigh— 기본값 mediumlow
코딩 작업에서는 이 설정이 비용과 응답 시간에 큰 영향을 줍니다.
| 작업 유형 | 권장 reasoning_effort
|
예시 |
|---|---|---|
| 장기 에이전트 작업 | xhigh |
다중 파일 리팩터링, 복잡한 디버깅, 작업 계획 |
| 일반 구현 작업 | medium |
단일 기능 구현, 테스트 추가, 코드 리뷰 |
| 기계적 편집 | low |
이름 변경, 독스트링 추가, 포맷 변환 |
예를 들어 단순 이름 변경 작업에 xhigh를 사용하면, 깊은 추론이 큰 가치를 제공하지 않는데도 출력 토큰 비용이 증가할 수 있습니다.
생각 토큰도 출력 토큰으로 청구되며, 출력은 100만 토큰당 6달러입니다. 기본값이 xhigh라는 점을 고려해 긴 에이전트 세션에는 별도 예산을 잡는 편이 안전합니다.
Qwen 3.8-Max가 작업에 과도하게 강력하다면, 전용 코딩 작업용 Qwen3 Coder 라인도 고려할 수 있습니다. 빠르고 저렴한 선택지로는 Qwen3 Coder Flash가 있습니다. 다른 오픈 웨이트 코딩 모델과 비교하려면 Kimi K3의 코딩 작업 처리 방식도 참고하세요.
모델이 구축한 것을 테스트하기: Apidog 단계
자율 코딩 데모에는 공통적인 간극이 있습니다. 모델은 API를 호출하는 코드를 만들지만, 그 호출이 실제 환경에서 올바른지 검증하는 과정은 종종 생략됩니다.
예를 들어 모델이 수천 줄의 코드를 생성하고 정상 컴파일에 성공하더라도, 다음 문제는 남아 있을 수 있습니다.
- 잘못된 엔드포인트 호출
- 인증 헤더 누락 또는 잘못된 형식
-
429 Too Many Requests처리 오류 - 잘못된 요청 본문 구조
- 프로덕션 환경에서만 발생하는 유효성 검사 실패
- 예상하지 못한 오류 응답 형식
1. 생성된 코드가 호출하는 엔드포인트를 직접 테스트하기
Qwen 3.8-Max가 API 클라이언트나 백엔드 서비스를 생성했다면, 관련 OpenAPI 사양을 Apidog으로 가져와 엔드포인트를 직접 검증하세요.
최소한 다음 항목을 테스트하는 것이 좋습니다.
- 인증 성공 및 인증 실패 시나리오
- 정상 요청과 최소 유효 요청
- 필수 필드 누락
- 잘못된 타입과 경계값
-
4xx,5xx,429오류 응답 - 재시도 및 타임아웃 처리
- 스트리밍 응답 처리
모델 API 자체를 평가 중이라면 Qwen 3.8 API 가이드에서 OpenAI 및 Anthropic 호환 프로토콜 설정을 확인할 수 있습니다. Apidog에서는 두 프로토콜의 요청과 응답을 나란히 검사하고, 스트리밍 응답 및 추론 델타도 확인할 수 있습니다.
2. 장기 에이전트 실행에는 모의 API 사용하기
에이전트 실행 시간이 길수록 프로덕션 API에 직접 연결하는 위험도 커집니다. 16일 동안 실행되는 자율 에이전트가 라이브 인프라에 요청을 보낸다면 다음 문제가 발생할 수 있습니다.
- 예상치 못한 비용 증가
- API 속도 제한 초과
- 테스트 데이터와 실제 데이터 혼합
- 외부 시스템 상태 변경
- 반복 요청으로 인한 중복 생성 또는 삭제
- 잘못된 자동화로 인한 데이터 변형
Apidog의 모의 서버를 사용하면 실제 시스템을 건드리지 않고도 에이전트에 현실적인 응답을 제공할 수 있습니다.
권장 워크플로는 다음과 같습니다.
- 실제 API 사양을 기준으로 모의 서버를 만듭니다.
- 에이전트가 사용하는 기본 URL을 모의 URL로 변경합니다.
- 성공, 유효성 오류, 인증 오류, 속도 제한 응답을 각각 준비합니다.
- 에이전트가 생성한 코드와 로그를 사람이 검토합니다.
- 검증이 끝난 후에만 실제 기본 URL로 전환합니다.
빠르게 모의 환경을 준비하려면 Apidog을 무료로 다운로드하세요.
핵심 패턴은 단순합니다. 코딩 모델에 더 많은 자율성을 부여할수록 API 계층은 더 중요한 제어 표면이 됩니다. 모든 커밋을 실시간으로 검토할 수는 없더라도, 에이전트가 통신할 수 있는 대상과 응답 형태는 통제할 수 있습니다.
자주 묻는 질문
Qwen 3.8은 코딩에 적합한가요?
알리바바의 자체 수치에 따르면, 에이전트 및 연구 중심 코딩 작업에는 강점을 보입니다.
- Terminal Bench 2.1: 86.6
- PaperBench: 93.0
- SWE-bench Pro: 67.7
다만 저장소 규모 버그 수정에서는 같은 표의 Fable 5가 80.0점으로 더 높습니다. 독립 검증은 아직 없으므로, 장기 자율 작업에 바로 적용하기보다 실제 코드베이스와 테스트 환경에서 먼저 평가하는 것이 좋습니다.
Claude Code에서 Qwen 3.8을 사용할 수 있나요?
네. 다음 세 환경 변수를 설정하면 됩니다.
export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=your-dashscope-api-key
export ANTHROPIC_MODEL=qwen3.8-max
알리바바는 이 설정을 직접 공개했으며, 대부분의 코딩 벤치마크도 Claude Code 하네스에서 실행했다고 밝혔습니다.
Qwen 3.8로 코딩하는 데 비용은 얼마나 드나요?
공개 가격 기준으로 1M 컨텍스트 전체에서 다음과 같습니다.
- 입력 토큰 100만 개당 2달러
- 출력 토큰 100만 개당 6달러
생각 토큰은 출력 토큰으로 청구됩니다. 기본값인 xhigh 추론 노력은 긴 에이전트 실행에서 많은 토큰을 생성할 수 있으므로, 짧은 대화형 사용보다 더 큰 비용 여유를 두는 것이 좋습니다.
비용 계산과 벤치마크 비교는 Qwen 3.8 벤치마크 분석에서 확인할 수 있습니다.
16일간의 oh-my-cli 실행은 정말 자율적이었나요?
그것은 알리바바의 주장입니다. 다만 대부분의 벤더 데모와 달리 결과 저장소가 공개되어 있습니다. qwen-code-dev-bot/oh-my-cli에서 커밋, PR, 이슈를 직접 확인할 수 있습니다.
2026년 7월 30일 기준으로 공개된 수치는 265개 커밋, 127개 PR, 151개 이슈입니다. 이 결과물이 “자율 개발”이라는 프레임을 정당화하는지는 저장소 이력을 읽고 코드 품질과 수정 패턴을 검토해 판단하는 것이 가장 정확합니다.



Top comments (0)