Z.ai는 2026년 8월 26일 GLM-5.3-Flash를 출시했습니다. 이 모델은 3,200억 개의 매개변수를 가진 혼합 전문가(MoE) 모델로, 180억 개의 활성 매개변수를 사용하며 MIT 라이선스로 배포됩니다. 또한 별도 비전 어댑터가 아닌 네이티브 이미지 처리를 지원하는 GLM-5 계열의 첫 모델입니다.
이 모델은 출시 전 일주일 동안 ox-alpha라는 이름으로 익명 제공되어 많은 개발자가 정체를 모른 채 사용하기도 했습니다.
중요: 이름의 “Flash”는 저지연 스트리밍을 뜻하지 않습니다. GLM-5.3-Flash의 강점은 생성 속도가 아니라 비용, 메모리 효율, 네이티브 멀티모달 입력입니다.
TL;DR
- 출시: 2026년 8월 26일, Z.ai의 오픈 가중치 MIT 모델
- 규모: 320B 전체 파라미터 / 18B 활성 파라미터
- 입력: 텍스트, 이미지, 비디오, 파일
- 컨텍스트: 1,048,576토큰
- 가격: 입력 100만 토큰당 $0.15, 출력 100만 토큰당 $0.50 — GLM-5.2의 약 10분의 1
- 속도: 초당 약 48.7 출력 토큰, 첫 토큰 응답 시간 1.52초
-
모델 ID:
glm-5.3-flash - 제공 경로: Z.ai API, OpenRouter, Cloudflare Workers AI, Vercel AI Gateway 등
-
가중치: Hugging Face
zai-org/GLM-5.3-Flash
사양
| 속성 | 값 |
|---|---|
| 총 매개변수 | 320B |
| 활성 매개변수 | 18B |
| 아키텍처 | 혼합 전문가, 하이브리드 선형·희소 어텐션 |
| 라이선스 | MIT |
| 컨텍스트 윈도우 | 1,048,576 토큰 |
| 입력 모달리티 | 텍스트, 이미지, 비디오, 파일 |
| 출력 | 텍스트 |
| 추론 모드 |
low, high, max — 기본값 max
|
| API 모델 ID | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
최대 출력 토큰 수는 제공업체마다 다릅니다. OpenRouter는 131,072토큰, Hugging Face 모델 카드는 163,840토큰을 명시합니다. Z.ai는 확정 수치를 공개하지 않았으므로, 긴 단일 응답이 필요한 워크로드라면 실제 제공업체 제한을 먼저 확인해야 합니다.
핵심 변화: 네이티브 멀티모달리티
이전 GLM 비전 기능은 별도 모델 또는 별도 엔드포인트로 제공됐습니다. 예를 들어 Z.ai의 GLM-5V-Turbo와 GLM-4.6V는 독립적인 비전 모델입니다.
GLM-5.3-Flash는 이미지, 비디오, 파일을 텍스트와 동일한 채팅 요청의 콘텐츠 블록으로 처리합니다. 즉, 하나의 모델 ID와 하나의 컨텍스트 윈도우에서 다음을 함께 전달할 수 있습니다.
- 긴 사양 문서
- 렌더링된 UI 스크린샷
- 사용자 상호작용 피드백
- 코드 변경 요청
1M 토큰 컨텍스트와 네이티브 비전의 조합은 단순 이미지 캡션보다 코딩 에이전트, UI 검증, 문서 기반 구현 작업에 적합합니다.
기존 전용 비전 접근 방식은 GLM-5V-Turbo API 가이드, 문서 이해 사례는 문서 이해를 위한 GLM-OCR에서 확인할 수 있습니다.
아키텍처와 비용 효율
Z.ai는 GLM-5.2를 사후 훈련한 것이 아니라, 새 기본 모델 위에 GLM-5.3-Flash를 구축했다고 설명합니다.
하이브리드 어텐션
GLM-5.3-Flash는 선형 어텐션과 희소 어텐션을 함께 사용합니다.
- 선형 어텐션: 지역적 종속성을 저렴하게 처리
- 희소 어텐션: 전역적으로 관련 있는 토큰 선택
Z.ai 설명에 따르면 GLM-5.3 대비 어텐션 계산량은 약 3배 적고, KV 캐시는 약 4.4배 작습니다. KV 캐시 감소는 긴 컨텍스트 추론의 메모리 비용을 낮추며, 1M 토큰 윈도우를 유지하면서 낮은 가격을 제공하는 핵심 요인입니다.
다양체 제약 하이퍼-연결
Z.ai는 스케일링 효율성 기술로 “Manifold-Constrained Hyper-Connections”를 언급합니다. 다만 공개된 세부 정보가 충분하지 않으므로, 검증된 성능 이점이 아닌 공급업체 설명으로 보는 것이 적절합니다.
훈련에는 Z.ai가 약 30조 개의 멀티모달 토큰이라고 설명한 데이터가 사용됐습니다.
“Flash”지만 빠르지는 않습니다
Artificial Analysis 측정 기준 GLM-5.3-Flash는 초당 48.7 출력 토큰을 생성합니다. 더 큰 형제 모델인 GLM-5.3은 약 초당 86토큰입니다.
즉, GLM-5.3-Flash는 GLM-5.3보다 생성 처리량이 약 절반 수준입니다.
다만 첫 토큰 응답 시간은 1.52초로, 오픈 가중치 모델 중앙값인 2.14초보다 좋습니다. 따라서 짧은 상호작용이 반복되는 워크로드에는 적합할 수 있습니다.
정리하면:
- 선택해야 하는 이유: 낮은 토큰 비용, 작은 KV 캐시, 이미지·비디오·파일 입력
- 선택하면 안 되는 이유: 더 높은 스트리밍 처리량이 필요할 때
벤치마크
Z.ai가 공개한 출시 벤치마크는 제3자 재현 전까지 공급업체 주장으로 취급해야 합니다.
독립적인 Artificial Analysis 기준으로 GLM-5.3-Flash는 Intelligence Index v4.1.1에서 57점을 기록했습니다.
- GLM-5.3: 60점
- 유사 규모 오픈 가중치 모델 중앙값: 27점
- GLM-5.3-Flash: 57점
Z.ai는 코딩 및 에이전트 작업에서 Claude Opus 4.8에 근접한다고 설명하지만, 이는 내부 평가에 대한 공급업체의 주장입니다. 실제 선택 전에는 자체 워크로드로 비교해야 합니다.
평가 항목의 의미는 GLM-5.2 벤치마크 분석에서 자세히 확인할 수 있습니다.
Ox Alpha 주간
8월 20일, ox-alpha라는 익명 모델이 1M 토큰 컨텍스트와 무료 가격으로 제3자 추론 플랫폼에 등장했습니다. 며칠 안에 플랫폼에서 가장 많이 사용되는 모델 중 하나가 됐고, 커뮤니티는 출력 특성으로 Zhipu 계열 모델임을 추정했습니다.
8월 26일 Z.ai는 Ox Alpha가 GLM-5.3-Flash였으며, 무료 제공 기간은 의도적인 부하 테스트였다고 확인했습니다.
Z.ai는 당시 트래픽이 SGLang 기반 스택을 사용하는 중국 국내 가속기에서 제공됐고, 토큰당 서비스 비용이 주류 NVIDIA 하드웨어와 유사했다고 주장합니다. 이는 독립 검증되지 않은 인프라 관련 주장입니다.
비슷한 패턴은 Pony Alpha가 DeepSeek 또는 GLM 모델로 밝혀졌을 때도 나타났습니다. 비정상적으로 긴 컨텍스트를 가진 익명 모델은 종종 출시 전 평가 데이터를 수집하는 미공개 플래그십일 수 있습니다.
실제 사용 방법
1. Z.ai API 사용
Z.ai 엔드포인트는 OpenAI와 호환됩니다. 기존 클라이언트의 기본 URL과 모델 ID만 변경하면 됩니다.
Base URL: https://api.z.ai/api/paas/v4/
Model: glm-5.3-flash
인증, 이미지 입력 페이로드, reasoning-effort 설정은 GLM-5.3-Flash API 가이드에서 확인할 수 있습니다.
2. 제3자 제공업체 사용
OpenRouter에서는 다음 모델 ID로 제공합니다.
z-ai/glm-5.3-flash
Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten, io.net에서도 사용할 수 있습니다. 가격은 리셀러별로 다르므로 실제 비용을 비교해야 합니다.
3. 코딩 에이전트 플랜 사용
Flash는 GLM 코딩 플랜에 포함되며, GLM-5.3보다 약 세 배의 사용 가능 할당량을 제공한다고 알려졌습니다. Z.ai 문서에 따르면 비수기 호출은 표준 포인트의 절반을 소비합니다.
4. 자체 호스팅
가중치는 MIT 라이선스로 제공되며 Hugging Face에서 받을 수 있습니다. 다음 런타임이 지원합니다.
- vLLM
- SGLang
- TokenSpeed
- KTransformers
- 소형 장비용 GGUF 양자화
어떤 모델을 선택해야 할까요?
다음 조건이라면 GLM-5.3-Flash를 선택하세요.
- 텍스트와 함께 이미지, 비디오 또는 파일을 처리해야 한다.
- 토큰당 비용이 가장 중요한 제약 조건이다.
- 낮은 메모리 사용량이 중요하다.
- MIT 라이선스 오픈 가중치를 자체 호스팅하고 싶다.
다음 조건이라면 GLM-5.3을 선택하세요.
- 추론 품질의 마지막 몇 점이 중요하다.
- 생성 처리량이 비용보다 중요하다.
- 긴 응답을 더 빠르게 스트리밍해야 한다.
자세한 선택 기준은 GLM-5.3-Flash와 GLM-5.3 비교 및 GLM-5.3이란 무엇인가에서 확인할 수 있습니다.
두 모델은 OpenAI 호환 엔드포인트에서 모델 ID 한 줄만 바꾸면 비교할 수 있습니다. 벤치마크만 신뢰하기보다 실제 프롬프트, 응답 형식, 멀티모달 입력, 비용, 지연 시간을 기준으로 직접 테스트하세요.
Apidog를 사용하면 멀티모달 API 요청을 재사용 가능한 컬렉션으로 저장하고 응답 어설션을 추가할 수 있습니다. GLM-5.3에서 Flash로 전환할 때 응답 형식이 유지되는지 프로덕션 배포 전에 검증할 수 있습니다.
FAQ
GLM-5.3-Flash는 무료인가요?
아니요. 무료 Ox Alpha 기간은 공식 발표와 함께 종료됐습니다. 2026년 9월 9일까지는 50% 출시 할인이 적용되며, 이후 정가가 적용됩니다.
GLM-5.3보다 빠른가요?
아니요. GLM-5.3-Flash는 초당 약 49토큰, GLM-5.3은 초당 약 86토큰을 생성합니다. 다만 첫 토큰 응답 시간은 1.52초로 더 빠릅니다.
정말 100만 토큰 컨텍스트를 처리하나요?
모델 구성과 Artificial Analysis 기준 구성된 윈도우는 1,048,576토큰입니다. OpenRouter가 더 큰 수치를 표시하더라도, 장문 출력 제한은 실제 제공업체 설정을 확인해야 합니다.
비디오를 입력으로 받을 수 있나요?
Z.ai 문서에는 텍스트, 이미지, 비디오, 파일 입력이 명시돼 있습니다. 비디오 지원은 이미지보다 새롭고 사용 사례가 적으므로, 의존하기 전에 실제 미디어로 검증하세요.
가중치 라이선스는 무엇인가요?
MIT 라이선스이며, Hugging Face의 zai-org/GLM-5.3-Flash에서 제공됩니다.



Top comments (0)