DEV Community

Cover image for GLM-5.3-Flash 로컬 실행 방법
Rihpig
Rihpig

Posted on Originally published at apidog.com

GLM-5.3-Flash 로컬 실행 방법

GLM-5.3-Flash는 MIT 라이선스로 출시된 3,200억 개의 매개변수 모델입니다. 라이선스는 자유로운 실행과 재배포를 허용하지만, 모델 크기는 상당한 하드웨어 요구 사항을 뜻합니다.

지금 Apidog를 사용해 보세요

다만 토큰당 활성화되는 매개변수는 180억 개뿐이며, 양자화 빌드도 제공됩니다. 따라서 대부분의 가이드가 전제하는 8x H200 환경뿐 아니라, 양자화와 CPU 오프로드를 활용한 더 작은 환경에서도 실행할 수 있습니다.

이 글에서는 풀 정밀도 프로덕션 배포부터 워크스테이션용 양자화 빌드까지, 필요한 하드웨어와 자체 호스팅이 적합한 상황을 정리합니다.

실제로 로드하는 것

속성
총 매개변수 320B
리드 선형 및 희소 어텐션
컨텍스트 1,048,576 토큰
라이선스 MIT
가중치 zai-org/GLM-5.3-Flash
GGUF 양자화 unsloth/GLM-5.3-Flash-GGUF

전문가 혼합(MoE) 구조에서는 320B 전체 가중치가 메모리에 상주해야 하지만, 각 토큰에서 실제 연산에 참여하는 매개변수는 18B입니다. 즉, 주요 제약은 FLOPs보다 메모리 용량입니다.

Z.ai는 GLM-5.3 대비 약 4.4배 작은 KV 캐시도 보고했습니다. 긴 컨텍스트 작업에서는 KV 캐시가 컨텍스트 길이와 함께 증가하므로, 이 차이가 매우 중요합니다.

계층 1: 프로덕션 노드에서 풀 정밀도

전체 품질과 실제 동시성을 목표로 한다면 기준 구성은 8x H200 노드입니다. GPU당 141GB, 총 약 1,128GB의 메모리를 제공합니다. 8x H20 노드도 사용할 수 있습니다.

가중치만 정밀도에 따라 약 700~800GB가 필요하며, KV 캐시와 런타임 오버헤드를 위한 여유 공간도 확보해야 합니다. 이런 클라우드 노드의 임대 비용은 하루 약 $24~$48 수준입니다.

vLLM

vLLM은 폭넓은 생태계 지원을 제공하는 일반적인 선택입니다. 텐서 병렬 크기는 2의 거듭제곱으로 설정합니다.

vllm serve zai-org/GLM-5.3-Flash \
  --tensor-parallel-size 8 \
  --max-model-len 1048576 \
  --trust-remote-code
Enter fullscreen mode Exit fullscreen mode

처음에는 더 작은 --max-model-len으로 시작하세요. 시작과 동시에 100만 토큰 컨텍스트를 요청하면 KV 캐시가 대량 할당되므로, 구성 오류가 아닌 메모리 부족 오류처럼 실패할 수 있습니다.

SGLang

SGLang은 출시 첫날부터 이 모델을 지원했으며 H100, H200, B200, B300, GB200, GB300용 레시피와 다중 모달 서빙 구성을 제공합니다. Z.ai는 사전 출시 서빙에 SGLang 기반 스택을 사용했습니다.

python -m sglang.launch_server \
  --model-path zai-org/GLM-5.3-Flash \
  --tp 8 \
  --context-length 1048576
Enter fullscreen mode Exit fullscreen mode

SGLang은 구조화된 출력과 고동시성 에이전트 워크로드에서 강점이 있습니다. 채팅 UI 대신 코딩 에이전트를 제공한다면 vLLM만 기본값으로 삼기보다 두 런타임을 모두 벤치마킹하세요.

두 런타임 모두 함수 호출을 사용하려면 도구 호출 파서를 설정해야 합니다. 파서 이름은 릴리스마다 달라질 수 있으므로, 배포 전 각 프로젝트의 최신 문서를 확인하세요.

계층 2: 더 작은 하드웨어에서 양자화

unsloth/GLM-5.3-Flash-GGUF는 IQ1_S, IQ2_XXS 등 공격적인 1비트·2비트 양자화 형식까지 제공합니다. 320B 모델을 2비트 수준으로 양자화하면 고용량 RAM 워크스테이션이나 다중 소비자 GPU 시스템에서도 CPU 오프로드와 함께 가중치를 다룰 수 있는 범위가 됩니다.

다만 다음 두 가지를 전제로 해야 합니다.

  • 공격적인 양자화는 품질을 낮춥니다. IQ1_S는 풀 정밀도 품질과 차이가 큽니다. MoE 모델은 밀집 모델보다 저하가 완만할 수 있지만, “실행된다”와 “업무에 충분히 잘 실행된다”는 다릅니다. 반드시 실제 작업으로 검증하세요.
  • Unsloth 문서는 아직 작업 중일 수 있습니다. 지원되는 양자화 형식과 권장 설정은 변경될 수 있으므로, 특정 형식을 기준으로 인프라를 설계하기 전에 실제 게시 상태를 확인하세요.

CPU 중심 또는 하이브리드 환경에서는 KTransformers가 적합합니다. MoE 전문가를 시스템 RAM에 유지하고 필요한 부분만 GPU로 이동시키므로, 토큰당 18B만 활성화되는 이 모델과 잘 맞습니다. TokenSpeed도 지원 런타임 목록에 포함됩니다.

더 작은 모델의 실행 방식은 GLM-4.7-Flash 로컬 실행 가이드에서 확인할 수 있으며, 일반적인 로컬 GLM 구성은 GLM-5를 로컬에서 무료로 실행하기에서 다룹니다.

메모리 예산 계산

구성 가능 여부는 다음 두 수치로 판단할 수 있습니다.

가중치

BF16에서는 매개변수당 약 2바이트를 사용하므로, 320B 가중치는 오버헤드 전 약 640GB가 필요합니다.

  • FP8: 약 절반
  • 4비트 양자화: 약 160GB
  • 공격적인 2비트 양자화: 더 낮은 메모리 사용량, 더 큰 품질 손실

KV 캐시

KV 캐시는 컨텍스트 길이와 동시성에 비례해 증가합니다. 8K 컨텍스트에서 잘 동작하는 구성이 128K에서 실패하는 이유는 보통 가중치가 아니라 캐시 증가입니다.

Z.ai가 보고한 GLM-5.3 대비 4.4배 감소는 도움이 되지만, 캐시 사용량은 여전히 토큰 수에 대해 선형적으로 증가합니다.

따라서 최대 100만 토큰 창이 아니라 애플리케이션이 실제로 사용하는 컨텍스트 길이를 기준으로 배포 크기를 정하세요. 사용하지 않는 컨텍스트 창을 미리 프로비저닝하는 것은 비용을 불필요하게 키우는 가장 흔한 원인입니다.

이전 오픈 가중치 흐름을 따르고 있었다면 GLM-5.3 자체 호스팅 게시물도 참고할 수 있습니다. 이제 Flash 가중치가 MIT 라이선스로 공개되었으므로, 이 글의 배포 지침을 우선하세요.

미세 조정

MIT 라이선스는 미세 조정과 재배포를 허용합니다. 이 수준의 기능을 가진 모델에서는 드문 조건이며, 가중치를 직접 운영해야 하는 강력한 이유입니다.

하지만 320B 모델의 전체 미세 조정은 대부분의 팀에 현실적이지 않습니다. LoRA 같은 매개변수 효율적 방법이 실용적인 선택입니다.

MoE 모델에서는 추가로 다음을 결정해야 합니다.

  • 라우터를 조정할지
  • 특정 전문가를 조정할지
  • 어텐션 계층을 조정할지

이 영역은 밀집 모델보다 확립된 지침이 적은 연구 분야입니다.

새 기능 개발보다 도메인 적응이 목표라면, 먼저 기본 모델에서 프롬프팅과 검색(RAG)을 검증하세요. 100만 토큰 컨텍스트를 제공하는 모델에서는 도메인 지식을 프롬프트에 포함하는 편이 학습보다 저렴하고 효과적인 경우가 많습니다.

샘플링 설정

Z.ai는 작업별로 다음 설정을 권장합니다.

사용 사례 temperature top_p
일반 1.0 0.95
코딩 0.95 1.0

모델은 reasoning_effort로 세 가지 추론 모드도 지원합니다.

  • low
  • high
  • max

기본값은 max입니다. 로컬 하드웨어에서는 특히 중요합니다. API에서는 추론 토큰이 비용이지만, 자체 호스팅에서는 생성 시간이 됩니다. 장비가 느리다면 low 설정이 실용적인 응답 시간과 그렇지 않은 응답 시간의 차이를 만들 수 있습니다.

자체 호스팅이 경제적인가?

대부분의 경우 비용만으로는 그렇지 않습니다.

정가 기준 GLM-5.3-Flash는 입력 100만 토큰당 $0.15입니다. 월 약 $1,000의 8x H200 노드는 약 67억 입력 토큰의 API 사용량에 해당합니다. 이보다 높은 볼륨을 지속적으로 처리해야 자체 호스팅 비용이 유리해집니다.

또한 노드는 유휴 상태여도 비용이 발생하지만, API는 사용량에 따라 과금됩니다. 24시간 높은 활용률을 유지하지 못한다면 고정 비용이 불리합니다.

자체 호스팅의 주된 이유는 비용보다 다음과 같습니다.

  • 데이터 보존과 프라이버시: 데이터가 인프라 외부로 나가지 않습니다.
  • 속도 제한 없음: 운영 중인 용량을 직접 사용할 수 있습니다.
  • 가용성 제어: 공급업체의 가동 시간과 가격 정책에 덜 의존합니다.
  • MIT 라이선스: 수정, 미세 조정, 재배포가 가능합니다.
  • 기존 하드웨어 활용: 이미 GPU를 보유하고 있다면 한계 비용은 전기료에 가까워집니다.

API 비용 관점의 자세한 비교는 GLM-5.3-Flash 가격 분석에서 확인할 수 있습니다.

배포 검증

vLLM과 SGLang은 OpenAI 호환 엔드포인트를 제공합니다. 따라서 로컬 서버와 Z.ai에 동일한 요청 형식을 사용할 수 있습니다.

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "zai-org/GLM-5.3-Flash",
    "messages": [{"role": "user", "content": "reply with OK"}]
  }'
Enter fullscreen mode Exit fullscreen mode

단순 응답 확인을 넘어 다음 항목을 테스트하세요.

  • 실제 사용 길이에서의 긴 컨텍스트 동작
  • 다중 모달을 제공하는 경우 이미지 입력
  • 실제 스키마를 사용한 도구 호출
  • 단일 요청 지연 시간이 아닌 동시성 환경의 처리량

저장된 테스트 컬렉션이 특히 유용합니다. 환경 변수로 기본 URL을 전환해 Apidog를 로컬 서버와 Z.ai 엔드포인트에 각각 연결하고, 동일한 테스트 스위트를 실행해 결과를 비교하세요.

이렇게 하면 양자화 빌드가 애플리케이션이 의존하는 도구 스키마를 처리하는지 빠르게 확인할 수 있습니다. 이는 실제 프로덕션에서 자주 발견되는 실패 모드입니다.

자주 묻는 질문

최소 하드웨어는 무엇인가요?

풀 정밀도는 8x H200급 노드가 기준입니다. 양자화된 GGUF 빌드는 훨씬 적은 하드웨어에서 실행할 수 있지만, 양자화 수준에 따라 품질이 저하됩니다.

320B 매개변수 전부를 메모리에 로드해야 하나요?

네. 토큰당 18B만 활성화되지만 전체 가중치 세트는 메모리에 상주해야 합니다. 제약은 연산보다 메모리입니다.

vLLM과 SGLang 중 어느 것이 더 좋나요?

SGLang은 출시 첫날부터 다중 모달 레시피를 제공했고, 동시성과 구조화된 출력에서 강점을 보일 수 있습니다. vLLM은 더 넓은 생태계 지원을 제공합니다. 실제 워크로드에서 둘 다 벤치마킹하세요.

단일 GPU에서 실행할 수 있나요?

풀 정밀도로는 불가능합니다. KTransformers 기반의 공격적 양자화와 CPU 오프로드를 사용하면 고용량 RAM과 단일 GPU 환경에서도 가능할 수 있지만, 생성 속도는 느립니다.

라이선스는 정말 MIT인가요?

네. 가중치는 상업적 사용, 수정, 미세 조정, 재배포를 허용하는 MIT 라이선스로 게시됩니다.

Top comments (0)