국제적으로 Z.ai로 활동하는 중국 연구소 Zhipu AI는 2026년 8월 14일 GLM-5.3을 출시했습니다. Zhipu의 내부 평가에 따르면 GLM-5.2 대비 코딩 성능은 50% 향상됐고, Terminal-Bench 3.0 점수는 4.6에서 28.3으로 상승했습니다. BigGo의 출시 보고서에 따르면 Zhipu는 코딩 및 에이전트 기능이 “Claude Fable 5에 근접한다”고 설명합니다. 오픈 웨이트는 약 2주 후 공개될 예정입니다. 전체 기능 분석과 벤치마크 표는 GLM-5.3이란 무엇인가를 참고하십시오. 이 글에서는 GLM-5.3 API를 실제 애플리케이션에 연결하는 빠른 시작 과정을 다룹니다.
이 글에서는 API 키 발급, cURL 첫 호출, OpenAI SDK를 사용한 Python·Node.js 구현, 스트리밍, 주요 매개변수 조정, 그리고 애플리케이션 코드 작성 전에 Apidog에서 요청을 검증하는 방법을 다룹니다. Z.ai API는 OpenAI 호환 형식을 사용하므로, 기존 OpenAI 스타일 엔드포인트를 호출해 본 경험이 있다면 호스트와 모델 ID만 바꾸면 대부분의 코드를 재사용할 수 있습니다.
주의: GLM-5.3은 출시 직후 문서가 빠르게 갱신될 수 있습니다. 아래에서 문서로 확인된 정보와 GLM-5 제품군의 기존 명명 규칙을 기반으로 한 예상 정보를 구분해 설명합니다. 프로덕션에 하드코딩하기 전에는 항상 공식 문서를 다시 확인하십시오.
요약 (TL;DR)
- GLM-5.3은 2026년 8월 14일 출시되었습니다. Zhipu 내부 평가에서 GLM-5.2 대비 코딩 성능이 50% 향상됐으며, Terminal-Bench 3.0 점수는 4.6에서 28.3으로 상승했습니다. Terminal-Bench 3.0 및 Agents’ Last Exam에서 오픈소스 모델 중 1위를 차지했다고 발표했습니다.
- API는 OpenAI 호환입니다. 국제 엔드포인트는
POST https://api.z.ai/api/paas/v4/chat/completions이며,Authorization: Bearer $GLM_API_KEY헤더를 사용합니다. 중국 본토 엔드포인트는https://open.bigmodel.cn/api/paas/v4/chat/completions입니다. - 작성 시점의 GLM-5 문서에는 모델 ID로
glm-5가 표시되어 있었습니다. 가격 페이지에는glm-5.2,glm-5.1이 별도 모델로 등록되어 있으므로glm-5.3도 같은 점 표기 규칙을 따를 것으로 예상되지만, 사용 전 확인이 필요합니다. - 출시 시점에 Zhipu는 5.3 전용 API 가격을 공개하지 않았습니다. 공식 가격 페이지에는 참고값으로 GLM-5.2가 입력 100만 토큰당 $1.40, 출력 100만 토큰당 $4.40, GLM-5가 각각 $1.00 및 $3.20으로 표시되어 있었습니다.
- 오픈 웨이트는 2026년 8월 28일경 Hugging Face에 공개될 예정입니다.
- 먼저 Apidog에서 지역별 환경과 모델 변수를 구성하고, 프롬프트·스트리밍·추론 모드를 검증한 뒤 애플리케이션 코드로 옮기십시오.
GLM-5.3이 중요한 이유
기본 모델 아키텍처는 GLM-5 제품군과 동일합니다. 이번 릴리스의 향상은 GLM-5에 대한 확장된 후처리 학습에서 비롯됐다고 설명됩니다. Zhipu가 공개한 수치에 따르면 Terminal-Bench 3.0은 4.6에서 28.3으로 상승했으며, SWE-Marathon 점수도 GLM-5.2 대비 약 두 배 증가했습니다.
보안 평가에서는 CyberGym 84.5%를 기록해 Claude Mythos 5 및 GPT-5.6 Sol보다 약간 높았다고 발표했지만, ExploitBench는 54.4%로 최첨단 모델보다 낮았습니다. 50% 코딩 성능 향상 및 일부 벤치마크 점수는 Zhipu 자체 평가에서 나온 수치이므로, 독립적인 재현 결과가 나오기 전까지는 공급업체 발표로 해석해야 합니다.
Z.ai의 문서에 따르면 GLM-5 제품군은 총 7,440억 개 매개변수의 MoE(Mixture of Experts) 구조입니다. 순방향 통과마다 약 400억 개 매개변수가 활성화되며, 컨텍스트 창은 20만 토큰입니다. 이는 GLM-5 제품군 사양이며, 5.3에만 한정된 주장은 아닙니다.
API 사용 관점에서 확인할 핵심은 두 가지입니다.
- Pandaily의 출시 보도에 따르면 Zhipu는 출시 약 2주 후인 8월 28일경 오픈 웨이트와 위험 검토 시스템을 공개할 예정입니다. 자체 호스팅을 계획한다면 지금의 API 응답을 회귀 기준선으로 저장해 두십시오. 관련 전략은 GLM-5.3 자체 호스팅 준비 가이드에서 확인할 수 있습니다.
- Seeking Alpha는 Zhipu를 “중국 OpenAI 경쟁자”로 평가합니다. 이 수준의 기능을 가진 오픈 웨이트가 공개되면 모델 선택과 비용 구조에 영향을 줄 수 있습니다.
API 키 받기
플랫폼은 지역에 따라 나뉩니다. 엔드포인트, 청구, 지연 시간 및 규정 준수 요구사항이 달라질 수 있으므로 먼저 사용할 플랫폼을 정하십시오.
Z.ai: 국제 사용자
Z.ai에서 계정을 만들고 API 콘솔에서 키를 생성합니다.
중국 본토 외 지역에서 사용하는 기본 경로입니다.
Bigmodel.cn: 중국 본토 사용자
중국 본토에서는 open.bigmodel.cn을 사용합니다.
- 기본 엔드포인트:
https://open.bigmodel.cn/api/paas/v4 - 인증 및 요청 형식: 국제 API와 동일
- 청구 체계: 국제 플랫폼과 별도
키는 코드에 직접 넣지 말고 환경 변수로 주입하십시오.
export GLM_API_KEY="your-key-from-the-console"
종량제 API가 아니라 GLM 코딩 플랜을 사용 중이라면, 8월 14일에 모든 사용자의 할당량이 재설정됐다는 점도 확인하십시오.
엔드포인트 및 인증
작성 시점의 GLM-5 문서 기준 국제 채팅 완성 엔드포인트는 다음과 같습니다.
POST https://api.z.ai/api/paas/v4/chat/completions
중국 본토에서는 호스트만 변경합니다.
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
인증은 Bearer 토큰 헤더 하나로 처리합니다.
Authorization: Bearer $GLM_API_KEY
요청 및 응답은 OpenAI 채팅 완성 형식과 호환됩니다.
- 요청:
model,messages - 응답:
choices,message,finish_reason,usage - 스트리밍:
stream: true
즉, 공식 OpenAI SDK를 그대로 사용하면서 base_url만 Z.ai API 주소로 바꾸면 됩니다. 다른 OpenAI 호환 공급업체용 코드를 작성한 적이 있다면 호스트와 모델만 교체해 포팅할 수 있습니다. 이 접근 방식은 DeepSeek V4 Pro API 사용법과 동일합니다.
모델 ID 확인하기
출시 당일 문서에는 모델 문자열로 glm-5가 표시되어 있었고, 5.3 전용 표기가 아직 반영되지 않았습니다. 가격 페이지에 glm-5.2, glm-5.1이 별도 모델로 표기된 점을 고려하면 새 ID는 glm-5.3일 가능성이 높습니다.
아래 예제에서는 glm-5.3을 사용합니다. 단, 프로덕션 반영 전에는 반드시 공식 모델 문서에서 현재 ID를 확인하십시오. 해당 지역에서 glm-5.3이 404를 반환하면 같은 제품군의 glm-5를 사용해야 할 수 있습니다.
cURL로 첫 요청 보내기
먼저 최소 요청으로 인증, 엔드포인트, 모델 ID가 모두 올바른지 확인합니다.
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking."
},
{
"role": "user",
"content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
성공 응답에서는 다음 필드를 우선 확인하십시오.
choices[0].message.content
usage.prompt_tokens
usage.completion_tokens
finish_reason
셸과 터미널 관련 검토 프롬프트는 Terminal-Bench 성능 향상을 빠르게 점검하기 위한 적절한 스모크 테스트입니다.
다단계 코딩 작업이나 에이전트 작업에는 thinking 매개변수를 활성화할 수 있습니다.
"thinking": { "type": "enabled" }
짧은 추출, 분류, 단순 변환 요청에서는 추론 토큰이 불필요할 수 있으므로 비활성화한 결과와 비교하십시오.
Python 빠른 시작
OpenAI Python SDK를 설치합니다.
pip install --upgrade openai
그다음 base_url을 Z.ai API 경로로 지정합니다.
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
},
{
"role": "user",
"content": (
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
첫날부터 usage를 로그에 기록하십시오. 5.3 전용 가격이 공개되지 않은 상태에서는 실제 입력·출력 토큰 사용량이 비용을 추정할 수 있는 가장 신뢰할 만한 운영 지표입니다.
Node.js 빠른 시작
Node.js에서도 openai 패키지를 사용합니다.
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: "glm-5.3",
messages: [
{
role: "system",
content:
"You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
},
{
role: "user",
content:
"A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
기존 코드베이스가 이미 OpenAI API를 호출한다면 별도 추상화 계층을 새로 만들 필요는 없습니다. Z.ai baseURL을 사용하는 두 번째 OpenAI 인스턴스를 만들고 작업별로 요청을 라우팅하십시오. 그러면 GLM-5.3과 기존 모델의 A/B 비교가 코드 재작성 대신 라우팅 설정 문제로 바뀝니다.
스트리밍
문서는 표준 stream 플래그 기반 스트리밍을 지원합니다. Python 예제는 다음과 같습니다.
stream = client.chat.completions.create(
model="glm-5.3",
messages=[
{
"role": "user",
"content": "Explain the N+1 query problem with a concrete ORM example.",
}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
원시 HTTP 요청에서는 본문에 다음 값을 추가하고 SSE(Server-Sent Events)를 파싱합니다.
"stream": true
실무에서는 다음 두 가지를 고려하십시오.
- 토큰 사용량은 마지막 청크와 함께 또는 스트림 종료 뒤에 도착할 수 있습니다. 정확한 비용 계산은 스트림을 완전히 닫은 뒤 수행하십시오.
-
thinking을 활성화하면 어려운 프롬프트에서 첫 토큰이 도착하기까지 더 긴 대기 시간이 발생할 수 있습니다. 모델이 응답 전 추론 토큰을 사용하기 때문입니다.
중요한 매개변수
| 매개변수 | 유형 | 구현 시 사용 기준 |
|---|---|---|
max_tokens |
정수 | 출력 길이 상한입니다. 비용 제어를 위해 항상 지정하십시오. |
temperature |
숫자 | 코드·추출 작업에는 0.2~0.4, 개방형 작성에는 0.7+를 사용하십시오. |
thinking |
객체 |
{"type": "enabled"}로 다단계 작업의 추론 모드를 켭니다. |
stream |
불리언 | 단일 JSON 응답 대신 SSE 청크를 받습니다. |
messages |
배열 | 표준 OpenAI 역할인 system, user, assistant를 사용합니다. |
비용은 공식 가격 페이지를 기준으로 확인하십시오. 출시 당시 5.3 전용 가격은 공개되지 않았으므로 리셀러나 비공식 페이지의 토큰 가격 추정치는 신뢰하지 않는 것이 좋습니다.
작성 시점의 참고 가격은 다음과 같습니다.
| 모델 | 입력 100만 토큰 | 출력 100만 토큰 |
|---|---|---|
| GLM-5.2 | $1.40 | $4.40 |
| GLM-5 | $1.00 | $3.20 |
유료 GLM 모델의 캐시된 입력은 80~85% 할인될 수 있으므로, 반복되는 시스템 프롬프트와 공통 컨텍스트는 가능한 한 안정적인 접두사로 구성해 캐시 적중을 유도하십시오. 비용 관리 패턴은 DeepSeek 가격 인상 사후 분석도 참고할 수 있습니다.
애플리케이션 코드 작성 전에 Apidog에서 GLM-5.3 테스트하기
스크립트에서 프롬프트를 반복 수정하며 호출하면 편집·실행·로그 탐색 과정마다 토큰 비용이 발생합니다. Z.ai API는 OpenAI 호환이므로, API 클라이언트에서 요청 형식을 먼저 고정한 뒤 코드로 옮기는 편이 효율적입니다.
Apidog에서는 다음 순서로 구성하십시오.
프로젝트를 만들고 채팅 완성 요청을 추가합니다.
OpenAI 호환 사양을 가져오거나POST /chat/completions를 직접 정의합니다. 요청 본문에는model과messages를 포함합니다.지역별 환경을 만듭니다.
zai-international과bigmodel-mainland환경을 생성합니다.
zai-international
BASE_URL=https://api.z.ai/api/paas/v4
bigmodel-mainland
BASE_URL=https://open.bigmodel.cn/api/paas/v4
인증 헤더는 환경 변수로 관리합니다.
Authorization: Bearer {{GLM_API_KEY}}
이렇게 하면 저장된 요청에 API 키를 넣지 않고도 드롭다운에서 지역을 전환할 수 있습니다.
- 모델 ID를 변수로 분리합니다.
GLM_MODEL=glm-5.3
출시 주간에는 모델 ID가 변경되거나 glm-5.2와 비교해야 할 수 있습니다. 변수로 분리하면 저장된 모든 요청을 수정하지 않고 한 곳에서 모델을 교체할 수 있습니다.
-
thinking활성화 여부를 같은 프롬프트에서 비교합니다. 요청을 복제한 뒤 한쪽에만 다음을 추가합니다.
"thinking": { "type": "enabled" }
지연 시간, 출력 품질, usage를 비교해 어떤 작업에 추론 토큰을 사용할지 결정하십시오.
스트리밍 요청을 별도로 검증합니다.
SSE 청크가 실시간으로 표시되는지 확인하고, 사용자가 체감할 첫 토큰 응답 시간을 측정하십시오.좋은 응답을 예시 또는 픽스처로 저장합니다.
이후 UI·파서·후처리 로직을 개발할 때는 라이브 API 호출 대신 저장된 응답을 사용하십시오. 이는 개발 중 토큰 소비를 줄이는 가장 효과적인 방법 중 하나입니다.
저장된 요청에 finish_reason, 응답 스키마, 토큰 수에 대한 검증을 추가하면 스모크 테스트를 회귀 테스트 스위트로 확장할 수 있습니다. API 전반에 적용할 수 있는 워크플로는 QA 엔지니어를 위한 API 테스팅 가이드에서 확인할 수 있습니다.
오류 처리 및 속도 제한
OpenAI 스타일 오류 객체를 예상하십시오.
{
"error": {
"message": "...",
"type": "...",
"code": "..."
}
}
일반적으로 처리해야 할 상태 코드는 다음과 같습니다.
| 상태 코드 | 일반적인 원인 | 처리 방법 |
|---|---|---|
400 |
잘못된 요청 본문, 알 수 없는 모델 ID | 요청 스키마와 모델 변수를 확인합니다. |
401 |
누락되었거나 취소된 API 키 | 환경 변수와 인증 헤더를 확인합니다. |
429 |
속도 제한 | 지터가 포함된 지수 백오프로 재시도합니다. |
5xx |
일시적 서버 오류 | 재시도 후 실패를 기록합니다. |
출시 초기 API를 운영할 때는 다음 습관을 적용하십시오.
- 429와 5xx에 재시도 정책을 적용합니다. 새 모델 출시 직후에는 트래픽이 집중될 수 있으므로 지터가 포함된 지수 백오프를 사용하십시오.
- 속도 제한 수치를 추정하지 않습니다. 동시성 및 티어별 제한은 공식 문서에서 현재 값을 확인하십시오.
-
모델 ID는 구성으로 관리합니다. 5.3의 동작 변화로 프롬프트 품질이 저하되면,
glm-5.2로의 롤백은 코드 배포가 아니라 설정 변경으로 끝나야 합니다.
OpenAI 호환 인터페이스이므로 Grok API 테스트 및 디버깅 워크플로도 유사하게 적용할 수 있습니다.
자주 묻는 질문 (FAQ)
GLM-5.3 API의 모델 ID는 무엇인가요?
Zhipu의 기존 명명 규칙을 따르면 glm-5.3이 예상됩니다. 가격 페이지에는 glm-5.2, glm-5.1이 별도 모델로 표시되어 있습니다. 다만 작성 시점의 모델 문서에는 glm-5가 표시되어 있었으므로, 프로덕션 적용 전 docs.z.ai에서 확인하십시오.
모델 ID는 코드에 하드코딩하지 말고 구성 파일이나 환경 변수에 저장하십시오.
GLM-5.3 API는 OpenAI SDK와 호환되나요?
네. base_url을 https://api.z.ai/api/paas/v4로 설정하고 Z.ai API 키를 전달하면 Python 및 Node.js용 공식 openai 패키지를 사용할 수 있습니다. 중국 본토에서는 Bigmodel.cn 엔드포인트를 사용하면 됩니다.
요청·응답 형식과 스트리밍 방식은 OpenAI 채팅 완성 인터페이스와 호환됩니다.
GLM-5.3 API 비용은 얼마인가요?
Zhipu는 2026년 8월 14일 출시 당시 GLM-5.3 전용 가격을 공개하지 않았습니다. 공식 가격 페이지에는 GLM-5.2가 입력 100만 토큰당 $1.40, 출력 100만 토큰당 $4.40으로 표시되어 있습니다.
5.3 가격 항목이 업데이트되기 전까지는 이를 참고값으로 사용하되, 리셀러의 가격 추측은 피하십시오.
GLM-5.3은 Claude 및 GPT와 어떻게 비교되나요?
Zhipu 자체 평가에 따르면 코딩 및 에이전트 기능은 “Claude Fable 5에 근접”합니다. CyberGym은 84.5%로 Claude Mythos 5 및 GPT-5.6 Sol보다 약간 높았다고 발표됐지만, ExploitBench는 54.4%로 최첨단 모델보다 낮았습니다.
이 수치는 독립적으로 재현되기 전까지 공급업체 주장으로 간주해야 합니다. 모델 비교 방법은 Grok 4.6 vs GPT-5.6 vs Claude Fable 5 비교를 참고하십시오.
GLM-5.3을 API 대신 로컬에서 실행할 수 있나요?
아직은 아닙니다. Zhipu는 출시 약 2주 후인 2026년 8월 28일경 Hugging Face 조직에 오픈 웨이트를 공개할 예정이라고 밝혔습니다.
7,440억 매개변수 MoE 설계는 로컬 노트북보다는 서버급 환경을 전제로 합니다. 현재는 호스팅 API를 사용해 프롬프트, 출력 품질, 지연 시간, 토큰 사용량 기준선을 먼저 구축하는 것이 현실적입니다.
GLM-5.3을 스택에 도입하는 순서
에이전트 루프나 코딩 워크로드를 운영한다면 GLM-5.3은 직접 평가할 가치가 있습니다. Terminal-Bench 및 SWE-Marathon 향상은 공급업체 보고서에 기반하지만, 공개된 변화 폭은 실제 워크로드에서 검증해 볼 이유가 됩니다. 오픈 웨이트 공개가 예정되어 있으므로, 지금 저장한 API 요청과 응답은 이후 자체 호스팅 환경의 회귀 기준선으로도 사용할 수 있습니다.
권장 순서는 다음과 같습니다.
- API 키를 발급합니다.
- cURL 요청으로 인증과 모델 ID를 확인합니다.
- Apidog를 다운로드해 국제·중국 본토 환경을 구성합니다.
- 모델 ID를 변수로 관리합니다.
- 실제 프롬프트로
thinking활성화·비활성화 결과를 비교합니다. - 응답 스키마,
finish_reason, 토큰 사용량을 검증합니다. - 검증된 요청만 Python 또는 Node.js 코드로 옮깁니다.
OpenAI 호환 형식 덕분에 애플리케이션 포팅 자체는 어렵지 않습니다. 핵심은 먼저 요청 형식과 운영 기준을 고정하고, 모델 ID·지역 엔드포인트·추론 모드·비용을 구성으로 관리하는 것입니다.

Top comments (0)