Zhipu AI, international als Z.ai bekannt, veröffentlichte GLM-5.3 am 14. August 2026. Laut dem Veröffentlichungsbericht von BigGo verbessern sich die Coding-Fähigkeiten gegenüber GLM-5.2 um 50 %, während Terminal-Bench 3.0 von 4,6 auf 28,3 steigt. Die offenen Gewichte sollen etwa zwei Wochen später folgen. Eine vollständige Funktions- und Benchmark-Übersicht finden Sie in Was ist GLM-5.3?; dieser Beitrag zeigt den praktischen API-Schnellstart.
Sie richten einen API-Schlüssel ein, senden einen ersten cURL-Request, verwenden GLM-5.3 mit dem OpenAI SDK in Python und Node.js, streamen Antworten und testen die Request-Form zunächst in Apidog. Die API von Z.ai ist OpenAI-kompatibel: Wenn Sie bereits Chat-Completions-Endpunkte genutzt haben, müssen Sie hauptsächlich Basis-URL, API-Key und Modell-ID anpassen.
Hinweis: GLM-5.3 wurde am Veröffentlichungstag beschrieben, an dem sich die Dokumentation schnell ändern kann. Verifizierte Angaben stammen aus den offiziellen Z.ai-Dokumenten. Modell-ID und Preise sollten Sie vor einem Produktions-Rollout erneut prüfen.
Kurz gesagt
-
Internationaler Endpunkt:
POST https://api.z.ai/api/paas/v4/chat/completions -
Endpunkt für Festlandchina:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions -
Authentifizierung:
Authorization: Bearer $GLM_API_KEY -
Vermutete Modell-ID:
glm-5.3. Die GLM-5-Dokumentation führte beim Verfassen nochglm-5; prüfen Sie die verfügbare ID vor dem Hardcoding. -
SDK-Kompatibilität: Die offiziellen OpenAI-Pakete für Python und Node.js funktionieren mit einer geänderten
base_url. - Preise: Zum Start gab es keine 5.3-spezifischen Preise. Die offizielle Preisübersicht führte GLM-5.2 mit 1,40 $ pro 1 Mio. Eingabe-Token und 4,40 $ pro 1 Mio. Ausgabe-Token.
- Open Weights: Erwartet auf der Hugging-Face-Organisation von Z.ai um den 28. August 2026.
- Empfohlener Workflow: Testen Sie Prompts, Modellvarianten und Streaming zuerst in Apidog, speichern Sie gute Antworten als Fixtures und portieren Sie erst dann nach Python oder Node.js.
Warum GLM-5.3 für API-Workloads relevant ist
GLM-5.3 basiert weiterhin auf der GLM-5-Familie; die Fortschritte stammen laut Zhipu aus skaliertem Post-Training. Zhipu berichtet unter anderem:
- Terminal-Bench 3.0: von 4,6 auf 28,3
- ungefähr verdoppelte SWE-Marathon-Leistung gegenüber GLM-5.2
- CyberGym: 84,5 %
- ExploitBench: 54,4 %
Diese Werte sind Anbieterangaben und sollten als solche behandelt werden, bis unabhängige Reproduktionen vorliegen. Für einen API-Smoke-Test eignen sich besonders terminalnahe Aufgaben, Shell-Reviews und mehrstufige Coding-Workflows.
Die Z.ai-Dokumentation beschreibt für die GLM-5-Familie ein Mixture-of-Experts-Design mit 744B Parametern insgesamt, etwa 40B aktiven Parametern pro Forward-Pass und einem Kontextfenster von 200K Token. Das sind Familienangaben, nicht zwingend 5.3-spezifische Eigenschaften.
Die geplanten offenen Gewichte machen die API zusätzlich nützlich: Verwenden Sie Ihre heutigen API-Requests als Regressions-Baseline für eine spätere Self-Hosting-Umgebung. Der GLM-5.3-Self-Hosting-Vorbereitungsleitfaden behandelt diesen Übergang. Auch die Einführungsberichterstattung von Pandaily verweist auf die geplante Veröffentlichung der Gewichte und des Risikobewertungssystems. Seeking Alpha ordnet Zhipu als „chinesischen OpenAI-Herausforderer“ ein.
1. API-Schlüssel erstellen
Zhipu stellt zwei regionale Plattformen bereit. Wählen Sie den Host passend zu Ihrem Traffic und Ihrer Abrechnung.
International: Z.ai
- Registrieren Sie sich unter z.ai.
- Öffnen Sie die API-Konsole.
- Erstellen Sie einen API-Schlüssel.
- Prüfen Sie bei Bedarf die Dokumentation unter docs.z.ai.
Dieser Pfad ist für Nutzer außerhalb des chinesischen Festlands vorgesehen.
Festlandchina: Bigmodel.cn
- Öffnen Sie open.bigmodel.cn.
- Erstellen Sie dort einen separaten API-Schlüssel.
- Verwenden Sie den regionalen Bigmodel-Host.
Die API-Struktur und Authentifizierung bleiben gleich, aber Host und Abrechnung sind getrennt. Für Traffic aus Festlandchina ist dieser Endpunkt wegen Latenz und Compliance die passende Wahl.
Speichern Sie den Schlüssel als Umgebungsvariable, nicht im Repository:
export GLM_API_KEY="your-key-from-the-console"
Wenn Sie den GLM Coding Plan statt API-Pay-as-you-go nutzen: Die Kontingente wurden laut Ankündigung am 14. August für alle Nutzer zurückgesetzt.
2. Endpunkt und Authentifizierung konfigurieren
Der internationale Chat-Completions-Endpunkt lautet:
POST https://api.z.ai/api/paas/v4/chat/completions
Für Festlandchina verwenden Sie:
POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Senden Sie den API-Key als Bearer-Token:
Authorization: Bearer $GLM_API_KEY
Die Request- und Response-Struktur folgt dem OpenAI-Chat-Completions-Format:
- Request:
modelundmessages - Response:
choices,message,finish_reasonundusage - Streaming: Standard-Flag
stream: true
Das gleiche Migrationsmuster gilt für andere OpenAI-kompatible Anbieter, etwa im Beitrag zur DeepSeek V4 Pro API.
Modell-ID nicht fest im Code verankern
Zum Veröffentlichungszeitpunkt führte die GLM-5-Dokumentation noch glm-5 als Modell-ID. Da die Preisübersicht glm-5.1 und glm-5.2 separat aufführt, liegt glm-5.3 als Konvention nahe.
Verwenden Sie deshalb Konfiguration statt Literalwerte:
export GLM_MODEL="glm-5.3"
Wenn glm-5.3 in Ihrer Region einen 404-Fehler liefert, prüfen Sie zuerst die offizielle Dokumentation. Als Familien-Fallback kann glm-5 relevant sein, sofern dieser in Ihrer Region verfügbar ist.
3. Ersten Request mit cURL senden
Starten Sie mit einem kleinen, reproduzierbaren Coding-Review:
curl "https://api.z.ai/api/paas/v4/chat/completions" \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking."
},
{
"role": "user",
"content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
}
],
"temperature": 0.3,
"max_tokens": 1024
}'
Prüfen Sie in der Antwort mindestens:
choices[0].message.content
usage.prompt_tokens
usage.completion_tokens
finish_reason
Für mehrstufige Coding- oder Agentenaufgaben können Sie den Denkmodus aktivieren:
"thinking": { "type": "enabled" }
Nutzen Sie thinking gezielt. Für kurze Klassifikation, Extraktion oder feste Ausgabeformate können zusätzliche Reasoning-Token unnötig sein.
4. Python mit dem OpenAI SDK verwenden
Installieren oder aktualisieren Sie das OpenAI-Paket:
pip install --upgrade openai
Konfigurieren Sie anschließend ausschließlich die Z.ai-Basis-URL:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["GLM_API_KEY"],
base_url="https://api.z.ai/api/paas/v4",
)
response = client.chat.completions.create(
model=os.environ.get("GLM_MODEL", "glm-5.3"),
messages=[
{
"role": "system",
"content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
},
{
"role": "user",
"content": (
"Review this Flask route for security issues:\n\n"
"@app.route('/user/<id>')\n"
"def get_user(id):\n"
" return db.execute(f'SELECT * FROM users WHERE id = {id}')"
),
},
],
temperature=0.3,
max_tokens=2048,
)
print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Protokollieren Sie usage von Beginn an. Solange keine 5.3-spezifischen Preise veröffentlicht sind, liefern Token-Zahlen die belastbarste Grundlage für Kostenprognosen.
5. Node.js mit dem OpenAI SDK verwenden
Installieren Sie das Paket:
npm install openai
Verwenden Sie anschließend dieselbe OpenAI-kompatible Schnittstelle:
import OpenAI from "openai";
const client = new OpenAI({
apiKey: process.env.GLM_API_KEY,
baseURL: "https://api.z.ai/api/paas/v4",
});
const response = await client.chat.completions.create({
model: process.env.GLM_MODEL || "glm-5.3",
messages: [
{
role: "system",
content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
},
{
role: "user",
content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
},
],
temperature: 0.3,
max_tokens: 2048,
});
console.log(response.choices[0].message.content);
console.log(response.usage);
Wenn Ihre Anwendung bereits OpenAI verwendet, brauchen Sie keinen zweiten SDK-Stack. Erstellen Sie eine weitere OpenAI-Instanz mit der Z.ai-baseURL und routen Sie Tasks anhand einer Konfiguration. So wird ein A/B-Test zwischen GLM-5.3 und Ihrem bisherigen Modell zu einer Routing-Änderung statt zu einer Neuentwicklung.
6. Antworten streamen
Streaming aktivieren Sie mit stream=True:
stream = client.chat.completions.create(
model=os.environ.get("GLM_MODEL", "glm-5.3"),
messages=[
{
"role": "user",
"content": "Explain the N+1 query problem with a concrete ORM example.",
}
],
stream=True,
)
for chunk in stream:
delta = chunk.choices[0].delta.content
if delta:
print(delta, end="", flush=True)
Bei direktem HTTP setzen Sie im JSON-Body:
"stream": true
Die Antwort kommt dann als Server-Sent Events. Jede data:-Zeile enthält ein Delta im OpenAI-Chunk-Format.
Beachten Sie dabei:
- Die endgültige Token-Nutzung kann erst am Ende des Streams verfügbar sein.
- Mit aktiviertem
thinkingkann die Zeit bis zum ersten sichtbaren Token bei komplexen Aufgaben steigen. - Messen Sie für UI-Workloads sowohl Time to First Token als auch die Gesamtlatenz.
7. Wichtige Parameter
| Parameter | Typ | Einsatz |
|---|---|---|
max_tokens |
integer | Harte Obergrenze für die Ausgabelänge und ein zentraler Kostenhebel. |
temperature |
number | Für Code und Extraktion meist 0.2 bis 0.4; für offenes Schreiben häufig 0.7+. |
thinking |
object |
{"type": "enabled"} aktiviert den Denkmodus für mehrstufige Aufgaben. |
stream |
boolean | Liefert Server-Sent Events statt eines einzelnen Response-Bodys. |
messages |
array | OpenAI-Standardrollen: system, user, assistant. |
Kosten kontrollieren
Zhipu veröffentlichte zum Start keine 5.3-spezifischen API-Preise. Nutzen Sie deshalb ausschließlich die offizielle Preisübersicht als Quelle.
Zum Zeitpunkt des Schreibens waren dort aufgeführt:
| Modell | Eingabe pro 1 Mio. Token | Ausgabe pro 1 Mio. Token |
|---|---|---|
| GLM-5.2 | 1,40 $ | 4,40 $ |
| GLM-5 | 1,00 $ | 3,20 $ |
Für kostenpflichtige GLM-Modelle werden zwischengespeicherte Eingaben laut Preisübersicht mit 80 bis 85 % Rabatt berechnet. Halten Sie deshalb System-Prompts stabil und vermeiden Sie unnötige Änderungen am Prompt-Präfix. Weitere übertragbare Kostenmuster beschreibt das DeepSeek-Preiserhöhungs-Postmortem.
8. GLM-5.3 zuerst in Apidog testen
Prompt-Iteration direkt in einem Skript ist langsam und kostet bei jedem Durchlauf Tokens. Da Z.ai OpenAI-kompatibel ist, können Sie die Explorationsphase vollständig in Apidog durchführen.
Empfohlene Einrichtung
Projekt und Request erstellen
Definieren SiePOST /chat/completionsmanuell oder importieren Sie eine OpenAI-kompatible Spezifikation. Der JSON-Body enthältmodelundmessages.Zwei Umgebungen anlegen
Erstellen Siezai-internationalundbigmodel-mainland.
| Umgebung | Base URL |
| --- | --- |
| zai-international | https://api.z.ai/api/paas/v4 |
| bigmodel-mainland | https://open.bigmodel.cn/api/paas/v4 |
Definieren Sie den Header auf Umgebungsebene:
Authorization: Bearer {{GLM_API_KEY}}
Modell-ID variabel halten
Verwenden Sie etwa{{GLM_MODEL}}mit dem Startwertglm-5.3. So können Sie bei einer geänderten Modell-ID oder für A/B-Tests mitglm-5.2zentral umstellen.-
thinkingparallel vergleichen
Duplizieren Sie denselben Request. Aktivieren Sie in einer Variantethinkingund vergleichen Sie:- Latenz
- Antwortqualität
usage- Einhaltung Ihres Ausgabeformats
Streaming realistisch prüfen
Senden Sie einen Request mitstream: true. Beobachten Sie die Zeit bis zum ersten Chunk, nicht nur die Gesamtdauer.Gute Responses als Fixtures speichern
Verwenden Sie gespeicherte Antworten bei späteren Tests. So validieren Sie Clients und Parser, ohne bei jedem Durchlauf die Live-API aufzurufen.
Aus gespeicherten Requests können Sie anschließend Test-Szenarien mit Assertions für finish_reason, Antwortschema und Token-Nutzung aufbauen. Einen allgemeinen Workflow dafür finden Sie im API-Testleitfaden für QA-Ingenieure.
9. Fehlerbehandlung und Ratenbegrenzungen
Rechnen Sie mit dem üblichen OpenAI-Fehlerformat:
{
"error": {
"message": "…",
"type": "…",
"code": "…"
}
}
Typische HTTP-Statuscodes:
| Status | Ursache | Reaktion |
|---|---|---|
400 |
Ungültiger Request-Body oder unbekannte Modell-ID | Request validieren, Modell-ID prüfen. |
401 |
Fehlender, falscher oder widerrufener API-Key | Umgebungsvariable und Berechtigungen prüfen. |
429 |
Ratenbegrenzung | Retry mit exponentiellem Backoff und Jitter. |
5xx |
Temporärer Serverfehler | Retry mit begrenzter Anzahl von Versuchen. |
Verwenden Sie für 429 und 5xx einen Retry-Wrapper:
import random
import time
def with_retry(fn, max_attempts=5):
for attempt in range(max_attempts):
try:
return fn()
except Exception:
if attempt == max_attempts - 1:
raise
delay = min(2 ** attempt, 20) + random.uniform(0, 0.5)
time.sleep(delay)
Drei Regeln sind besonders wichtig:
- Implementieren Sie exponentiellen Backoff mit Jitter für
429und temporäre5xx. - Erfinden Sie keine festen Limits. Prüfen Sie Parallelitäts- und Tier-Details in der offiziellen Z.ai-Dokumentation.
- Halten Sie die Modell-ID in der Konfiguration. Ein Rollback von
glm-5.3aufglm-5.2sollte keine Codeänderung oder neues Deployment erfordern.
Der gleiche OpenAI-kompatible Debugging-Ansatz gilt auch für andere APIs, etwa im Leitfaden zum Testen und Debuggen der Grok-API.
Häufig gestellte Fragen
Was ist die Modell-ID für die GLM-5.3 API?
Die erwartete ID ist glm-5.3, entsprechend der bisherigen Familienkonvention mit glm-5.1 und glm-5.2. Da die GLM-5-Dokumentation beim Verfassen noch glm-5 führte, sollten Sie die aktuelle ID vor dem Produktionsstart prüfen. Speichern Sie sie immer als Konfigurationswert.
Funktioniert die GLM-5.3 API mit dem OpenAI SDK?
Ja. Setzen Sie im offiziellen openai-Paket die Basis-URL auf:
https://api.z.ai/api/paas/v4
Für Festlandchina verwenden Sie den entsprechenden bigmodel.cn-Host. Request-Format, Chat-Completions-Antworten und Streaming folgen dem OpenAI-kompatiblen Muster.
Wie viel kostet die GLM-5.3 API?
Zum Start am 14. August 2026 gab es keine 5.3-spezifischen Preise. Prüfen Sie die offizielle Preisgestaltungsseite und verlassen Sie sich nicht auf Reseller-Schätzungen. GLM-5.2 mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro 1 Mio. Token ist bis zur Veröffentlichung einer 5.3-Zeile nur ein Referenzpunkt.
Wie vergleicht sich GLM-5.3 mit Claude und GPT?
Zhipu ordnet die Coding- und Agentenfähigkeit als „nahezu Claude Fable 5“ ein. Die genannten CyberGym- und ExploitBench-Werte sind jedoch Anbieterangaben und sollten unabhängig überprüft werden. Einen Vergleich von Spitzenmodellen finden Sie in Grok 4.6 vs. GPT-5.6 vs. Claude Fable 5.
Kann ich GLM-5.3 lokal ausführen?
Noch nicht mit den zum Veröffentlichungszeitpunkt verfügbaren Gewichten. Zhipu kündigte die Veröffentlichung auf der Hugging-Face-Organisation für etwa zwei Wochen nach dem Release an. Das 744B-Parameter-MoE-Design ist für Server-Infrastruktur ausgelegt, nicht für einen Laptop. Nutzen Sie die API jetzt, um Evaluierungen und Regressionstests für eine spätere Self-Hosting-Umgebung aufzubauen.
Nächste Schritte
Testen Sie GLM-5.3, wenn Sie Coding-Workloads, Terminal-Automatisierung oder Agenten-Loops betreiben. Die gemeldeten Benchmark-Sprünge stammen vom Anbieter, sind aber groß genug für einen eigenen, reproduzierbaren Vergleich mit Ihren realen Prompts.
Empfohlene Reihenfolge:
- API-Key erstellen.
- Den cURL-Smoke-Test ausführen.
- Modell-ID und regionalen Endpunkt als Umgebungsvariablen hinterlegen.
- Prompts,
thinkingund Streaming in Apidog vergleichen. - Gute Antworten und Assertions als Fixtures speichern.
- Erst danach nach Python oder Node.js portieren.
Sobald Request und Antwortverhalten validiert sind, ist die Anwendungsmigration hauptsächlich eine Frage von Basis-URL, API-Key und Modellkonfiguration.

Top comments (0)