GLM-5.3 ist ein großes Sprachmodell, das am 14. August 2026 von Zhipu AI veröffentlicht wurde, dem chinesischen Labor, das international als Z.ai tätig ist. Es handelt sich um ein Post-Training-Upgrade des Basismodells GLM-5, das gezielt auf Coding- und Agentenaufgaben ausgerichtet ist. Zhipu plant, die offenen Gewichte etwa zwei Wochen nach dem Start auf Hugging Face zu veröffentlichen. In internen Evaluierungen meldet Zhipu eine um 50 % bessere Coding-Fähigkeit gegenüber GLM-5.2.
Apidog noch heute ausprobieren
Die Veröffentlichung ist aus zwei Gründen relevant: Ein Labor, das Seeking Alpha als „chinesischen OpenAI-Herausforderer“ bezeichnet, liefert ein Coding-Modell, das laut Zhipu „nahe an Claude Fable 5 heranreicht“, und plant anschließend die Gewichte offenzulegen. Der Start erfolgte einen Tag nach der neuesten DeepSeek-Veröffentlichung, die wir im DeepSeek V4 Pro API-Leitfaden behandelt haben.
In diesem Artikel erfahren Sie, was GLM-5.3 ist, wie Sie Benchmark-Aussagen einordnen, wann die offenen Gewichte erwartet werden und wie Sie sofort einen ersten API-Request senden. Sie können den Request ohne eigenen Code in Apidog testen.
TL;DR
- GLM-5.3 wurde am 14. August 2026 von Zhipu AI (Z.ai) ausgeliefert. Das GLM-5-Basismodell bleibt unverändert; die Verbesserungen stammen aus skaliertem Post-Training.
- Der Terminal-Bench-3.0-Score stieg laut Startbericht von 4,6 auf 28,3 — ein 6,2-facher Anstieg und Platz eins unter Open-Source-Modellen.
- Bei Agents’ Last Exam belegt GLM-5.3 laut Startbericht ebenfalls Platz eins unter offenen Modellen.
- CyberGym: 84,5 %, leicht über Claude Mythos 5 und GPT-5.6 Sol. ExploitBench: 54,4 %, weiterhin hinter den Spitzenmodellen.
- Die offenen Gewichte sollen etwa am 28. August 2026 auf Hugging Face erscheinen.
- Die GLM-5-Familie nutzt laut offizieller Dokumentation eine Mixture-of-Experts-Architektur mit 744 Mrd. Gesamtparametern, etwa 40 Mrd. aktiven Parametern pro Forward Pass und einem Kontextfenster von 200K Token.
- Die API ist OpenAI-kompatibel und unter
https://api.z.ai/api/paas/v4/chat/completionserreichbar. Zum Start wurde keine spezifische Preisgestaltung für GLM-5.3 veröffentlicht.
Was GLM-5.3 ist
GLM-5.3 ist die dritte Punktversion der GLM-5-Familie und klar auf Coding- und Agenten-Workloads zugeschnitten. Zhipu hat das Basismodell nicht neu trainiert. Die offizielle Dokumentation beschreibt GLM-5 als Mixture-of-Experts-Modell mit:
- 744 Mrd. Gesamtparametern
- etwa 40 Mrd. aktiven Parametern pro Forward Pass
- 200K Token Kontextfenster
Diese Spezifikationen bleiben unverändert. Die Verbesserungen von GLM-5.3 stammen vollständig aus skaliertem Post-Training auf denselben Basisgewichten.
Das ist praktisch relevant: Wenn ein Modell ohne neues Basistraining deutlich besser wird, ist die Post-Training-Pipeline ein zentraler Teil des Produkts. Zhipu meldet eine 50%ige Verbesserung der Coding-Fähigkeit gegenüber GLM-5.2 und fokussiert dabei auf:
- terminalgesteuerte Agentenaufgaben
- langfristige Softwareentwicklung
- Sicherheitsanalyse
GLM-5.3 ist daher kein allgemeines Chat-Upgrade, sondern ein Modell für Teams, die autonome Coding-Agenten oder Repository-weite Entwicklungsaufgaben evaluieren möchten.
GLM-5.3-Benchmarks: Zahlen richtig einordnen
Die Startberichte von BigGo Finance und Pandaily nennen die folgenden Ergebnisse. Achten Sie auf die Quelle: Öffentliche Ranglisten und interne Evaluierungen sind unterschiedlich belastbar.
| Benchmark | GLM-5.3-Ergebnis | Kontext | Quelle |
|---|---|---|---|
| Terminal-Bench 3.0 | 28,3 (von 4,6) | 6,2-facher Anstieg; Platz eins unter Open-Source-Modellen | Startbericht |
| Agents’ Last Exam | Platz eins unter Open-Source-Modellen | Ergebnis zum Start nicht veröffentlicht | Startbericht |
| CyberGym | 84,5 % | Leicht über Claude Mythos 5 und GPT-5.6 Sol | Startbericht |
| ExploitBench | 54,4 % | Hinter Frontier-Modellen | Startbericht |
| SWE-Marathon | ungefähr 2× GLM-5.2 | Langfristige Softwareentwicklung | Zhipu intern |
| Coding-Fähigkeit, aggregiert | +50 % vs. GLM-5.2 | Zhipus Hauptaussage | Zhipu intern |
Was Sie aus den Werten ableiten können
Der Sprung von 4,6 auf 28,3 bei Terminal-Bench 3.0 ist relevant. Terminal-Benchmarks testen, ob ein Modell Shell-Befehle sinnvoll verketten, Ausgaben lesen und Fehler über mehrere Schritte hinweg korrigieren kann. Wenn Sie Agenten bauen, die Tests ausführen, Dateien ändern oder CI-Probleme untersuchen, ist genau dieses Verhalten wichtig.
Gleichzeitig bleiben die am häufigsten zitierten Aussagen — der 50%ige Coding-Zuwachs und der verdoppelte SWE-Marathon-Score — interne Werte von Zhipu. Behandeln Sie sie als Signal für eine Evaluierung, nicht als Ersatz für eigene Tests.
Was „nahe an Claude Fable 5“ praktisch bedeutet
Zhipu beschreibt die Coding- und Agentenfähigkeiten von GLM-5.3 als „nahe an Claude Fable 5“. Diese Formulierung ist bewusst vorsichtig.
Wo die Aussage plausibel ist:
- Platz eins unter Open-Source-Modellen bei Terminal-Bench 3.0
- Platz eins unter offenen Modellen bei Agents’ Last Exam
- 84,5 % bei CyberGym, leicht über Claude Mythos 5 und GPT-5.6 Sol
Für Terminal-Agenten, CI-Automatisierung und mehrstufige Coding-Aufgaben im Repository kann GLM-5.3 daher ein ernstzunehmender Kandidat sein.
Wo die Aussage nicht vollständig zutrifft:
- Bei ExploitBench erreicht GLM-5.3 54,4 % und liegt damit weiter hinter den Spitzenmodellen.
- Exploit-Entwicklung verlangt tiefes, mehrstufiges Denken unter Unsicherheit. Die Lücke deutet darauf hin, dass geschlossene Frontier-Modelle bei den schwierigsten Aufgaben weiterhin Vorteile haben.
Für Ihren Stack bedeutet das: Vergleichen Sie GLM-5.3 direkt mit Ihren bisherigen Modellen anhand eigener Tickets, Repositories und CI-Fehlerfälle. Für eine Einordnung ähnlicher Benchmark-Kategorien hilft auch unser Vergleich von Grok 4.6, GPT-5.6 und Claude Fable 5.
Open Weights: Veröffentlichung um den 28. August 2026
Zhipu plant, die offenen Gewichte von GLM-5.3 etwa zwei Wochen nach dem API-Start bereitzustellen. Erwartet werden sie um den 28. August 2026 in der zai-org-Organisation auf Hugging Face.
Die Verzögerung ist laut Zhipu Teil einer umfangreichen Risikobewertung. Das ist nachvollziehbar: Ein Modell mit 84,5 % bei CyberGym besitzt relevante offensive Sicherheitsfähigkeiten. Die Freigabe von Gewichten ist etwas anderes als der Zugriff über eine überwachte API.
Vorbereitung auf Self-Hosting
Für die meisten Teams ist Inferenz mit voller Präzision bei einem 744B-Parameter-MoE-Modell keine Desktop-Aufgabe — auch wenn nur etwa 40B Parameter pro Token aktiv sind. Rechnen Sie mit Server-Hardware und mehreren GPUs oder warten Sie auf quantisierte Community-Varianten.
Wenn Sie lokale Bereitstellung planen, bereiten Sie vorab Folgendes vor:
- Definieren Sie reale Evaluierungs-Prompts und Erfolgskriterien.
- Speichern Sie API-Antworten als Baseline.
- Messen Sie Latenz, Kosten, Tool-Use-Erfolg und Test-Pass-Rate.
- Vergleichen Sie nach Release lokale Inferenz direkt mit der gehosteten API.
Details zu Dimensionierung, Serving-Stacks und Baseline-Tests behandelt der Leitfaden zum Self-Hosting von GLM-5.3.
Wie GLM-5.3 in die Open-Model-Landschaft passt
Der naheliegende Vergleich ist DeepSeek: Beide Labore veröffentlichen offene Gewichte, beide arbeiten mit API-Angeboten und beide lieferten neue Modelle innerhalb von 24 Stunden aus.
Der Schwerpunkt unterscheidet sich jedoch:
- DeepSeek V4 Pro: generalistisches Flaggschiff
- GLM-5.3: spezialisierte Wette auf Coding-Agenten und Terminal-Workloads
Wenn ein großer Teil Ihres Traffics aus agentischer Entwicklung besteht, sollten Sie GLM-5.3 zuerst gegen Ihre bestehende Prompt-Suite testen.
Auch API-Kosten bleiben ein Faktor. Die jüngste DeepSeek-Preiserhöhung — analysiert in unserem Leitfaden zur DeepSeek-API-Kostenoptimierung — zeigt, dass sich Preise selbst bei offenen Modellfamilien schnell ändern können. Das macht Self-Hosting als Absicherung attraktiver.
Zum Start hatte Zhipu keine GLM-5.3-spezifischen Preise veröffentlicht. Die offizielle Preisübersicht listete für GLM-5.2 zum Zeitpunkt der Erstellung:
- 1,4 $ pro 1 Mio. Eingabe-Tokens
- 4,4 $ pro 1 Mio. Ausgabe-Tokens
Nutzen Sie diese Werte nur als Orientierung und prüfen Sie die aktuelle Preisübersicht vor dem Budgetieren.
Sobald quantisierte Varianten verfügbar sind, kann GLM-5.3 zu den Modellen gehören, die ohne API-Abhängigkeit lokal betrieben werden. Einen Überblick über die aktuelle Landschaft finden Sie in unserem Beitrag zu den besten lokalen LLMs 2026.
GLM Coding Plan: Quoten wurden zurückgesetzt
Zhipu hat am 14. August die Quoten des GLM Coding Plans für alle Benutzer zurückgesetzt. Wenn Sie den Coding Plan über Z.ai abonniert haben, begann Ihr Kontingent am Veröffentlichungstag erneut.
Der Coding Plan ist von der tokenbasierten API-Abrechnung getrennt. Das Zurücksetzen gilt für den Plan, nicht für API-Guthaben oder API-Abrechnung.
Nutzer auf dem chinesischen Festland greifen über open.bigmodel.cn auf das entsprechende Ökosystem mit eigenen Plänen und Abrechnungen zu.
Die API in fünf Minuten testen
Die API von Z.ai ist OpenAI-kompatibel. Wenn Sie bereits OpenAI-kompatible Chat-Completions-Endpunkte verwenden, können Sie Ihren Client meist mit wenigen Anpassungen wiederverwenden.
Internationale API-URL:
https://api.z.ai/api/paas/v4/chat/completions
Endpoint für das chinesische Festland:
https://open.bigmodel.cn/api/paas/v4/chat/completions
Die Authentifizierung erfolgt über einen Bearer-Token. Zum Start führte die offizielle Dokumentation noch glm-5 als Modell-ID. Die folgende glm-5.3-ID folgt der Familienkonvention, sollte aber vor einem produktiven Einsatz auf der Modell-Dokumentationsseite geprüft werden.
export GLM_API_KEY="your-key-from-z.ai"
curl https://api.z.ai/api/paas/v4/chat/completions \
-H "Authorization: Bearer $GLM_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Write a bash script that finds the five largest files in a git repo, excluding the .git directory."
}
],
"temperature": 0.6,
"max_tokens": 1024
}'
Die Antwort folgt dem OpenAI-Schema und enthält unter anderem:
-
choicesmit der Modellantwort -
usagemit Token-Zählungen
Request in Apidog speichern und vergleichen
Für wiederholbare Tests ist eine API-Client-Umgebung praktischer als ständig angepasste cURL-Strings:
- Importieren Sie den Request in Apidog.
- Speichern Sie
GLM_API_KEYals Umgebungsvariable. - Legen Sie getrennte Umgebungen für
api.z.aiundopen.bigmodel.cnan. - Speichern Sie Antworten für repräsentative Aufgaben.
- Verwenden Sie diese Antworten später als Regressions-Baseline für lokale Open-Weight-Deployments.
Damit wechseln Sie Regionen oder Modell-IDs per Dropdown statt durch manuelle Änderungen im Request.
Für Python- und Node.js-Clients, Streaming und Fehlerbehandlung lesen Sie den vollständigen GLM-5.3 API-Schnellstart.
FAQ
Ist GLM-5.3 Open Source?
Noch nicht. Zhipu plant eine Open-Weight-Veröffentlichung um den 28. August 2026 auf Hugging Face, etwa zwei Wochen nach dem API-Start. Bis dahin ist der Zugriff nur über die gehostete API möglich.
Wie unterscheidet sich GLM-5.3 von GLM-5.2?
Das Basismodell bleibt identisch. Die Verbesserungen kommen aus skaliertem Post-Training. Zhipu meldet:
- +50 % Coding-Fähigkeit in internen Evaluierungen
- Terminal-Bench 3.0 von 4,6 auf 28,3
- ungefähr verdoppelten SWE-Marathon-Score
Kontextfenster, Parameteranzahl und Architektur entsprechen weiterhin der GLM-5-Familienbaseline.
Was kostet GLM-5.3?
Zum Start wurden keine GLM-5.3-spezifischen API-Preise veröffentlicht. GLM-5.2 lag laut offizieller Preisübersicht zum Zeitpunkt der Erstellung bei 1,4 $ pro 1 Mio. Eingabe-Tokens und 4,4 $ pro 1 Mio. Ausgabe-Tokens.
Prüfen Sie vor dem Budgetieren immer die aktuelle Preisübersicht. Für allgemeine Kostensenkung bei tokenbasierten APIs siehe den Leitfaden zur API-Kostenoptimierung nach der DeepSeek-Preiserhöhung.
Kann ich GLM-5.3 auf eigener Hardware ausführen?
Nach der Veröffentlichung der Gewichte: ja, mit Einschränkungen. GLM-5 ist ein 744B-Parameter-MoE-Modell mit etwa 40B aktiven Parametern pro Forward Pass. Inferenz mit voller Präzision benötigt daher Server-Hardware mit mehreren GPUs.
Quantisierte Community-Builds sollten die Einstiegshürde senken. Für die Vorbereitung siehe den Self-Hosting-Leitfaden.
Ist GLM-5.3 besser als Claude oder GPT für Coding?
Für die gemeldeten Agenten- und Terminal-Benchmarks ist GLM-5.3 wettbewerbsfähig: Platz eins unter Open-Source-Modellen bei Terminal-Bench 3.0 und ein leicht höherer CyberGym-Wert als Claude Mythos 5 und GPT-5.6 Sol.
Bei ExploitBench liegt GLM-5.3 mit 54,4 % jedoch hinter den Spitzenmodellen. Die richtige Entscheidung ist daher workloadabhängig: Testen Sie Ihre eigenen Aufgaben gegen beide Optionen, bevor Sie Produktions-Traffic umstellen — genauso, wie Sie jede API vor der Übernahme testen sollten.
Wo GLM-5.3 in Ihren Stack passt
GLM-5.3 ist eine spezialisierte Veröffentlichung mit einem klaren Profil:
- starke Ergebnisse bei Coding-Agenten und Terminal-Aufgaben
- OpenAI-kompatible API für sofortige Tests
- erwartete Open Weights innerhalb von etwa zwei Wochen
- noch teilweise unbestätigte Aussagen, bis unabhängige Evaluierungen vorliegen
Das reicht für eine strukturierte Evaluierung, aber nicht automatisch für eine Migration.
Starten Sie mit einer kleinen, realistischen Prompt-Suite:
- Wählen Sie 10 bis 20 typische Coding-Aufgaben aus Ihrem Team.
- Erfassen Sie Erfolg, Laufzeit, Tokenverbrauch und manuelle Nacharbeit.
- Speichern Sie Antworten als API-Baseline.
- Wiederholen Sie dieselben Tests nach dem Open-Weight-Release lokal.
- Vergleichen Sie Qualität, Kosten, Latenz und Betriebsaufwand.
Laden Sie Apidog herunter, um Ihre Requests und Testantworten zu organisieren. Halten Sie die Endpunkte von Z.ai und bigmodel.cn als getrennte Umgebungen bereit, damit Sie Regionen, Modell-IDs und später lokale Deployments reproduzierbar vergleichen können.

Top comments (0)