DEV Community

Cover image for Wie benutzt man die GLM-5.3 API?
Emre Demir
Emre Demir

Posted on Originally published at apidog.com

Wie benutzt man die GLM-5.3 API?

Zhipu AI, international als Z.ai bekannt, veröffentlichte GLM-5.3 am 14. August 2026. Laut dem Veröffentlichungsbericht von BigGo verbessern sich die Coding-Fähigkeiten gegenüber GLM-5.2 um 50 %, während Terminal-Bench 3.0 von 4,6 auf 28,3 steigt. Die offenen Gewichte sollen etwa zwei Wochen später folgen. Eine vollständige Funktions- und Benchmark-Übersicht finden Sie in Was ist GLM-5.3?; dieser Beitrag zeigt den praktischen API-Schnellstart.

Apidog heute ausprobieren

Sie richten einen API-Schlüssel ein, senden einen ersten cURL-Request, verwenden GLM-5.3 mit dem OpenAI SDK in Python und Node.js, streamen Antworten und testen die Request-Form zunächst in Apidog. Die API von Z.ai ist OpenAI-kompatibel: Wenn Sie bereits Chat-Completions-Endpunkte genutzt haben, müssen Sie hauptsächlich Basis-URL, API-Key und Modell-ID anpassen.

Hinweis: GLM-5.3 wurde am Veröffentlichungstag beschrieben, an dem sich die Dokumentation schnell ändern kann. Verifizierte Angaben stammen aus den offiziellen Z.ai-Dokumenten. Modell-ID und Preise sollten Sie vor einem Produktions-Rollout erneut prüfen.

Kurz gesagt

  • Internationaler Endpunkt: POST https://api.z.ai/api/paas/v4/chat/completions
  • Endpunkt für Festlandchina: POST https://open.bigmodel.cn/api/paas/v4/chat/completions
  • Authentifizierung: Authorization: Bearer $GLM_API_KEY
  • Vermutete Modell-ID: glm-5.3. Die GLM-5-Dokumentation führte beim Verfassen noch glm-5; prüfen Sie die verfügbare ID vor dem Hardcoding.
  • SDK-Kompatibilität: Die offiziellen OpenAI-Pakete für Python und Node.js funktionieren mit einer geänderten base_url.
  • Preise: Zum Start gab es keine 5.3-spezifischen Preise. Die offizielle Preisübersicht führte GLM-5.2 mit 1,40 $ pro 1 Mio. Eingabe-Token und 4,40 $ pro 1 Mio. Ausgabe-Token.
  • Open Weights: Erwartet auf der Hugging-Face-Organisation von Z.ai um den 28. August 2026.
  • Empfohlener Workflow: Testen Sie Prompts, Modellvarianten und Streaming zuerst in Apidog, speichern Sie gute Antworten als Fixtures und portieren Sie erst dann nach Python oder Node.js.

Warum GLM-5.3 für API-Workloads relevant ist

GLM-5.3 basiert weiterhin auf der GLM-5-Familie; die Fortschritte stammen laut Zhipu aus skaliertem Post-Training. Zhipu berichtet unter anderem:

  • Terminal-Bench 3.0: von 4,6 auf 28,3
  • ungefähr verdoppelte SWE-Marathon-Leistung gegenüber GLM-5.2
  • CyberGym: 84,5 %
  • ExploitBench: 54,4 %

Diese Werte sind Anbieterangaben und sollten als solche behandelt werden, bis unabhängige Reproduktionen vorliegen. Für einen API-Smoke-Test eignen sich besonders terminalnahe Aufgaben, Shell-Reviews und mehrstufige Coding-Workflows.

Die Z.ai-Dokumentation beschreibt für die GLM-5-Familie ein Mixture-of-Experts-Design mit 744B Parametern insgesamt, etwa 40B aktiven Parametern pro Forward-Pass und einem Kontextfenster von 200K Token. Das sind Familienangaben, nicht zwingend 5.3-spezifische Eigenschaften.

Die geplanten offenen Gewichte machen die API zusätzlich nützlich: Verwenden Sie Ihre heutigen API-Requests als Regressions-Baseline für eine spätere Self-Hosting-Umgebung. Der GLM-5.3-Self-Hosting-Vorbereitungsleitfaden behandelt diesen Übergang. Auch die Einführungsberichterstattung von Pandaily verweist auf die geplante Veröffentlichung der Gewichte und des Risikobewertungssystems. Seeking Alpha ordnet Zhipu als „chinesischen OpenAI-Herausforderer“ ein.

1. API-Schlüssel erstellen

Zhipu stellt zwei regionale Plattformen bereit. Wählen Sie den Host passend zu Ihrem Traffic und Ihrer Abrechnung.

International: Z.ai

  1. Registrieren Sie sich unter z.ai.
  2. Öffnen Sie die API-Konsole.
  3. Erstellen Sie einen API-Schlüssel.
  4. Prüfen Sie bei Bedarf die Dokumentation unter docs.z.ai.

Dieser Pfad ist für Nutzer außerhalb des chinesischen Festlands vorgesehen.

Festlandchina: Bigmodel.cn

  1. Öffnen Sie open.bigmodel.cn.
  2. Erstellen Sie dort einen separaten API-Schlüssel.
  3. Verwenden Sie den regionalen Bigmodel-Host.

Die API-Struktur und Authentifizierung bleiben gleich, aber Host und Abrechnung sind getrennt. Für Traffic aus Festlandchina ist dieser Endpunkt wegen Latenz und Compliance die passende Wahl.

Speichern Sie den Schlüssel als Umgebungsvariable, nicht im Repository:

export GLM_API_KEY="your-key-from-the-console"
Enter fullscreen mode Exit fullscreen mode

Wenn Sie den GLM Coding Plan statt API-Pay-as-you-go nutzen: Die Kontingente wurden laut Ankündigung am 14. August für alle Nutzer zurückgesetzt.

2. Endpunkt und Authentifizierung konfigurieren

Der internationale Chat-Completions-Endpunkt lautet:

POST https://api.z.ai/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Für Festlandchina verwenden Sie:

POST https://open.bigmodel.cn/api/paas/v4/chat/completions
Enter fullscreen mode Exit fullscreen mode

Senden Sie den API-Key als Bearer-Token:

Authorization: Bearer $GLM_API_KEY
Enter fullscreen mode Exit fullscreen mode

Die Request- und Response-Struktur folgt dem OpenAI-Chat-Completions-Format:

  • Request: model und messages
  • Response: choices, message, finish_reason und usage
  • Streaming: Standard-Flag stream: true

Das gleiche Migrationsmuster gilt für andere OpenAI-kompatible Anbieter, etwa im Beitrag zur DeepSeek V4 Pro API.

Modell-ID nicht fest im Code verankern

Zum Veröffentlichungszeitpunkt führte die GLM-5-Dokumentation noch glm-5 als Modell-ID. Da die Preisübersicht glm-5.1 und glm-5.2 separat aufführt, liegt glm-5.3 als Konvention nahe.

Verwenden Sie deshalb Konfiguration statt Literalwerte:

export GLM_MODEL="glm-5.3"
Enter fullscreen mode Exit fullscreen mode

Wenn glm-5.3 in Ihrer Region einen 404-Fehler liefert, prüfen Sie zuerst die offizielle Dokumentation. Als Familien-Fallback kann glm-5 relevant sein, sofern dieser in Ihrer Region verfügbar ist.

3. Ersten Request mit cURL senden

Starten Sie mit einem kleinen, reproduzierbaren Coding-Review:

curl "https://api.z.ai/api/paas/v4/chat/completions" \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "system",
        "content": "You are a code reviewer. Flag issues as blocking or non-blocking."
      },
      {
        "role": "user",
        "content": "Review this shell script for safety:\n\nrm -rf $BUILD_DIR/*\ncp dist/* $DEPLOY_TARGET"
      }
    ],
    "temperature": 0.3,
    "max_tokens": 1024
  }'
Enter fullscreen mode Exit fullscreen mode

Prüfen Sie in der Antwort mindestens:

choices[0].message.content
usage.prompt_tokens
usage.completion_tokens
finish_reason
Enter fullscreen mode Exit fullscreen mode

Für mehrstufige Coding- oder Agentenaufgaben können Sie den Denkmodus aktivieren:

"thinking": { "type": "enabled" }
Enter fullscreen mode Exit fullscreen mode

Nutzen Sie thinking gezielt. Für kurze Klassifikation, Extraktion oder feste Ausgabeformate können zusätzliche Reasoning-Token unnötig sein.

4. Python mit dem OpenAI SDK verwenden

Installieren oder aktualisieren Sie das OpenAI-Paket:

pip install --upgrade openai
Enter fullscreen mode Exit fullscreen mode

Konfigurieren Sie anschließend ausschließlich die Z.ai-Basis-URL:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["GLM_API_KEY"],
    base_url="https://api.z.ai/api/paas/v4",
)

response = client.chat.completions.create(
    model=os.environ.get("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "system",
            "content": "You are a code reviewer. Flag issues as blocking or non-blocking.",
        },
        {
            "role": "user",
            "content": (
                "Review this Flask route for security issues:\n\n"
                "@app.route('/user/<id>')\n"
                "def get_user(id):\n"
                "    return db.execute(f'SELECT * FROM users WHERE id = {id}')"
            ),
        },
    ],
    temperature=0.3,
    max_tokens=2048,
)

print(response.choices[0].message.content)
print("input tokens:", response.usage.prompt_tokens)
print("output tokens:", response.usage.completion_tokens)
Enter fullscreen mode Exit fullscreen mode

Protokollieren Sie usage von Beginn an. Solange keine 5.3-spezifischen Preise veröffentlicht sind, liefern Token-Zahlen die belastbarste Grundlage für Kostenprognosen.

5. Node.js mit dem OpenAI SDK verwenden

Installieren Sie das Paket:

npm install openai
Enter fullscreen mode Exit fullscreen mode

Verwenden Sie anschließend dieselbe OpenAI-kompatible Schnittstelle:

import OpenAI from "openai";

const client = new OpenAI({
  apiKey: process.env.GLM_API_KEY,
  baseURL: "https://api.z.ai/api/paas/v4",
});

const response = await client.chat.completions.create({
  model: process.env.GLM_MODEL || "glm-5.3",
  messages: [
    {
      role: "system",
      content: "You are a terminal automation agent. Return each step as a shell command with a one-line rationale.",
    },
    {
      role: "user",
      content: "A Node service on port 3000 stopped responding after a deploy. Give me a diagnosis sequence.",
    },
  ],
  temperature: 0.3,
  max_tokens: 2048,
});

console.log(response.choices[0].message.content);
console.log(response.usage);
Enter fullscreen mode Exit fullscreen mode

Wenn Ihre Anwendung bereits OpenAI verwendet, brauchen Sie keinen zweiten SDK-Stack. Erstellen Sie eine weitere OpenAI-Instanz mit der Z.ai-baseURL und routen Sie Tasks anhand einer Konfiguration. So wird ein A/B-Test zwischen GLM-5.3 und Ihrem bisherigen Modell zu einer Routing-Änderung statt zu einer Neuentwicklung.

6. Antworten streamen

Streaming aktivieren Sie mit stream=True:

stream = client.chat.completions.create(
    model=os.environ.get("GLM_MODEL", "glm-5.3"),
    messages=[
        {
            "role": "user",
            "content": "Explain the N+1 query problem with a concrete ORM example.",
        }
    ],
    stream=True,
)

for chunk in stream:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="", flush=True)
Enter fullscreen mode Exit fullscreen mode

Bei direktem HTTP setzen Sie im JSON-Body:

"stream": true
Enter fullscreen mode Exit fullscreen mode

Die Antwort kommt dann als Server-Sent Events. Jede data:-Zeile enthält ein Delta im OpenAI-Chunk-Format.

Beachten Sie dabei:

  1. Die endgültige Token-Nutzung kann erst am Ende des Streams verfügbar sein.
  2. Mit aktiviertem thinking kann die Zeit bis zum ersten sichtbaren Token bei komplexen Aufgaben steigen.
  3. Messen Sie für UI-Workloads sowohl Time to First Token als auch die Gesamtlatenz.

7. Wichtige Parameter

Parameter Typ Einsatz
max_tokens integer Harte Obergrenze für die Ausgabelänge und ein zentraler Kostenhebel.
temperature number Für Code und Extraktion meist 0.2 bis 0.4; für offenes Schreiben häufig 0.7+.
thinking object {"type": "enabled"} aktiviert den Denkmodus für mehrstufige Aufgaben.
stream boolean Liefert Server-Sent Events statt eines einzelnen Response-Bodys.
messages array OpenAI-Standardrollen: system, user, assistant.

Kosten kontrollieren

Zhipu veröffentlichte zum Start keine 5.3-spezifischen API-Preise. Nutzen Sie deshalb ausschließlich die offizielle Preisübersicht als Quelle.

Zum Zeitpunkt des Schreibens waren dort aufgeführt:

Modell Eingabe pro 1 Mio. Token Ausgabe pro 1 Mio. Token
GLM-5.2 1,40 $ 4,40 $
GLM-5 1,00 $ 3,20 $

Für kostenpflichtige GLM-Modelle werden zwischengespeicherte Eingaben laut Preisübersicht mit 80 bis 85 % Rabatt berechnet. Halten Sie deshalb System-Prompts stabil und vermeiden Sie unnötige Änderungen am Prompt-Präfix. Weitere übertragbare Kostenmuster beschreibt das DeepSeek-Preiserhöhungs-Postmortem.

8. GLM-5.3 zuerst in Apidog testen

Prompt-Iteration direkt in einem Skript ist langsam und kostet bei jedem Durchlauf Tokens. Da Z.ai OpenAI-kompatibel ist, können Sie die Explorationsphase vollständig in Apidog durchführen.

Empfohlene Einrichtung

  1. Projekt und Request erstellen

    Definieren Sie POST /chat/completions manuell oder importieren Sie eine OpenAI-kompatible Spezifikation. Der JSON-Body enthält model und messages.

  2. Zwei Umgebungen anlegen

    Erstellen Sie zai-international und bigmodel-mainland.

| Umgebung | Base URL |
| --- | --- |
| zai-international | https://api.z.ai/api/paas/v4 |
| bigmodel-mainland | https://open.bigmodel.cn/api/paas/v4 |

Definieren Sie den Header auf Umgebungsebene:

   Authorization: Bearer {{GLM_API_KEY}}
Enter fullscreen mode Exit fullscreen mode
  1. Modell-ID variabel halten

    Verwenden Sie etwa {{GLM_MODEL}} mit dem Startwert glm-5.3. So können Sie bei einer geänderten Modell-ID oder für A/B-Tests mit glm-5.2 zentral umstellen.

  2. thinking parallel vergleichen

    Duplizieren Sie denselben Request. Aktivieren Sie in einer Variante thinking und vergleichen Sie:

    • Latenz
    • Antwortqualität
    • usage
    • Einhaltung Ihres Ausgabeformats
  3. Streaming realistisch prüfen

    Senden Sie einen Request mit stream: true. Beobachten Sie die Zeit bis zum ersten Chunk, nicht nur die Gesamtdauer.

  4. Gute Responses als Fixtures speichern

    Verwenden Sie gespeicherte Antworten bei späteren Tests. So validieren Sie Clients und Parser, ohne bei jedem Durchlauf die Live-API aufzurufen.

Aus gespeicherten Requests können Sie anschließend Test-Szenarien mit Assertions für finish_reason, Antwortschema und Token-Nutzung aufbauen. Einen allgemeinen Workflow dafür finden Sie im API-Testleitfaden für QA-Ingenieure.

9. Fehlerbehandlung und Ratenbegrenzungen

Rechnen Sie mit dem üblichen OpenAI-Fehlerformat:

{
  "error": {
    "message": "…",
    "type": "…",
    "code": "…"
  }
}
Enter fullscreen mode Exit fullscreen mode

Typische HTTP-Statuscodes:

Status Ursache Reaktion
400 Ungültiger Request-Body oder unbekannte Modell-ID Request validieren, Modell-ID prüfen.
401 Fehlender, falscher oder widerrufener API-Key Umgebungsvariable und Berechtigungen prüfen.
429 Ratenbegrenzung Retry mit exponentiellem Backoff und Jitter.
5xx Temporärer Serverfehler Retry mit begrenzter Anzahl von Versuchen.

Verwenden Sie für 429 und 5xx einen Retry-Wrapper:

import random
import time

def with_retry(fn, max_attempts=5):
    for attempt in range(max_attempts):
        try:
            return fn()
        except Exception:
            if attempt == max_attempts - 1:
                raise

            delay = min(2 ** attempt, 20) + random.uniform(0, 0.5)
            time.sleep(delay)
Enter fullscreen mode Exit fullscreen mode

Drei Regeln sind besonders wichtig:

  • Implementieren Sie exponentiellen Backoff mit Jitter für 429 und temporäre 5xx.
  • Erfinden Sie keine festen Limits. Prüfen Sie Parallelitäts- und Tier-Details in der offiziellen Z.ai-Dokumentation.
  • Halten Sie die Modell-ID in der Konfiguration. Ein Rollback von glm-5.3 auf glm-5.2 sollte keine Codeänderung oder neues Deployment erfordern.

Der gleiche OpenAI-kompatible Debugging-Ansatz gilt auch für andere APIs, etwa im Leitfaden zum Testen und Debuggen der Grok-API.

Häufig gestellte Fragen

Was ist die Modell-ID für die GLM-5.3 API?

Die erwartete ID ist glm-5.3, entsprechend der bisherigen Familienkonvention mit glm-5.1 und glm-5.2. Da die GLM-5-Dokumentation beim Verfassen noch glm-5 führte, sollten Sie die aktuelle ID vor dem Produktionsstart prüfen. Speichern Sie sie immer als Konfigurationswert.

Funktioniert die GLM-5.3 API mit dem OpenAI SDK?

Ja. Setzen Sie im offiziellen openai-Paket die Basis-URL auf:

https://api.z.ai/api/paas/v4
Enter fullscreen mode Exit fullscreen mode

Für Festlandchina verwenden Sie den entsprechenden bigmodel.cn-Host. Request-Format, Chat-Completions-Antworten und Streaming folgen dem OpenAI-kompatiblen Muster.

Wie viel kostet die GLM-5.3 API?

Zum Start am 14. August 2026 gab es keine 5.3-spezifischen Preise. Prüfen Sie die offizielle Preisgestaltungsseite und verlassen Sie sich nicht auf Reseller-Schätzungen. GLM-5.2 mit 1,40 $ Eingabe und 4,40 $ Ausgabe pro 1 Mio. Token ist bis zur Veröffentlichung einer 5.3-Zeile nur ein Referenzpunkt.

Wie vergleicht sich GLM-5.3 mit Claude und GPT?

Zhipu ordnet die Coding- und Agentenfähigkeit als „nahezu Claude Fable 5“ ein. Die genannten CyberGym- und ExploitBench-Werte sind jedoch Anbieterangaben und sollten unabhängig überprüft werden. Einen Vergleich von Spitzenmodellen finden Sie in Grok 4.6 vs. GPT-5.6 vs. Claude Fable 5.

Kann ich GLM-5.3 lokal ausführen?

Noch nicht mit den zum Veröffentlichungszeitpunkt verfügbaren Gewichten. Zhipu kündigte die Veröffentlichung auf der Hugging-Face-Organisation für etwa zwei Wochen nach dem Release an. Das 744B-Parameter-MoE-Design ist für Server-Infrastruktur ausgelegt, nicht für einen Laptop. Nutzen Sie die API jetzt, um Evaluierungen und Regressionstests für eine spätere Self-Hosting-Umgebung aufzubauen.

Nächste Schritte

Testen Sie GLM-5.3, wenn Sie Coding-Workloads, Terminal-Automatisierung oder Agenten-Loops betreiben. Die gemeldeten Benchmark-Sprünge stammen vom Anbieter, sind aber groß genug für einen eigenen, reproduzierbaren Vergleich mit Ihren realen Prompts.

Empfohlene Reihenfolge:

  1. API-Key erstellen.
  2. Den cURL-Smoke-Test ausführen.
  3. Modell-ID und regionalen Endpunkt als Umgebungsvariablen hinterlegen.
  4. Prompts, thinking und Streaming in Apidog vergleichen.
  5. Gute Antworten und Assertions als Fixtures speichern.
  6. Erst danach nach Python oder Node.js portieren.

Sobald Request und Antwortverhalten validiert sind, ist die Anwendungsmigration hauptsächlich eine Frage von Basis-URL, API-Key und Modellkonfiguration.

Top comments (0)