GLM-5.3-Flash ist derzeit zum halben Preis erhältlich. Das Angebot endet am 9. September 2026; danach verdoppeln sich alle Kostenprognosen, die auf den heutigen Preisen basieren.
Alle Zahlen wurden am 27. August 2026 überprüft. Da Preisseiten sich ändern können, sollten Sie die Tarife bei Ihrem tatsächlichen Anbieter bestätigen, bevor Sie ein Budget festlegen.
Preise
| Einführungspreis bis 9. Sep. 2026 | Listenpreis danach | |
|---|---|---|
| Eingabe | $0.075 / 1 Mio. Token | $0.15 / 1 Mio. Token |
| Ausgabe | $0.25 / 1 Mio. Token | $0.50 / 1 Mio. Token |
| Gecachte Eingabe | $0.015 / 1 Mio. Token | $0.03 / 1 Mio. Token |
Artificial Analysis nennt einen gemischten Wert von $0.10 pro Million Token bei einem Cache-Hit-zu-Eingabe-zu-Ausgabe-Verhältnis von 7:2:1. Das ist ein nützlicher Vergleichswert, aber Ihre tatsächliche Token-Mischung bestimmt Ihre Rechnung.
Kosten für typische Workloads
Die folgenden Beispiele verwenden den Listenpreis nach dem 9. September.
Support-Klassifikator: 100.000 Tickets pro Monat mit jeweils etwa 800 Eingabe- und 100 Ausgabetoken ergeben 80 Mio. Eingabe- und 10 Mio. Ausgabetoken. Kosten: $12.00 Eingabe + $5.00 Ausgabe = $17 pro Monat. Setzen Sie
reasoning_effortauflow, um die Ausgabekosten weiter zu senken.Programmierassistent: 500 Sitzungen täglich mit jeweils 15.000 Eingabe- und 2.000 Ausgabetoken ergeben monatlich 225 Mio. Eingabe- und 30 Mio. Ausgabetoken. Ohne Caching: $48.75 pro Monat. Bei 70 % Cache-Hits sinken die Eingabekosten auf etwa $14.85 und die Gesamtkosten auf etwa $30.
Dokumenten-Pipeline mit Bildern: 10.000 Dokumente monatlich mit etwa 40.000 Eingabe- und 1.500 Ausgabetoken pro Dokument ergeben 400 Mio. Eingabe- und 15 Mio. Ausgabetoken. Kosten: $60.00 Eingabe + $7.50 Ausgabe = $67.50 pro Monat.
Cache-Treffer sind Ihr größter Hebel
Gecachte Eingabe kostet mit $0.03 pro Million Token nur ein Fünftel frischer Eingabe bei $0.15. Strukturieren Sie Prompts daher so:
- Stabilen Inhalt zuerst: System-Prompt, wiederverwendete Dokumente, Codebasis-Kontext.
- Variable Inhalte zuletzt: Zeitstempel, Anfrage-IDs, Benutzernamen und aktuelle Eingaben.
- Das stabile Präfix über Aufrufe hinweg bytegenau identisch halten.
Ein variabler Wert am Anfang des Prompts kann den Cache für alles Folgende ungültig machen.
Z.ai führt die Speicherung gecachter Eingaben für einen begrenzten Zeitraum als kostenlos auf. Behandeln Sie das als Werbeaktion und prüfen Sie die aktuellen Bedingungen, bevor Sie Ihre Architektur darauf stützen.
reasoning_effort aktiv steuern
Bei GLM-5.3-Flash ist reasoning_effort standardmäßig auf max gesetzt. Das ist die teuerste Einstellung.
Verfügbare Modi:
lowhighmax
Denktoken werden als Ausgabe abgerechnet. Für Klassifizierung, Extraktion, Routing und Formatierung ist low oft ausreichend und kann die Ausgabekosten deutlich reduzieren.
Die Konfiguration ist in unserem API-Leitfaden beschrieben. Es ist eine Änderung in einer Zeile und sollte Ihr erster Test sein, wenn Ihre Rechnung höher ausfällt als erwartet.
Vergleich mit GLM-5.3
| Modell | Durchschnitt pro 1 Mio. Token |
|---|---|
| GLM-5.3-Flash | $0.10 |
| GLM-5.3 | $0.90 |
Das entspricht etwa dem neunfachen Preis bei nur drei Punkten Unterschied im Artificial Analysis Intelligence Index: 57 gegenüber 60.
Unser vollständiger Vergleich erklärt, wann GLM-5.3 trotzdem die bessere Wahl ist: insbesondere bei langen Antworten, die an wartende Personen gestreamt werden, da GLM-5.3 fast doppelt so schnell generiert.
Gegenüber GLM-5.2 liegt die Aussage von Z.ai bei etwa einem Zehntel des Preises sowie bei Kosten pro Aufgabe von $0.045. Unsere GLM-5.2-Preisübersicht enthält die ältere Preisliste für Migrationsbudgets.
Im Vergleich zu den günstigen multimodalen Stufen anderer Anbieter ist GLM-5.3-Flash preislich wettbewerbsfähig. Zudem ist es MIT-lizenziert, sodass Self-Hosting möglich bleibt. Der engste Google-Vergleich findet sich in unserem Beitrag zur Gemini-3.7-Flash-Preisgestaltung.
Wiederverkäufer können deutlich teurer sein
Das Modell ist direkt über Z.ai sowie über OpenRouter, Cloudflare Workers AI, Vercel AI Gateway, DeepInfra, Novita, GMICloud, Baseten und io.net verfügbar.
Die Preise sind nicht einheitlich. AIHubMix führte beispielsweise etwa $0.113 für Eingabe und $0.394 für Ausgabe auf — zwischen Aktions- und Listenpreis von Z.ai. Einige Anbieter reichen den Einführungsrabatt weiter, andere nicht.
Wenn Sie über einen Aggregator routen, prüfen Sie dessen aktuellen Tarif. Ein einheitliches Gateway kann eine Marge enthalten, die bei diesen niedrigen absoluten Preisen leicht zu übersehen ist.
Wann sich Self-Hosting lohnt
Die Gewichte sind MIT-lizenziert. Für Full-Precision-Serving benötigen Sie grob einen Knoten der H200-Klasse mit 8 GPUs. Gemietete Cloud-Kapazität kostet dafür etwa $24 bis $48 pro Tag, also ungefähr $1.000 pro Monat unabhängig von der Auslastung.
Zum API-Listenpreis entsprechen $1.000 etwa 6,7 Milliarden Eingabetoken. Sie benötigen daher ein sehr hohes und konstantes Volumen, bevor sich ein eigener Knoten allein über Kosten lohnt.
Für die meisten Teams geht es bei Self-Hosting eher um:
- Kontrolle
- Datenresidenz
- Lizenzierung
Die Ausnahme sind quantisierte Builds. GGUF-Quantisierungen existieren; wenn Sie bereits passende Hardware besitzen, sind die Grenzkosten hauptsächlich Strom. Unser Leitfaden für den lokalen Betrieb zeigt, was die einzelnen Hardware-Stufen leisten können.
Für Entwickler: der Coding-Plan
Wenn ein einzelner Entwickler GLM-5.3-Flash über Claude Code oder Cline nutzt, ist Preisgestaltung pro Token möglicherweise nicht das passende Modell.
Der GLM Coding Plan beginnt bei etwa $18 pro Monat, enthält GLM-5.3-Flash und soll die dreifache nutzbare Quote von GLM-5.3 bieten. Laut Z.ai verbrauchen Off-Peak-Aufrufe zudem nur die Hälfte der Standardpunkte.
Für tägliche Entwicklungsarbeit ist ein Pauschalplan meist günstiger und besser vorhersehbar als getakteter API-Zugang. Unser Leitfaden zur Einrichtung des Harness erklärt die Einrichtung. Der Vergleich der Coding-Pläne stellt den GLM-Plan den Alternativen gegenüber.
Überwachen Sie Ausgabetoken
Eingabetoken erhalten oft mehr Aufmerksamkeit, weil ihre Mengen größer wirken. Budgets platzen jedoch häufig auf der Ausgabeseite:
- Ausgabe kostet mehr als das Dreifache der Eingabe: $0.50 gegenüber $0.15 pro Million Token.
- Denktoken werden als Ausgabe berechnet.
- Bei
reasoning_effort: maxkann das Modell deutlich mehr Token erzeugen, als in der finalen Antwort sichtbar sind.
Damit kann ein Workload mit kurzem Prompt und gesprächigem Modell ausgabe-dominiert sein, obwohl er auf dem Papier eingabe-lastig aussieht. Der gemischte Vergleichswert von $0.10 setzt ein Verhältnis von 7:2:1 voraus, das viele reale Workloads nicht erreichen.
Messen Sie statt zu schätzen:
- Protokollieren Sie das
usage-Objekt jeder Vervständigungsantwort. - Aggregieren Sie Eingabe-, Ausgabe- und Cache-Token.
- Vergleichen Sie die tatsächliche Mischung mit Ihrer Budgetannahme.
- Liegt Ausgabe über etwa 15 % aller Token, prüfen Sie zuerst
reasoning_effortund danach die Prompt-Länge.
Führen Sie repräsentative Aufrufe als gespeicherte Sammlung in Apidog aus. Verwenden Sie die Modell-ID als Umgebungsvariable, erfassen Sie die Tokenwerte pro Anfrage und führen Sie dieselbe Suite anschließend gegen GLM-5.3 aus. So vergleichen Sie reale Rechnungen statt Marketingangaben.
Checkliste vor dem 9. September
- Messen Sie Ihre tatsächliche Token-Mischung. Der gemischte Satz basiert auf 7:2:1. Bei ausgabe-lastigen Workloads liegen die effektiven Kosten näher bei $0.50 als bei $0.10 pro Million Token.
- Prüfen Sie Ihre Cache-Trefferrate. Der Unterschied zwischen frischer und gecachter Eingabe beträgt Faktor 5.
- Rechnen Sie mit Listenpreisen neu. Ab dem 10. September verdoppelt sich alles. Wenn Ihr Workload nur mit dem Aktionspreis rentabel ist, müssen Sie das jetzt lösen.
FAQ
Ist GLM-5.3-Flash kostenlos?
Nein. Es war etwa eine Woche kostenlos, als es vor dem Start anonym als „ox-alpha“ lief. Der aktuelle Rabatt von 50 % ist kein kostenloses Angebot.
Wann endet der Rabatt?
Am 9. September 2026. Danach gelten die Listenpreise.
Warum unterscheiden sich die Preise je nach Website?
Einige nennen Aktionspreise, andere Listenpreise; Wiederverkäufer setzen außerdem eigene Margen fest. Prüfen Sie stets den Anbieter, den Ihre Anwendung tatsächlich aufruft.
Kosten Bildeingaben extra?
Bilder verbrauchen Kontext-Token und werden als Eingabe abgerechnet. Es gibt keinen separaten Bildzuschlag, aber hochauflösende Bilder können viele Token verbrauchen.
Ist Self-Hosting günstiger?
Nur bei sehr großem, dauerhaftem Volumen oder bei vorhandener Hardware mit quantisiertem Build. Bei $0.15 pro Million Eingabetoken ist die Anmietung eines 8x-H200-Knotens allein aus Kostengründen schwer zu rechtfertigen.
Top comments (0)