GLM-5.3-Flash Uncensored: Was die Abliterierung wirklich zeigt
TL;DR: OrcaRouter veröffentlichte abliterierte Gewichte für GLM-5.3-Flash, ein Mixture-of-Experts-Modell mit 320B Parametern und 18B aktiven Parametern. Die Veröffentlichungen kamen in zwei Schritten: native Block-FP8-Gewichte am 29. August 2026 und ein NVFP4-Build für NVIDIA-GPUs am 31. August. GGUF- und MLX-Konvertierungen sind inzwischen ebenfalls verfügbar. Laut OrcaRouter sanken die Ablehnungsraten beispielsweise bei MaliciousInstruct von 96 % auf 11 %, aber nicht auf null. Die wichtigste Behauptung betrifft deshalb nicht die Entzensurierung, sondern die Modellinterpretierbarkeit: Ein Teil der Ausrichtung von GLM-5.3-Flash scheint nicht durch eine einzelne lineare Ablehnungsrichtung vermittelt zu werden.
Abliterierung ist inzwischen Routine: Ein Open-Weights-Modell wird analysiert, eine interne Richtung identifiziert, die mit Ablehnungen zusammenhängt, und anschließend aus den Gewichten entfernt. Viele solcher Veröffentlichungen sind wenig bemerkenswert. Diese verdient eine genauere Betrachtung, weil die Versionshinweise ein negatives Ergebnis über die Darstellung von Alignment in einem modernen Open-Weights-Modell enthalten.
Was tatsächlich veröffentlicht wurde
OrcaRouter veröffentlichte die Gewichte von GLM-5.3-Flash zunächst in der ursprünglichen Block-FP8-Präzision. Zwischen Basismodell und modifiziertem Modell wurde kein Rekompaktierungsschritt eingefügt. Die Architektur bleibt bei 320B Gesamtparametern und 18B aktiven Parametern. Die ursprüngliche Ankündigung erreichte später mehr als zwei Millionen Aufrufe.
Am 31. August 2026 folgte ein NVFP4-Build. NVIDIA nutzt dieses 4-Bit-Gleitkommaformat, um den Speicherbedarf zu senken und die Inferenz auf kompatibler Hardware zu beschleunigen. Die Ankündigung erreichte ungefähr 75.000 Aufrufe – deutlich weniger als das Original, aber passend zu einem Format-Release mit engerer Zielgruppe.
Seitdem sind außerdem GGUF- und MLX-Versionen verfügbar:
- Block-FP8: Referenzartefakt für Rechenzentrums-GPUs
- NVFP4: NVIDIA-Pfad mit geringerem Speicherbedarf
- GGUF: llama.cpp- und Workstation-Pfad
- MLX: Apple-Silicon-Pfad
Bei einer Überprüfung der Hugging-Face-Organisation am 1. September 2026 existierten sowohl GLM-5.3-Flash-Uncensored-GGUF als auch GLM-5.3-Flash-Uncensored-MLX. Die beiden Formate hatten zu diesem Zeitpunkt noch keine Downloads, der NVFP4-Build fünf und das FP8-Original 1.541. Die Aufmerksamkeit lag also bisher vor allem auf den Ankündigungen, nicht auf den Artefakten selbst.
Das ist keine einmalige Veröffentlichung. Dieselbe Organisation hostet bereits abliterierte Builds von Qwen3.8-27B – allein der FP8-Build verzeichnete mehr als 300.000 Downloads –, Qwen3.8-Flash-Next und Gemma-4-26B. GLM-5.3-Flash ist der neueste Eintrag in diesem Katalog.
Die Gewichte stehen unter der MIT-Lizenz und nennen zai-org/GLM-5.3-Flash als Basismodell. Die Modellkarte beschreibt den Build als abliteriert, Vision-Sprache-Modell, MoE-Modell und funktionsaufruf-fähig. Die multimodalen Fähigkeiten und Werkzeug-Schnittstellen des Basismodells sollen daher erhalten bleiben.
„Kein LoRA, kein Jailbreak-Prompt“ richtig einordnen
Die Formulierung unterscheidet die Methode von zwei verbreiteten Ansätzen.
Ein Jailbreak-Prompt manipuliert das Modell zur Laufzeit. Das Sicherheitstraining bleibt unverändert; der Prompt versucht lediglich, die Ausrichtung zu umgehen. Diese Methode ist fragil, verbraucht bei jeder Anfrage zusätzlichen Kontext und kann durch Anbieteränderungen unwirksam werden.
Ein LoRA-Adapter besteht aus zusätzlichen Gewichten, die beim Laden des Modells hinzugefügt werden. Das Basismodell selbst bleibt unverändert, und der Adapter kann wieder entfernt werden.
Bei der Abliterierung wird die interne Aktivierungsrichtung, die mit dem Ablehnungsverhalten verbunden ist, direkt aus den Gewichten entfernt. Es gibt keinen Adapter und keinen Prompt, der zur Laufzeit etwas unterdrückt. Das geänderte Verhalten ist eine Eigenschaft des Checkpoints.
Das ist auch eine Lieferkettenfrage: Ein abliteriertes Modell lässt sich nicht durch die Suche nach Adaptern oder durch eine Prompt-Prüfung erkennen. Wenn die Herkunft offener Modelle in Ihrer Umgebung relevant ist, müssen Sie die Basismodell-Abstammung mit dem tatsächlich eingesetzten Checkpoint vergleichen. Für den breiteren Umgang mit Modellgrenzen siehe KI-Agenten-Guardrails.
Die gemeldeten Ablehnungsraten
Die folgenden Zahlen stammen von OrcaRouter. Zum Zeitpunkt der Erstellung gab es keine unabhängige Replikation. Behandeln Sie sie daher als Anbieterangaben.
| Benchmark | Basis-Ablehnung | Nach Abliterierung |
|---|---|---|
| MaliciousInstruct | 96 % | 11 % |
| JailbreakBench | 93 % | 12 % |
| AdvBench | 97 % | 15 % |
| HarmBench | 93 % | 18 % |
| XSTest: benigne Überablehnung | 2,4 % | 0,4 % |
Die letzte Zeile sollte anders gelesen werden als die ersten vier. XSTest misst Überablehnung: Das Modell verweigert harmlose Anfragen, weil sie oberflächlich einem riskanten Thema ähneln.
Das ist der Fehlermodus, den Entwickler in der Produktion tatsächlich sehen:
- Ein Passwort-Reset lässt sich nicht debuggen, weil das Wort „Passwort“ vorkommt.
- Ein Port-Scanner für die eigene Infrastruktur wird abgelehnt.
- Ein Bedrohungsbericht kann nicht zusammengefasst werden, weil er Bedrohungen beschreibt.
Der Rückgang von 2,4 % auf 0,4 % ist deshalb für den legitimen Alltag besonders interessant. Die ersten vier Zeilen machen den Checkpoint dagegen zu einem Forschungsartefakt und nicht zu einem Produktivitätswerkzeug. Lizenz, lokale Gesetze und die eigene Sicherheitsarchitektur sind entsprechend wichtiger als bei einem gewöhnlichen Modell-Release.
Was Sie tatsächlich gewinnen
Die praktischen Vorteile liegen nicht nur in den Schlagzeilenzahlen.
Weniger Überablehnung
Der deutlichste Nutzen ist die geringere Wahrscheinlichkeit, dass das Modell harmlose Entwicklungsarbeit verweigert. Eine sechsfach niedrigere XSTest-Rate kann in einer normalen Arbeitswoche mehr bewirken als ein spektakulärer Jailbreak-Benchmark.
Kein Prompt-Overhead
Prompt-Engineering gegen Ablehnungen kostet bei jedem Aufruf Kontext, führt zu inkonsistenten Ergebnissen und kann nach einem Anbieter-Patch plötzlich nicht mehr funktionieren. Eine Änderung auf Gewichtsebene ist über Anfragen hinweg stabiler, weil sie Teil des Artefakts ist.
Kontrolle über die Bereitstellung
MIT-lizenzierte offene Gewichte lassen sich selbst hosten und auf einen exakten Checkpoint festlegen. Prompts und Dokumente bleiben innerhalb der eigenen Infrastruktur. Ein Anbieter kann nicht ohne Vorwarnung seine Filter ändern und dadurch einen laufenden Workflow unterbrechen.
Für den Infrastrukturteil sind GLM-5.3 Open Weights selbst hosten und die Informationen dazu, was GLM-5.3-Flash ist, hilfreiche Ausgangspunkte.
Erhalt der Fähigkeitsoberfläche
Die Modellkarte listet weiterhin Vision-Sprache und Funktionsaufrufe. Es handelt sich also nicht um einen reinen Text-Build. Das ist relevant, wenn Sie das Modell in agentischen Workflows statt nur im Chat verwenden möchten.
Die Grenzen
Abliterierung verbessert nicht automatisch die Fähigkeiten. Sie verändert Verhalten. Veröffentlichte Arbeiten zu dieser Technik finden im Allgemeinen einen gewissen Qualitätsverlust, während OrcaRouter keine Ergebnisse zu Denk-, Code- oder Sehvermögen berichtet.
Sie tauschen daher eine gemessene Reduzierung der Ablehnung gegen ein ungemessenes Risiko der Degradation ein. Außerdem liegt jede Filterentscheidung, die zuvor das Basismodell getroffen hat, nun in Ihrem eigenen Stack. Das bedeutet zusätzlichen Personal-, Policy- und Überwachungsaufwand – nicht automatisch weniger Arbeit.
Der wissenschaftlich interessante Teil
Die Ablehnung fällt nicht einheitlich auf null. Bei den vier schadensbezogenen Benchmarks bleibt sie zwischen 11 % und 18 %. OrcaRouters Interpretation lautet, dass ein Teil der Ausrichtung von GLM-5.3-Flash nicht durch eine einzelne lineare Ablehnungsrichtung vermittelt wird. Z.ai könnte also einen tieferen Ablehnungsmechanismus trainiert haben, als diese Technik normalerweise erreicht.
Das ist eine Behauptung über das Modellinnere. Sollte sie sich bestätigen, wäre sie bedeutsamer als der Checkpoint selbst.
Das übliche Modell der Abliterierung ist einfach: Ablehnung entspricht weitgehend einer Richtung im Aktivierungsraum; diese Richtung wird entfernt; das Ablehnungsverhalten bricht zusammen. Bei GLM-5.3-Flash führt der Eingriff zwar von 96 % auf 11 %, stoppt dort aber. Das deutet darauf hin, dass ein Teil der Ausrichtung in einer Form überlebt, die der Eingriff nicht erreicht.
Zwei Vorbehalte bleiben wichtig:
- Es handelt sich um die Interpretation des Labors zu seinem eigenen Ergebnis. Eine alternative Erklärung ist eine unvollständige Implementierung oder ein dabei entstandener Qualitätsverlust.
- Eine verbleibende Ablehnungsrate von 11 % bis 18 % ist kein Sicherheitsmerkmal. Ein Modell, das 15 % schädlicher Anfragen ablehnt, ist nicht sicher, sondern unzuverlässig.
Trotzdem ist die Aussage „Unsere Technik stieß an eine Grenze, und wir vermuten einen architektonischen Grund“ ungewöhnlich wertvoll. Ein negativer Interpretierbarkeitsbefund ist oft informativer als ein weiterer unzensierter Checkpoint.
Behauptungen, die Sie selbst prüfen sollten
„Intelligenz auf Claude-Opus-4.8-Niveau“
Ein Folgebeitrag beschrieb die Veröffentlichung als Werkzeug mit Intelligenz auf diesem Niveau. Ein Benchmark begleitete diese Aussage nicht, und der Vergleich bezieht sich nicht auf die aktuelle Opus-Generation. Behandeln Sie ihn als Marketing. Wenn Leistungsparität für Ihren Anwendungsfall wichtig ist, führen Sie eine eigene Evaluation durch.
Ablehnungsraten sind kein Fähigkeitsproxy
Eine niedrige Ablehnungsrate bedeutet keine hohe Fähigkeit. Abliterierung ist eine Verhaltensänderung und kann mit allgemeiner Degradation einhergehen. Keine der beiden Ankündigungen beantwortet, ob sich Denk-, Code- oder Sehfähigkeiten gegenüber dem Basismodell verändert haben.
Für Vergleichswerte zum unmodifizierten Modell siehe GLM-5.3-Flash-Preise und den GLM-5.3-Flash API-Leitfaden.
Betrieb und Hardware
320B Parameter machen GLM-5.3-Flash auch mit 18B aktiven Parametern nicht zu einem Laptop-Modell. Das Format bestimmt, wer den Checkpoint realistisch betreiben kann:
- **Block-FP8 Quantisierung für leistungsfähige Workstations
- MLX: Apple Silicon mit sehr großer Unified-Memory-Konfiguration
Für Self-Hosting gelten die Anleitungen zum Basismodell weiterhin: GLM-5.3-Flash lokal ausführen und GLM-5.3 Open Weights selbst hosten.
Weitere Vergleiche finden Sie in der Übersicht unzensierter LLMs, bei LLMs ohne Einschränkungen und in der früheren abliterierten DeepSeek-R1-Veröffentlichung.
Die Evaluation ist ein API-Testproblem
Wenn Sie mit einem solchen Modell legitime Sicherheitsforschung, Red- und Blue-Team-Übungen oder eine defensive Filterbewertung durchführen, besteht die eigentliche Arbeit aus einer großen, wiederholbaren Anfrage-Suite. Das ist API-Testing – auch dann, wenn die Antwort ein Modelltext ist.
1. Dieselbe Suite für alle Ziele
Testen Sie FP8, NVFP4, GGUF, das unmodifizierte Basismodell und gegebenenfalls einen gehosteten Endpunkt mit denselben Anfragen. Wechseln Sie nur die Basis-URL oder Umgebung. Andernfalls schreiben Sie Unterschiede möglicherweise der Quantisierung statt dem Sampling oder dem Checkpoint zu.
2. Behauptungen statt Augenmaß
Eine Ablehnungsrate ist ein Prozentsatz über viele Prompts. Einzelne Transkripte sind nützlich für die Diagnose, aber nicht als skalierbare Messung. Prüfen Sie strukturierte Antwortfelder und klassifizieren Sie Ergebnisse mit reproduzierbaren Regeln.
3. Regressionen ermöglichen
Gewichte und Quantisierungen werden neu veröffentlicht. Eine einmal gemessene Zahl ist später nur dann zitierfähig, wenn Sie Suite, Checkpoint, Format, Sampling-Parameter und Laufzeitumgebung speichern und erneut ausführen können.
4. Nichtdeterminismus berücksichtigen
Derselbe Prompt kann unterschiedliche Vervollständigungen liefern. Prüfen Sie daher die Klassifizierung der Antwort statt String-Gleichheit und verwenden Sie ausreichend Stichproben, damit eine Rate statistisch aussagekräftig bleibt. Das Problem wird ausführlicher in Testen nichtdeterministischer KI-Agenten behandelt.
5. Tool-Aufrufe separat testen
Ein Modell, das Funktionsaufrufe unterstützt, hat ein anderes Risikoprofil, wenn es ein Tool aufruft, das es ablehnen sollte. Prüfen Sie daher neben Textantworten auch Tool-Namen, Argument-Schemata, Berechtigungen und Vertragsverletzungen.
Genau hier hilft eine API-Plattform. In Apidog können Sie:
- den Endpunkt einmal definieren,
- die Prompt-Suite als Collection speichern,
- Antwortfelder und Tool-Schemata prüfen,
- Basis-URLs über Umgebungsvariablen zwischen Anbietern und Quantisierungen wechseln,
- die Tests in CI ausführen.
Die Einrichtung aus Testen der GLM-5.3-Flash API mit Apidog funktioniert ebenso für andere OpenAI-kompatible Endpunkte. Wenn Ihre Evaluation derzeit in einem Notizbuch lebt, das niemand reproduzierbar ausführen kann, können Sie Apidog herunterladen. Das Prinzip gilt auch für Produktions-KI-Agenten-Zuverlässigkeit.
Red-Team-Arbeit benötigt einen Audit-Trail
Das Ausführen von Benchmarks mit schädlichen Prompts gegen ein abliteriertes Modell muss vorab genehmigt und anschließend nachvollziehbar sein:
- Wer hat den Test ausgeführt?
- Gegen welchen Checkpoint?
- Mit wessen Genehmigung?
- In welchem Umfang?
- Auf welcher Hardware?
- Mit welchen Ergebnissen?
Wenn diese Informationen nur in der Shell-Historie einer einzelnen Person stehen, handelt es sich nicht um ein belastbares Forschungsprogramm.
Sharkly passt zu diesem Anwendungsfall, weil die Arbeit über eine einzelne Sitzung hinaus dokumentiert werden muss:
- Eine Aufgabe im Backlog startet keinen Lauf automatisch. Sensible Bewertungen werden vorbereitet, abgegrenzt und genehmigt, bevor sie ausgeführt werden.
- Die Aufgabe ist der Datensatz: Fortschritt, Tool-Aufrufe und Ergebnisse fließen dorthin zurück. Agentenausgaben bleiben als beantwortbare Kommentare erhalten.
- Ein Team kann aus Leader-Agent, weiteren Agenten und Personen bestehen. Ein Prüfer im Loop ist für Red-Team-Arbeit normal.
- Die Ausführung folgt dem „Bring Your Own“-Modell. Sie verbinden einen Laptop, Server oder Container mit der bereits installierten Runtime.
- Bei einem 320B-Modell ist die konkrete GPU-Box ein Teil der Kontrolle. Die explizite Dokumentation der ausführenden Maschine ist kein unnötiger Overhead.
- Bereiche, Projekte, Sprints, Aufgaben und Jira-Synchronisation geben dem Team eine bekannte Struktur.
Ein unzensiertes Modell ist ein Forschungswerkzeug. Forschungswerkzeuge ohne Aufzeichnungen führen dazu, dass eine Organisation später nicht erklären kann, was ausgeführt wurde oder warum.
Rechtliche und sicherheitstechnische Realität
Die MIT-Lizenz regelt die Gewichte. Sie erlaubt nicht automatisch jede Nutzung der Ausgabe und überträgt keine Haftung auf den ursprünglichen Anbieter. Lokales Recht, Unternehmensrichtlinien und Plattformbedingungen gelten weiterhin.
Sinnvolle Anwendungsfälle sind insbesondere:
- Sicherheitsforschung
- Interpretierbarkeitsarbeit
- Red- und Blue-Team-Übungen
- Untersuchung von Ablehnungsmechanismen
- Evaluation eigener Filter
- Reduzierung gutartiger Überablehnung in internen Workflows
Wenn Sie einen unzensierten Checkpoint Endbenutzern bereitstellen, liegt die gesamte Filter- und Überwachungslast bei Ihrem eigenen Stack. Das ist eine Architekturentscheidung mit Personal- und Compliance-Folgen, kein einfaches Konfigurationsflag.
FAQ
Ist GLM-5.3-Flash-Uncensored dasselbe Modell wie GLM-5.3-Flash?
Architektur und Basisgewichte sind gleich: 320B Parameter, davon 18B aktiv. Das Ablehnungsverhalten wurde aus den Gewichten entfernt. Die Abdeckung des Basismodells finden Sie unter Was GLM-5.3-Flash ist.
Sind die Bewertungszahlen unabhängig verifiziert?
Nein. Alle Zahlen stammen von OrcaRouter. Zum Zeitpunkt der Erstellung gab es keine unabhängige Überprüfung durch Dritte. Die Benchmarks sind öffentlich, daher ist eine Replikation mit entsprechender Hardware möglich.
Welches Format sollte ich verwenden?
FP8 ist das Referenzartefakt und die Grundlage der veröffentlichten Evaluierungen. NVFP4 ist der praktische NVIDIA-Pfad für Einzelknoten. GGUF eignet sich für llama.cpp und Workstations, MLX für Apple Silicon. Da sich Verhalten und Qualität durch Quantisierung ändern können, sollten Sie jedes Format mit derselben Testsuite prüfen.
Beeinträchtigt Abliterierung die allgemeine Leistung?
Das ist möglich. Veröffentlichte Arbeiten finden im Allgemeinen eine gewisse Degradation, und OrcaRouter berichtet für diesen Checkpoint keine vollständige Evaluation von Denk-, Code- und Sehfähigkeiten. Vergleichen Sie den Build selbst mit dem Basismodell.
Warum stoppte die Ablehnung bei 11 % bis 18 % statt bei null?
OrcaRouters Erklärung ist, dass ein Teil der Ausrichtung nicht durch eine einzelne lineare Ablehnungsrichtung vermittelt wird. Die alternative Erklärung ist eine unvollständige Implementierung oder ein Qualitätsverlust. In beiden Fällen ist die Restquote kein Sicherheitsmerkmal.
Kann ich den Checkpoint kommerziell nutzen?
Die Gewichte sind MIT-lizenziert. Das beantwortet die Lizenzfrage, nicht automatisch die rechtliche oder politische Frage für Ihre konkrete Bereitstellung. Beziehen Sie Ihr Rechtsteam ein, insbesondere wenn Endbenutzer die Ausgabe sehen.
Fazit
OrcaRouter veröffentlichte innerhalb von drei Tagen zwei Formate für GLM-5.3-Flash-Uncensored; das erste erreichte mehr als zwei Millionen Aufrufe. GGUF und MLX erweitern inzwischen die verfügbaren Bereitstellungspfade. Die eigentliche Entzensurierung ist dabei weniger bemerkenswert als der negative Befund dahinter.
Eine Technik, die Ablehnungen bei vielen offenen Modellen stark reduziert, brachte GLM-5.3-Flash von 96 % auf 11 % und blieb dort. Wenn unabhängige Replikationen dieses Ergebnis bestätigen, sagt es etwas über die interne Darstellung der Ausrichtung in Z.ais Modell aus.
Wenn Sie den Checkpoint einsetzen, messen Sie systematisch:
- dieselbe Testsuite über alle Formate und Endpunkte,
- reproduzierbare Klassifizierungen statt einzelner Transkripte,
- Regressionstests für spätere Checkpoint- und Quantisierungsänderungen,
- getrennte Prüfungen für Text- und Tool-Aufrufe,
- einen Audit-Trail für Genehmigung, Hardware, Checkpoint und Ergebnisse.
Ein unzensiertes Modell entbindet Sie nicht von der Pflicht zu wissen, was Sie ausgeführt haben. Es erhöht sie.




Top comments (0)