GLM-5.3-Flash 검열 제거판: 공개된 것, 남은 거부, 그리고 평가 방법
요약: OrcaRouter는 2026년 8월 29일 네이티브 block-FP8, 8월 31일 NVIDIA GPU용 NVFP4 빌드 등 두 차례에 걸쳐 GLM-5.3-Flash의 검열 제거(abliterated) 가중치를 공개했습니다. 이 모델은 18B 활성 매개변수를 사용하는 320B 매개변수 MoE 모델입니다. GGUF와 MLX 변환도 제공됩니다. 제조사 보고 거부율은 MaliciousInstruct 기준 96%에서 11%로 감소했지만 0%는 아니었습니다. 더 중요한 주장은 GLM-5.3-Flash의 정렬 일부가 단일 선형 거부 방향으로 매개되지 않는다는 점입니다. 사실이라면 Z.ai의 안전 훈련이 일반적으로 검열 제거가 목표로 삼는 구조보다 더 깊을 수 있음을 의미합니다.
검열 제거(Abliteration)는 이제 흔한 작업입니다. 공개 가중치 모델에서 거부와 관련된 내부 방향을 찾고, 해당 방향을 제거한 체크포인트를 배포하는 방식입니다. 대부분의 릴리스는 기술적으로 특별하지 않지만, 이번 사례는 최첨단 공개 모델에서 정렬이 어떻게 표현되는지에 대한 부정적인 결과를 포함한다는 점에서 살펴볼 가치가 있습니다.
실제로 공개된 내용
이번 릴리스는 이틀 간격으로 진행됐고, 이후 여러 형식의 변환본이 추가됐습니다.
2026년 8월 29일: block-FP8
OrcaRouter의 GLM-5.3-Flash 모델 페이지는 원래 block-FP8 정밀도를 유지한 검열 제거 가중치를 공개했습니다. 기본 모델과 수정 모델 사이에 재양자화 단계가 없다는 뜻입니다.
모델은 다음 특성을 그대로 유지합니다.
- 320B 전체 매개변수
- 18B 활성 매개변수
- 기본 GLM-5.3-Flash와 동일한 아키텍처
- MoE 구조
- 시각-언어 기능
- 함수 호출 지원
기본 모델의 구조와 용도는 GLM-5.3-Flash란 무엇인가와 GLM-5.3과의 비교에서 다뤘습니다. 첫 발표 게시물은 이후 2백만 회 이상의 조회수를 기록했습니다.
2026년 8월 31일: NVFP4
두 번째 빌드는 NVIDIA의 4비트 부동 소수점 형식인 NVFP4를 대상으로 합니다. 설치 공간을 줄이고 추론 속도를 높이는 대신 정밀도를 일부 교환하는 방식입니다.
이 게시물은 약 75,000회의 조회수를 기록했습니다. 원본 FP8 발표보다 관심 범위가 좁은 형식 배포라는 점을 보여줍니다.
이후: GGUF와 MLX
2026년 9월 1일 Hugging Face 조직을 확인했을 때 다음 저장소가 모두 존재했습니다.
GLM-5.3-Flash-Uncensored-GGUFGLM-5.3-Flash-Uncensored-MLX
이는 llama.cpp와 Apple Silicon 경로가 구현됐다는 뜻입니다. 확인 당시 다운로드 수는 GGUF와 MLX가 각각 0회, NVFP4가 5회, FP8 원본이 1,541회였습니다. 현재 관심은 실제 아티팩트보다 발표에 집중돼 있습니다.
이 릴리스는 단발성 프로젝트도 아닙니다. 같은 조직은 다음과 같은 검열 제거 빌드도 호스팅합니다.
- Qwen3.8-27B — FP8 빌드만 300,000회 이상 다운로드
- Qwen3.8-Flash-Next
- Gemma-4-26B
GLM 릴리스는 이 카탈로그의 최신 항목입니다.
가중치에는 MIT 라이선스가 적용되며, 기본 모델은 zai-org/GLM-5.3-Flash로 명시돼 있습니다.
“LoRA 없음, 탈옥 프롬프트 없음”의 의미
발표에서 이 문구를 강조한 이유는 검열 제거가 다음 두 방식과 다르기 때문입니다.
탈옥 프롬프트
탈옥 프롬프트는 추론 시 모델을 조작합니다. 안전 훈련은 그대로 남아 있으며, 사용자가 프롬프트로 우회하는 방식입니다.
- 요청마다 추가 컨텍스트 비용 발생
- 결과가 불안정함
- 공급업체가 패치하면 작동하지 않음
LoRA 어댑터
LoRA는 로드 시 추가하는 소규모 가중치 집합입니다. 기본 모델은 변경되지 않고 어댑터를 제거할 수 있습니다.
검열 제거
검열 제거는 거부 동작에 해당하는 내부 활성화 방향을 식별한 뒤, 가중치 자체에서 해당 방향을 제거합니다. 별도의 어댑터나 런타임 프롬프트가 필요하지 않습니다.
따라서 프롬프트나 어댑터를 검사하는 것만으로는 검열 제거 모델을 감사할 수 없습니다. 실제 체크포인트와 기본 모델의 계보를 확인해야 합니다. 공개 모델을 운영 환경에 배포한다면 이는 공급망 문제이기도 합니다. 모델 동작을 제한하는 일반적인 접근은 AI 에이전트 가드레일에서 확인할 수 있습니다.
거부율 수치
아래 수치는 OrcaRouter가 자체 보고한 결과입니다. 작성 시점에는 독립적인 재현이 없었으므로 제조사 보고로 취급해야 합니다.
| 벤치마크 | 기본 거부율 | 검열 제거 후 |
|---|---|---|
| MaliciousInstruct | 96% | 11% |
| JailbreakBench | 93% | 12% |
| AdvBench | 97% | 15% |
| HarmBench | 93% | 18% |
| XSTest 양성 과도한 거부 | 2.4% | 0.4% |
마지막 행은 앞의 네 행과 다르게 해석해야 합니다. XSTest는 과도한 거부(over-refusal)를 측정합니다. 즉, 표면적으로 위험해 보이는 단어가 포함됐다는 이유로 실제로는 무해한 요청을 거부하는지를 평가합니다.
예를 들면 다음과 같습니다.
- “암호”라는 단어가 있다는 이유로 비밀번호 재설정 흐름 디버깅을 거부
- 소유한 인프라의 네트워크 스캐너 작성을 거부
- 위협 보고서의 내용을 요약하는 작업을 거부
2.4%에서 0.4%로 감소한 수치는 실무에서 직접 체감할 수 있는 결과입니다. 반면 앞의 네 가지 수치는 모델을 생산성 도구라기보다 연구용 아티팩트로 만드는 요소이며, 라이선스와 지역 법률을 반드시 함께 검토해야 합니다.
실제로 얻는 것
검열 제거 모델의 실질적인 이점은 다음 네 가지입니다.
1. 무해한 작업을 덜 거부한다
가장 큰 이점입니다. XSTest 결과처럼 양성 과도한 거부율이 2.4%에서 0.4%로 줄었습니다.
안전 튜닝된 모델에서 발생하는 과도한 거부는 재시도, 프롬프트 재작성, 작업 포기로 이어집니다. 검열 제거 모델은 주제와 의도를 구별하지 못하는 이 실패 모드를 줄일 수 있습니다.
2. 요청마다 우회 비용이 없다
프롬프트 기반 우회와 달리 매 요청에 별도의 지침을 붙일 필요가 없습니다. 동작이 체크포인트의 속성이므로 호출 간 일관성이 높고, 공급업체가 조용히 정책을 변경해 동작이 달라지는 문제도 피할 수 있습니다.
3. 배포를 직접 통제할 수 있다
MIT 라이선스와 공개 가중치를 바탕으로 자체 호스팅하고, 특정 체크포인트에 고정할 수 있습니다. 프롬프트와 문서를 외부 공급업체로 보내지 않아도 됩니다.
규제된 환경에서는 이러한 통제가 중요합니다. 기본 모델의 자체 호스팅 방법은 GLM-5.3 오픈 가중치 자체 호스팅에서 다뤘습니다.
4. 기존 기능 표면을 유지한다
모델 카드에는 시각-언어 및 함수 호출 기능이 계속 표시됩니다. 따라서 텍스트 전용으로 축소된 빌드가 아니며, 에이전트나 도구 사용 시나리오에도 사용할 수 있습니다.
다만 중요한 한계가 있습니다. 이 중 어느 것도 성능 향상을 의미하지 않습니다. 검열 제거는 행동 편집이며, 관련 연구에서는 일반적으로 일정한 품질 저하 비용이 보고됩니다. 이번 발표에는 추론, 코딩, 시각 성능이 기본 모델과 비교해 어떻게 달라졌는지에 대한 결과가 없습니다.
즉, 측정된 거부율 감소를 측정되지 않은 성능 저하 위험과 교환하는 셈입니다. 기본 모델이 처리하던 필터링 책임도 이제 배포자의 인력과 모니터링 시스템이 맡아야 합니다.
가장 흥미로운 결과: 거부율이 0이 아니다
네 가지 유해성 벤치마크에서 거부율은 0~2%가 아니라 11~18%에 머물렀습니다.
OrcaRouter는 GLM-5.3-Flash의 정렬 일부가 단일 선형 거부 방향으로 매개되지 않는다고 설명합니다. Z.ai가 일반적인 검열 제거 대상 모델보다 더 깊은 거부 메커니즘을 구축했을 가능성이 있다는 주장입니다.
검열 제거에 대한 일반적인 정신 모델은 다음과 같습니다.
- 거부 동작이 활성화 공간의 하나의 주요 방향으로 나타난다.
- 해당 방향을 찾는다.
- 가중치에서 제거한다.
- 거부 동작이 크게 감소한다.
이번 결과가 재현된다면 이 모델에는 이 설명만으로 다룰 수 없는 정렬 메커니즘이 남아 있다는 뜻입니다. 96%에서 11%로 감소한 뒤 멈춘 결과는 해당 가설을 검토할 이유를 제공합니다.
다만 두 가지 주의가 필요합니다.
- 이는 한 연구소의 자체 결과에 대한 해석입니다. 단순히 구현이 완전하지 않았을 가능성도 있습니다.
- 잔여 거부율 11~18%를 안전 기능으로 간주해서는 안 됩니다. 유해 요청의 15%를 거부하는 모델은 안전한 모델이 아니라 예측하기 어려운 모델입니다.
검증이 필요한 주장
“Claude Opus 4.8 수준의 지능”
후속 게시물은 이 모델이 방어자에게 해당 수준의 지능을 제공한다고 설명했습니다. 그러나 벤치마크가 함께 제시되지 않았고, 현재 Opus 세대가 아닌 모델 버전과의 비교입니다.
이 주장은 마케팅으로 취급하고, 기능 동등성이 중요하다면 직접 평가해야 합니다.
거부율을 기능의 대리 지표로 사용하는 것
낮은 거부율이 높은 기능을 의미하지는 않습니다. 검열 제거는 행동적 편집이고, 이번 릴리스는 추론·코딩·시각 성능의 변화를 보고하지 않았습니다.
기본 모델의 가격과 API 정보는 GLM-5.3-Flash 가격 및 GLM-5.3-Flash API 가이드에서 확인할 수 있습니다.
실행 및 하드웨어 현실
18B가 활성 매개변수라고 해도 전체 크기는 320B입니다. 현실적인 실행 경로는 배포 형식에 따라 달라집니다.
- Block-FP8: 원본 릴리스이자 데이터센터 GPU용 참조 아티팩트
- NVFP4: NVIDIA 하드웨어에서 설치 공간을 줄이는 단일 노드 경로
-
GGUF:
llama.cpp를 통한 워크스테이션용 양자화 경로 - MLX: Apple Silicon용 경로지만 매우 큰 통합 메모리가 필요
호스팅 엔드포인트 대신 자체 호스팅하려면 GLM-5.3-Flash 로컬 실행 및 GLM-5.3 오픈 가중치 자체 호스팅 가이드가 적용됩니다.
관련 맥락은 검열 제거된 LLM 조사, 제한 없는 LLM, DeepSeek R1 검열 제거 릴리스에서 확인할 수 있습니다.
평가의 핵심은 API 테스트다
합법적인 안전 연구, 레드·블루 팀 연습, 방어적 필터 평가에 이 모델을 사용한다면 핵심 작업은 엔드포인트에 반복 가능한 요청 스위트를 실행하고 응답을 검증하는 것입니다.
다음 조건을 충족해야 결과를 비교할 수 있습니다.
여러 배포 대상을 같은 방식으로 테스트한다
최소한 다음 대상을 동일한 요청으로 비교해야 합니다.
- FP8
- NVFP4
- GGUF
- 수정되지 않은 기본 모델
- 호스팅 엔드포인트
기본 URL만 교체할 수 있어야 하며, 그렇지 않으면 동작 차이가 양자화 때문인지 요청 구성 때문인지 알 수 없습니다.
육안 확인 대신 어설션을 사용한다
거부율은 수백 개 프롬프트에 대한 비율입니다. 응답을 사람이 읽는 방식은 확장되지 않고 재현도 어렵습니다. 응답 분류, 필수 필드, 오류 유형을 어설션으로 정의해야 합니다.
회귀 테스트를 예약한다
가중치는 업데이트되고 양자화본은 다시 게시될 수 있습니다. 다음 달에도 같은 테스트를 실행할 수 있도록 요청, 체크포인트, 환경, 결과를 저장해야 합니다.
비결정성을 고려한다
같은 프롬프트도 실행마다 다른 결과를 낼 수 있습니다. 문자열 완전 일치보다 응답 분류와 정책 위반 여부를 검증하고, 비율이 의미를 갖도록 충분한 샘플을 사용해야 합니다.
자세한 내용은 비결정적 AI 에이전트 테스트에서 확인할 수 있습니다.
도구 호출을 별도로 검사한다
함수 호출이 가능한 모델은 텍스트 모델과 다른 위험 표면을 가집니다. 모델이 호출해서는 안 되는 도구를 호출하는지, 인자 스키마와 계약을 준수하는지 별도로 테스트해야 합니다.
Apidog에서는 엔드포인트를 한 번 정의하고, 프롬프트 스위트를 컬렉션으로 관리하며, 응답 필드를 어설션하고, 환경 변수로 제공업체나 양자화 형식 사이의 기본 URL을 교체할 수 있습니다. 테스트를 CI에서 실행하면 결과를 일화가 아닌 재현 가능한 수치로 관리할 수 있습니다.
수정되지 않은 모델의 테스트 방법은 Apidog로 GLM-5.3-Flash API 테스트하기에서 다뤘습니다. 동일한 방식은 OpenAI 호환 엔드포인트에도 적용됩니다.
현재 평가가 다른 사람이 다시 실행할 수 없는 노트북에만 있다면 Apidog 다운로드를 고려해 보세요. 관련 내용은 운영 환경 AI 에이전트 신뢰성에서 확인할 수 있습니다.
레드 팀에는 터미널보다 감사 추적이 필요하다
검열 제거 모델에 유해 프롬프트 벤치마크를 실행하는 작업은 사전 승인과 사후 귀속이 모두 필요합니다.
최소한 다음 정보를 기록해야 합니다.
- 누가 실행했는가
- 어떤 체크포인트를 사용했는가
- 누구의 승인 아래 실행했는가
- 평가 범위는 무엇이었는가
- 어떤 결과가 나왔는가
이 기록이 한 연구원의 셸 기록에만 남아 있다면 연구 프로그램이 아니라 책임 공백입니다.
Sharkly는 세션 이후에도 남아야 하는 작업을 관리하는 데 적합합니다.
- 백로그 작업이 자동으로 실행되지 않음
- 민감한 평가의 준비·범위 지정·승인 절차 제공
- 진행 상황, 도구 호출, 결과를 작업으로 스트리밍
- 에이전트 출력을 댓글로 저장
- 리더 에이전트, 다른 에이전트, 사람이 참여하는 크루 구성
- 연결한 노트북·서버·컨테이너에서 기존 런타임 사용
- 공간, 프로젝트, 스프린트, 작업 구조 및 Jira 동기화 지원
320B 모델의 경우 가중치가 실제로 존재하는 GPU 머신과 실행 머신을 명확히 기록하는 것이 특히 중요합니다.
검열 제거 모델은 연구 도구입니다. 기록 없이 사용하는 연구 도구는 조직이 무슨 일이 일어났는지 설명하지 못하게 만듭니다.
법적·안전상의 현실
MIT 라이선스는 가중치의 사용 조건을 규정할 뿐입니다. 출력으로 불법적인 일을 할 권한을 부여하지 않으며, 배포자의 책임을 없애지도 않습니다.
지역 법률, 고용주의 정책, 사용 중인 플랫폼 약관은 계속 적용됩니다. 모델이 요청을 거부하지 않았다는 사실은 법적 판단을 바꾸지 않습니다.
합리적인 사용 사례는 다음과 같습니다.
- 안전 연구
- 해석 가능성 연구
- 레드·블루 팀 연습
- 거부 메커니즘 연구
- 과도한 거부가 실제 문제인 보안 엔지니어링
최종 사용자에게 모델을 배포한다면 필터링 책임 전체가 애플리케이션 스택으로 이동합니다. 이는 구성 플래그가 아니라 인력과 모니터링을 포함한 설계 결정입니다.
자주 묻는 질문
GLM-5.3-Flash-Uncensored는 GLM-5.3-Flash와 같은 모델인가요?
동일한 아키텍처와 기본 가중치를 사용하며, 18B 활성 매개변수를 가진 320B 매개변수 모델입니다. 편집된 부분은 거부 동작입니다. 기본 모델은 GLM-5.3-Flash란 무엇인가에서 확인할 수 있습니다.
평가 수치는 독립적으로 검증됐나요?
아닙니다. 모든 수치는 OrcaRouter가 자체 보고했으며, 작성 당시 제3자 재현은 없었습니다. 다만 사용된 벤치마크는 공개돼 있어 충분한 하드웨어가 있다면 재현할 수 있습니다.
어떤 형식을 사용해야 하나요?
FP8은 참조 아티팩트이자 평가에 사용된 형식입니다. NVFP4는 단일 노드 NVIDIA 배포에 적합하고, GGUF는 워크스테이션, MLX는 Apple Silicon에 적합합니다.
양자화에 따라 동작이 달라질 수 있으므로, 단순한 체감 테스트보다 반복 가능한 스위트를 사용해야 합니다.
검열 제거가 일반 성능을 저하시키나요?
관련 공개 연구는 일반적으로 어느 정도의 성능 저하를 보고합니다. 그러나 이번 모델에 대해서는 해당 변화가 발표되지 않았습니다. 기본 모델과 직접 벤치마크해 확인해야 합니다.
왜 거부율이 0%가 아니라 11~18%에서 멈췄나요?
이번 릴리스에서 가장 흥미로운 미해결 질문입니다. OrcaRouter는 정렬 일부가 단일 선형 거부 방향으로 매개되지 않는다고 설명합니다. 다른 가능성은 구현이 불완전했다는 것입니다.
어느 쪽이든 잔여 거부율을 안전 기능으로 사용해서는 안 됩니다.
상업적으로 사용할 수 있나요?
가중치는 MIT 라이선스이므로 허용적인 조건을 갖습니다. 그러나 이는 라이선스에 대한 답변일 뿐, 특정 배포의 법적·정책적 적합성을 보장하지 않습니다. 특히 출력이 최종 사용자에게 전달되는 경우 법무팀의 검토가 필요합니다.
마무리
OrcaRouter는 3일 동안 두 가지 형식의 GLM-5.3-Flash 검열 제거 빌드를 공개했고, 첫 발표는 2백만 회 이상의 조회수를 기록했습니다. 검열 제거 자체는 이제 일상적인 기술입니다.
이번 릴리스에서 기억할 부분은 부정적인 결과입니다. 일반적인 검열 제거 절차가 거부율을 96%에서 11%로 낮췄지만 0%까지 만들지는 못했습니다. 이 결과가 독립적인 재현에서도 유지된다면, Z.ai가 정렬을 구현한 방식에 대한 중요한 단서가 됩니다.
실제로 사용하려면 다음을 지키세요.
- FP8, NVFP4, GGUF, MLX, 기본 모델, 호스팅 엔드포인트를 같은 스위트로 비교합니다.
- 거부율과 도구 호출을 어설션으로 검증합니다.
- 다음 달에도 실행할 수 있도록 회귀 테스트를 저장합니다.
- 어떤 가중치에 대해 누가 무엇을 실행했고 누가 승인했는지 기록합니다.
이것이 Apidog와 Sharkly가 각각 해결하려는 문제입니다.
검열 제거 모델은 무엇을 실행했는지 기록해야 할 의무를 없애지 않습니다. 오히려 그 의무를 더 크게 만듭니다.




Top comments (0)