Hace semanas empezaron a aparecer versiones "uncensored" del Qwen 3.8 27B. No son jailbreaks de prompt. No son fine-tunes hechos en GPUs de 80K dólares. Son algo mucho más elegante :
Abliteration.
Si trabajas con IA local, soberanía de datos o arquitectura de agentes, necesitas entender qué está pasando. No para usarlo a ciegas, sino para saber dónde traza la línea tu stack.
¿Qué es la abliteration?
Es cirugía de pesos, no reentrenamiento. Toma el modelo base, identifica matemáticamente la "dirección de rechazo" en su espacio de activaciones, y la ortogonaliza — es decir, la borra del mapa.
El resultado: el modelo físicamente ya no puede activar el mecanismo de rechazo. No es que te engañe con un prompt creativo. Es que la neurona que decía "no" dejó de existir.
Los cuatro pasos, sin humo:
- Correr prompts duales — un set "dañino" (que dispara rechazo) y uno "inofensivo" (que acepta). Se graban activaciones capa por capa.
- Calcular el vector de diferencia — la resta entre ambas medias revela la dirección exacta del rechazo en el espacio latente.
-
Ortogonalizar cada matriz de peso — se aplica
W' = W - r·(rᵀ·W)para que el modelo nunca pueda proyectar en esa dirección. - Validar — el build de JonathanColetti midió 100 prompts dañinos: el rechazo cayó de 98/100 a 12/100. Una reducción del 88%.
Cero gradient descent. Cero datos nuevos. Álgebra lineal pura sobre los pesos existentes.
El panorama actual: 4 builds en circulación
| Build | Publicador | Formato | Nota clave |
|---|---|---|---|
| Qwen3.8-27B-Uncensored-GGUF | JonathanColetti | GGUF Q2_K → Q8_0 | Más maduro y testeado. |
| Qwen3.8-abliterated | huihui-ai | GGUF + Ollama | Fácil de probar. |
| Qwen3.8-27B-Uncensored | orcarouter | GGUF + MLX nativo | El mejor para Apple Silicon (MTP incluido). |
| Qwen3.8-27B-AEON-ULTIMATE | AEON-7 | BF16 | Impracticable en <128 GB. |
Todos parten del mismo principio, pero difieren en el método de ablación (Heretic vs. direccional) y el formato de inferencia.
Lo que ganas, lo que pierdes
** Se mantiene intacto:**
- Capacidad de razonamiento (MMLU, ARC, HellaSwag sin cambios significativos).
- Ventana de contexto: 262K tokens.
- Visión y tool-use (la torre de visión no se toca).
** Se elimina permanentemente:**
- Los guardarraíles de seguridad. El modelo cumplirá instrucciones que el base rechazaría.
- La capa de alineación. Es irreversible.
** La responsabilidad es 100% tuya.** Cada model card lo deja claro: research-only, red teaming, interpretabilidad. No es para poner frente a usuarios finales sin filtros adicionales.
¿Cuándo tiene sentido usarlo?
No en producción pública. Pero sí en escenarios de soberanía IA donde necesitas:
- Red teaming local sin depender de APIs externas.
- Investigación de mecanismos de alineación (entender cómo funciona el rechazo ayuda a diseñar mejores guardarraíles).
- Análisis de seguridad donde un rechazo falso positivo bloquea el flujo de trabajo.
Veredicto
La abliteration no es un truco. Es una demostración de que la "seguridad" de un LLM no está en los datos de entrenamiento ni en los prompts de sistema: está en una dirección vectorial dentro de las matrices de peso. Y si sabes dónde apuntar, puedes eliminarla con una fórmula.
Top comments (0)