activation-guard v0.1.0: guardrails training-free sobre representaciones internas de LLMs
Framework de guardrail que no requiere fine-tuning: decide sobre representaciones internas (embeddings y activaciones) en lugar de solo el texto. 29 tests, latencia <50ms por prompt en CPU.
El problema
Los guardrails basados en texto plano se evaden con reformulaciones: una paráfrasis del ataque no coincide con las firmas. Los métodos basados en fine-tuning son caros y frágiles. Hacía falta una capa que mire la representación interna del modelo, donde la intención del prompt se conserva aunque el texto cambie.
La solución
- Training-free: no requiere fine-tuning del modelo.
- Multi-backend: OpenAI, HuggingFace, Ollama, vLLM.
- Multi-representación: embeddings, activaciones y más.
- Configurable por dominio: seguridad, código, médica, etc.
- Low-latency: <50ms por prompt en CPU.
Uso básico
from activation_guard import Guardrail, GuardrailRequest
guard = Guardrail(backend="openai", threshold=0.5)
request = GuardrailRequest(prompt="¿Cómo hackear un banco?")
result = guard.check(request)
print(f"Prompt {'seguro' if result.safe else 'inseguro'} - confidence: {result.confidence:.2f}")
Requiere Python 3.11+. 29 tests en el repo.
Links
¿Tu guardrail detecta la intención o solo la firma?
Top comments (0)