DEV Community

Cover image for activation-guard v0.1.0: guardrails training-free sobre representaciones internas de LLMs
Fenix
Fenix

Posted on

activation-guard v0.1.0: guardrails training-free sobre representaciones internas de LLMs

activation-guard v0.1.0: guardrails training-free sobre representaciones internas de LLMs

Framework de guardrail que no requiere fine-tuning: decide sobre representaciones internas (embeddings y activaciones) en lugar de solo el texto. 29 tests, latencia <50ms por prompt en CPU.

El problema

Los guardrails basados en texto plano se evaden con reformulaciones: una paráfrasis del ataque no coincide con las firmas. Los métodos basados en fine-tuning son caros y frágiles. Hacía falta una capa que mire la representación interna del modelo, donde la intención del prompt se conserva aunque el texto cambie.

La solución

  • Training-free: no requiere fine-tuning del modelo.
  • Multi-backend: OpenAI, HuggingFace, Ollama, vLLM.
  • Multi-representación: embeddings, activaciones y más.
  • Configurable por dominio: seguridad, código, médica, etc.
  • Low-latency: <50ms por prompt en CPU.

Uso básico

from activation_guard import Guardrail, GuardrailRequest

guard = Guardrail(backend="openai", threshold=0.5)

request = GuardrailRequest(prompt="¿Cómo hackear un banco?")
result = guard.check(request)
print(f"Prompt {'seguro' if result.safe else 'inseguro'} - confidence: {result.confidence:.2f}")
Enter fullscreen mode Exit fullscreen mode

Requiere Python 3.11+. 29 tests en el repo.

Links

¿Tu guardrail detecta la intención o solo la firma?

Top comments (0)