hermes-shield v0.2.0: sanitizador de entrada anti prompt-injection en 5 capas
Sanitizador de entrada para agentes de IA: protege contra prompt injection, exfiltración de datos, ejecución de comandos e ingeniería social. Funciona en 6 idiomas. 181 tests.
El problema
La entrada de un agente de IA es la superficie de ataque más barata: un mensaje externo bien construido puede reescribir el system prompt, exfiltrar datos o inducir ejecución de comandos. La defensa de una sola capa (firmas de texto) se evade con homoglifos, leetspeak, paráfrasis y urgencia fabricada.
La solución
Arquitectura de 5 capas en profundidad, con short-circuit para entradas limpias:
| Capa | Función | Latencia |
|---|---|---|
| 0 | Normalización (unicode, leetspeak, homoglifos, zero-width) + rate limiting | <1ms |
| 1 | Pattern matching (200+ firmas, 6 idiomas) | <5ms |
| 2 | Embeddings TF-IDF (detección de paráfrasis) | <10ms |
| 3 | Heurística de urgencia/presión (ingeniería social) | <1ms |
| 4 | Inspección estructurada de parámetros (SSRF, email injection) | <1ms |
Las entradas limpias solo pasan por las capas 0-1 (short-circuit). Las sospechosas reciben análisis completo. Idiomas: inglés, español, francés, alemán, italiano y portugués.
Aclaración de marca: Hermes Shield es un proyecto open source independiente. No está afiliado ni respaldado por Nous Research. Por su arquitectura de middleware agnóstica, es compatible con Hermes Agent y con cualquier otro framework de agentes.
Uso básico
from hermes_shield import HermesShield
shield = HermesShield(sensitivity="medium")
result = shield.check(user_input)
Links
¿Qué capas de defensa hay entre la entrada de tu agente y su memoria?
Top comments (0)