DEV Community

Cover image for hermes-shield v0.2.0: sanitizador de entrada anti prompt-injection en 5 capas
Fenix
Fenix

Posted on

hermes-shield v0.2.0: sanitizador de entrada anti prompt-injection en 5 capas

hermes-shield v0.2.0: sanitizador de entrada anti prompt-injection en 5 capas

Sanitizador de entrada para agentes de IA: protege contra prompt injection, exfiltración de datos, ejecución de comandos e ingeniería social. Funciona en 6 idiomas. 181 tests.

El problema

La entrada de un agente de IA es la superficie de ataque más barata: un mensaje externo bien construido puede reescribir el system prompt, exfiltrar datos o inducir ejecución de comandos. La defensa de una sola capa (firmas de texto) se evade con homoglifos, leetspeak, paráfrasis y urgencia fabricada.

La solución

Arquitectura de 5 capas en profundidad, con short-circuit para entradas limpias:

Capa Función Latencia
0 Normalización (unicode, leetspeak, homoglifos, zero-width) + rate limiting <1ms
1 Pattern matching (200+ firmas, 6 idiomas) <5ms
2 Embeddings TF-IDF (detección de paráfrasis) <10ms
3 Heurística de urgencia/presión (ingeniería social) <1ms
4 Inspección estructurada de parámetros (SSRF, email injection) <1ms

Las entradas limpias solo pasan por las capas 0-1 (short-circuit). Las sospechosas reciben análisis completo. Idiomas: inglés, español, francés, alemán, italiano y portugués.

Aclaración de marca: Hermes Shield es un proyecto open source independiente. No está afiliado ni respaldado por Nous Research. Por su arquitectura de middleware agnóstica, es compatible con Hermes Agent y con cualquier otro framework de agentes.

Uso básico

from hermes_shield import HermesShield

shield = HermesShield(sensitivity="medium")
result = shield.check(user_input)
Enter fullscreen mode Exit fullscreen mode

Links

¿Qué capas de defensa hay entre la entrada de tu agente y su memoria?

Top comments (0)