DEV Community

Cover image for 🛡️ Arquitectura de Defensa para Agentes de IA: Cómo asegurar tus LLMs contra Prompt Injection, Tool-Poisoning y Fugitividad.
Fenix
Fenix

Posted on

🛡️ Arquitectura de Defensa para Agentes de IA: Cómo asegurar tus LLMs contra Prompt Injection, Tool-Poisoning y Fugitividad.

El ecosistema actual de agentes autónomos y servidores MCP (Model Context Protocol) es brillante, pero operativamente es una pesadilla de seguridad. Estamos construyendo sistemas que ejecutan código, acceden a bases de datos y toman decisiones críticas basándose en salidas de texto que son intrínsecamente manipulables.

Si estás desplegando agentes en producción confiando únicamente en que el modelo "se portará bien" gracias a su System Prompt, estás completamente desprotegido.

Para solucionar esto, he desarrollado un framework de defensa en profundidad distribuido en 4 capas críticas. No se trata de teoría académica; son sensores deterministas y dinámicos listos para producción.

🏗️ Las 4 Capas del Ecosistema de Seguridad.


Capa 1: Sanitización de Entrada y Control de Estímulos (Ingress).


El ataque empieza antes de que el modelo procese el token. Necesitamos interceptar vectores maliciosos tanto en texto como en medios visuales.

hermes-shield: Un sanitizador de entrada anti prompt-injection que opera en 5 capas secuenciales para neutralizar instrucciones hostiles ocultas.

vision-injection-guard: Un sensor determinista diseñado para procesadores VLM. Detecta texto malicioso inyectado visualmente en imágenes antes de que el modelo de lenguaje lo interprete.

corpus-scrub: Herramienta de prevención de fuga de datos. Detecta y redacta de forma automática PII (información personal identificable) y secretos en tus corpus de datos antes de entrenar o ajustar un LLM.

Capa 2: Pasarela de Control y Validación Física (Gateway & Sandbox).


Una vez que el agente está activo, no puede comunicarse directamente con el exterior sin un proxy que valide sus intenciones.

ai-guard-gateway: Una pasarela de seguridad profesional para endpoints expuestos. Implementa Rate Limiting, redacción de PII en tiempo real, detección de inyecciones y políticas OPA (Open Policy Agent).

seblight: Sovereign Execution Broker. Una autoridad basada en certificados criptográficos para autorizar la ejecución de comandos críticos emitidos por agentes autónomos.

Misdirection Proxy: Un desvío estratégico. Reduce la tasa de éxito de ataques (ASR) de un 20% a un rango de entre 0-2% devolviendo respuestas simuladas que confunden al atacante.

Capa 3: Monitoreo en Tiempo de Ejecución (Runtime Sensors).


Los agentes multi-paso necesitan evaluación continua entre cada llamada a herramientas (tool-calls).

agent-shield-runtime: Un hook de despliegue que intercepta cada llamada a herramientas del agente y la evalúa dinámicamente contra 5 sensores clave:

scope-lib: Evaluación del alcance de la tarea bajo 3 criterios estrictos.

adi-shield: Detección de inyección en 5 vectores dinámicos.

wallet-guard: Guardrails financieros y bucles infinitos de presupuesto.

goal-anchor: Verificación de la integridad del objetivo original del usuario.

trajectory-sentinel: Correlación de señales de defensa a lo largo de la sesión.

cross-session-memory-guard: Un sensor de lectura (read-only) que vigila la exfiltración de memoria entre sesiones en entornos multi-inquilino (multi-tenant). Compara, observa y alerta sin alterar el estado del modelo.

Capa 4: Defensa del Ecosistema de Herramientas y Datos (MCP & Supply Chain).


Los agentes son tan seguros como las herramientas (tools) que se les permiten usar. El envenenamiento de esquemas es el nuevo vector de ataque.

mcp-schema-sentinel: Sensor que mitiga ataques de tool-poisoning o rug-pulls en servidores MCP. Alerta mediante hashing determinista si la descripción o el esquema de una herramienta de confianza cambia silenciosamente en caliente.

skill-auditor: Herramienta de auditoría para colecciones de habilidades de agentes. Clasifica cada habilidad en lenguaje natural y busca referencias rotas o secretos hardcodeados.

🛠️ Validación Científica y Enfoque Post-Hoc.

Ninguna arquitectura de seguridad está completa sin métricas de confianza calibradas. Parte de este framework incluye capas de validación avanzada como dock-confidence y flood-confidence, que aplican Conformal Prediction y estimaciones post-hoc para garantizar que los modelos hidrológicos o de descubrimiento de fármacos operen bajo rangos de incertidumbre matemáticamente rigurosos, evitando alucinaciones estadísticas.

🚀 Únete a la Resilencia Open Source.

Todo este ecosistema está construido bajo licencias libres y con un enfoque CPU-only, optimizado para ejecutarse localmente sin depender de infraestructuras costosas de GPU.

Si estás desplegando agentes autónomos, la era de la ingenuidad se ha terminado. Protege tu stack.

👉 Revisa la arquitectura completa en: https://github.com/amurlaniakea

Top comments (0)