El ecosistema actual de agentes autónomos y servidores MCP (Model Context Protocol) es brillante, pero operativamente es una pesadilla de seguridad. Estamos construyendo sistemas que ejecutan código, acceden a bases de datos y toman decisiones críticas basándose en salidas de texto que son intrínsecamente manipulables.
Si estás desplegando agentes en producción confiando únicamente en que el modelo "se portará bien" gracias a su System Prompt, estás completamente desprotegido.
Para solucionar esto, he desarrollado un framework de defensa en profundidad distribuido en 4 capas críticas. No se trata de teoría académica; son sensores deterministas y dinámicos listos para producción.
🏗️ Las 4 Capas del Ecosistema de Seguridad.
Capa 1: Sanitización de Entrada y Control de Estímulos (Ingress).
El ataque empieza antes de que el modelo procese el token. Necesitamos interceptar vectores maliciosos tanto en texto como en medios visuales.
hermes-shield: Un sanitizador de entrada anti prompt-injection que opera en 5 capas secuenciales para neutralizar instrucciones hostiles ocultas.
vision-injection-guard: Un sensor determinista diseñado para procesadores VLM. Detecta texto malicioso inyectado visualmente en imágenes antes de que el modelo de lenguaje lo interprete.
corpus-scrub: Herramienta de prevención de fuga de datos. Detecta y redacta de forma automática PII (información personal identificable) y secretos en tus corpus de datos antes de entrenar o ajustar un LLM.
Capa 2: Pasarela de Control y Validación Física (Gateway & Sandbox).
Una vez que el agente está activo, no puede comunicarse directamente con el exterior sin un proxy que valide sus intenciones.
ai-guard-gateway: Una pasarela de seguridad profesional para endpoints expuestos. Implementa Rate Limiting, redacción de PII en tiempo real, detección de inyecciones y políticas OPA (Open Policy Agent).
seblight: Sovereign Execution Broker. Una autoridad basada en certificados criptográficos para autorizar la ejecución de comandos críticos emitidos por agentes autónomos.
Misdirection Proxy: Un desvío estratégico. Reduce la tasa de éxito de ataques (ASR) de un 20% a un rango de entre 0-2% devolviendo respuestas simuladas que confunden al atacante.
Capa 3: Monitoreo en Tiempo de Ejecución (Runtime Sensors).
Los agentes multi-paso necesitan evaluación continua entre cada llamada a herramientas (tool-calls).
agent-shield-runtime: Un hook de despliegue que intercepta cada llamada a herramientas del agente y la evalúa dinámicamente contra 5 sensores clave:
scope-lib: Evaluación del alcance de la tarea bajo 3 criterios estrictos.
adi-shield: Detección de inyección en 5 vectores dinámicos.
wallet-guard: Guardrails financieros y bucles infinitos de presupuesto.
goal-anchor: Verificación de la integridad del objetivo original del usuario.
trajectory-sentinel: Correlación de señales de defensa a lo largo de la sesión.
cross-session-memory-guard: Un sensor de lectura (read-only) que vigila la exfiltración de memoria entre sesiones en entornos multi-inquilino (multi-tenant). Compara, observa y alerta sin alterar el estado del modelo.
Capa 4: Defensa del Ecosistema de Herramientas y Datos (MCP & Supply Chain).
Los agentes son tan seguros como las herramientas (tools) que se les permiten usar. El envenenamiento de esquemas es el nuevo vector de ataque.
mcp-schema-sentinel: Sensor que mitiga ataques de tool-poisoning o rug-pulls en servidores MCP. Alerta mediante hashing determinista si la descripción o el esquema de una herramienta de confianza cambia silenciosamente en caliente.
skill-auditor: Herramienta de auditoría para colecciones de habilidades de agentes. Clasifica cada habilidad en lenguaje natural y busca referencias rotas o secretos hardcodeados.
🛠️ Validación Científica y Enfoque Post-Hoc.
Ninguna arquitectura de seguridad está completa sin métricas de confianza calibradas. Parte de este framework incluye capas de validación avanzada como dock-confidence y flood-confidence, que aplican Conformal Prediction y estimaciones post-hoc para garantizar que los modelos hidrológicos o de descubrimiento de fármacos operen bajo rangos de incertidumbre matemáticamente rigurosos, evitando alucinaciones estadísticas.
🚀 Únete a la Resilencia Open Source.
Todo este ecosistema está construido bajo licencias libres y con un enfoque CPU-only, optimizado para ejecutarse localmente sin depender de infraestructuras costosas de GPU.
Si estás desplegando agentes autónomos, la era de la ingenuidad se ha terminado. Protege tu stack.
👉 Revisa la arquitectura completa en: https://github.com/amurlaniakea
Top comments (0)