articulo-devto-auditoria-agentes
Cómo auditar agentes de IA y sistemas RAG antes de llevarlos a producción
Si tu equipo tiene agentes de IA ejecutando acciones reales — enviando emails, tocando bases de datos, llamando APIs de terceros — en algún momento alguien te va a preguntar: ¿cómo sabes que ese agente hace lo que debería, y solo eso?
La mayoría de equipos confunde "tener logs" con "tener una auditoría". No son lo mismo, y la diferencia importa mucho cuando un cliente enterprise, un inversor o un regulador te pide evidencia real.
Observabilidad no es lo mismo que auditoría
La observabilidad te dice qué está pasando ahora mismo. La auditoría te da evidencia verificable e inalterable de lo que pasó, para poder demostrarlo después ante quien lo pida. Necesitas las dos, pero solo la segunda te protege legalmente.
Qué debe cubrir una auditoría real de agentes LLM / RAG
- Seguridad del repositorio: secretos expuestos, dependencias vulnerables, patrones OWASP en el código que orquesta al agente.
- Prompts y system messages: qué instrucciones recibe el modelo y si alguien puede alterarlas sin control.
- Trazabilidad de acciones: cada llamada a herramientas, cada efecto secundario real (email enviado, pago ejecutado, registro modificado), con timestamp.
- Control de costes: qué gasta el agente por acción, y si hay límites que disparen una alerta antes de un sobrecoste.
- Puntos de control humano: qué acciones requieren aprobación antes de ejecutarse, y si ese control es real o solo teórico.
- Cumplimiento normativo: si operas en la UE, documentación de supervisión humana para el AI Act en sistemas de alto riesgo.
El error más común
Muchos equipos solo guardan el resultado final ("email enviado correctamente"), no el camino que llevó hasta ahí. Cuando algo sale mal, no hay forma de saber si el fallo estuvo en el prompt, en una herramienta externa, o en una decisión del propio modelo — porque esa parte nunca quedó registrada.
Checklist abierto
He publicado un checklist completo y de uso libre en GitHub, cubriendo seguridad, trazabilidad, control humano, costes y cumplimiento AI Act:
👉 github.com/tradeayoub98-ops/checklist-auditoria-agentes-ia
Contribuciones y sugerencias son bienvenidas vía issues o pull requests.
Automatizándolo
Si tu equipo quiere automatizar buena parte de estas comprobaciones en vez de hacerlas a mano, en DatotecAudit construimos exactamente esto: auditoría de seguridad del repo, trazabilidad forense con hash de integridad, control Human-in-the-Loop, e informes de cumplimiento AI Act generados directamente desde tus datos de uso reales.
¿Cómo audita tu equipo sus agentes hoy en día? Curioso por saber qué enfoques usáis.
Top comments (0)