DEV Community

Sanya
Sanya

Posted on

深度解析 OWASP LLM Top 10 与 Agentic AI Top 10:智能体时代的安全攻防图谱

前言

2025年,AI安全领域迎来了两座重要的里程碑:OWASP LLM Top 10 2025版正式发布,以及全球首个 OWASP Agentic AI Top 10 于2025年12月正式出炉。前者针对大语言模型应用,后者则剑指正在兴起的自主智能体(Agentic AI)系统。两者共同构成了当下AI安全研究的核心知识体系。

本文将深入解析这两份报告的核心内容,梳理其内在联系,结合2025—2026年最前沿的安全实践,提出系统性的解法思路与重心建议。


一、OWASP LLM Top 10(2025版)全面解析

2025版OWASP LLM Top 10相比2023版有重大更新,新增了三个风险类别,重新调整了优先级分布。以下是完整解析:

LLM01 — 提示词注入(Prompt Injection)

不变的第一名。提示词注入是LLM应用中最经典也最危险的风险,攻击者通过在用户输入、RAG检索结果、工具输出等位置注入恶意指令,使模型执行非预期操作。

2025年新增重点Indirect Prompt Injection(间接提示词注入)成为主要攻击向量——恶意网页内容、日历邀请、邮件正文中的隐藏指令可在模型处理外部数据时被触发。

防御重心:输入层严格隔离与验证(CDR / 内容消毒)、运行时意图验证(Intent Validation)、系统提示词锁定、行为基线监控。

LLM02 — 敏感信息泄露(Sensitive Information Disclosure)

从第9位跃升至第2位。模型可能通过输出泄露API密钥、个人隐私数据、商业机密或系统内部信息。攻击路径包括:训练数据记忆、上下文窗口泄露、过度详细的响应等。

防御重心:输出过滤与PII检测、数据最小化原则、差分隐私训练、严格的上下文隔离。

LLM03 — 供应链风险(Supply Chain)

从第6位升至第3位。涵盖第三方模型、数据集、预训练权重、工具库中的恶意组件。2025年随着MCP生态的爆发,供应链攻击面急剧扩大。

防御重心:SBOM / AIBOM 清单管理、模型来源验证与签名、依赖项把关与版本固定、容器化构建环境。

LLM04 — 数据与模型投毒(Data & Model Poisoning)

攻击者通过污染训练数据、RAG知识库或嵌入向量,使模型在特定触发条件下产生错误输出或有害行为。这是一种慢性的、持久性的攻击。

防御重心:训练数据来源审计、RAG知识库输入验证、嵌入向量异常检测、定期模型行为审计。

LLM05 — 不当输出处理(Improper Output Handling)

将模型输出视为可信输入,未做消毒直接传给浏览器(XSS)、Shell或SQL查询(SQL注入)。这是LLM应用中最容易转化为经典漏洞的路径。

防御重心:输出编码与验证(与传统Web安全一致)、强制Schema校验、禁止将未验证输出写入危险操作。

LLM06 — 过度代理(Excessive Agency)

从第4位升至第6位但内容大幅扩展。模型被授予了超出任务所需的工具调用权限,导致一次成功的提示词注入可以触发真实的外部操作(发邮件、删除数据、修改记录等)。

防御重心:最小工具集原则、动作级鉴权与审批、关键操作强制人工确认(Human-in-the-Loop)、MCP网关统一管控。

LLM07 — 系统提示词泄露(System Prompt Leakage)

2025版新增。攻击者可提取应用的隐藏系统提示词,暴露内部指令逻辑、业务规则,甚至嵌入的密钥或凭证。此风险源于对提示词保密性的过度假设。

核心教训:永远不要将任何安全敏感信息放入系统提示词。

LLM08 — 向量与嵌入弱点(Vector & Embedding Weaknesses)

2025版新增,直接回应RAG(检索增强生成)大规模应用后的安全需求。风险包括:嵌入反转攻击(从向量恢复原始数据)、知识库投毒、跨租户向量存储泄露。

防御重心:向量数据库访问控制、嵌入内容验证、按信任度加权检索、多租户隔离。

LLM09 — 虚假信息(Misinformation)

2025版新增。模型生成看似合理但实际错误或有害的内容,并在缺乏来源标注的情况下被用户信任。

防御重心:事实核查机制、来源追踪与标注、置信度分级显示、幻觉检测系统。

LLM10 — 无界消耗(Unbounded Consumption)

2025版新增,将资源管理风险与成本风险合并。攻击者通过精心构造的输入触发模型的高计算量行为,导致服务降级或意外的高额API成本。

防御重心:输入长度与复杂度限制、Token预算强制控制、自适应限流、成本监控与告警。


二、OWASP Agentic AI Top 10(2025版)深度解析

2025年12月,OWASP正式发布首个针对自主智能体系统的安全风险框架——Agentic Applications Top 10。这份框架的核心洞察是:LLM Top 10问的是「模型如何被操纵」,Agentic Top 10问的是「当这种操纵被赋予自主性、记忆、凭证和真实工具访问能力后会发生什么」。

ASI01 — 智能体目标劫持(Agent Goal Hijack)

攻击者通过操纵指令、外部数据或工具输出,改变智能体的既定目标。与一次性提示注入不同,目标劫持的影响是持续性的——被劫持的目标可能被写入记忆,在跨会话中反复生效。

真实案例:EchoLeak事件中,攻击者通过隐藏指令将Copilot变成静默数据窃取引擎。

防御重心:意图胶囊(Intent Capsules)、高风险操作强制人工审批、运行时意图验证。

ASI02 — 工具滥用与利用(Tool Misuse and Exploitation)

智能体在合法权限范围内错误使用工具——调用不恰当的API、使用错误参数或异常顺序组合多个工具。Amazon Q事件是典型案例:攻击者通过模糊指令诱导智能体将合法工具串联,完成数据导出。

防御重心:工具级最小特权、动作级鉴权、语义防火墙(Semantic Firewall)、自适应工具预算。

ASI03 — 身份与权限滥用(Identity & Privilege Abuse)

智能体缺乏独立身份或过度继承用户权限,形成「身份爆炸」问题。Agent可以代表用户批准自己的请求、绕过审批流或访问管理端点。

防御重心:Agent独立服务身份(与用户身份分离)、JIT(即时)权限发放、时间限定令牌、禁止自我授权。

ASI04 — 智能体供应链风险(Agentic Supply Chain Vulnerabilities)

恶意或被篡改的工具、MCP服务器、模型或智能体描述文件在运行时动态加载,影响行为。2025年GitHub MCP服务器漏洞事件是标志性案例。

防御重心:SBOM/AIBOM、来源签名验证、容器化隔离、供应链「急停」开关。

ASI05 — 意外代码执行(Unexpected Code Execution)

智能体生成或处理的文本被直接或间接解释为可执行代码。AutoGPT RCE事件表明,自然语言执行路径可以成为通向远程代码执行的高危通道。

防御重心:禁止生产环境eval()、沙箱执行、非root权限、代码审计与监控。

ASI06 — 记忆与上下文投毒(Memory & Context Poisoning)

攻击者将错误或恶意信息写入智能体的长期记忆或RAG数据库。Gemini Memory Attack展示了恶意网页如何直接写入Agent的记忆存储。

与LLM04的区别:这是持久性的、跨会话的风险,危害远超一次性注入。

防御重心:内存分段、访问与留存限制、来源追溯与异常检测、按信任度加权检索。

ASI07 — 智能体间通信不安全(Insecure Inter-Agent Communication)

多智能体系统中,消息被视为「内部可信流量」而缺乏验证。攻击者可伪造、篡改或重放智能体间消息,导致协作行为被操纵。

防御重心:消息身份验证与完整性校验、安全通信通道、Agent感知防重放、协议固定。

ASI08 — 级联失败(Cascading Failures)

一个错误在自主执行与多智能体协作机制下被不断复制放大,最终演变为系统级连锁故障。规划错误或被污染的记忆可能触发自动部署级联。

防御重心:零信任设计、信任边界隔离、爆炸半径护栏、行为与治理漂移检测。

ASI09 — 人机信任滥用(Human-Agent Trust Exploitation)

智能体以权威、紧急或高度合理的方式输出内容,操纵人类执行高风险操作。「人在回路」并不等于安全——决策已被误导,最终操作却由人完成。

防御重心:明确确认机制、不可变日志、行为检测、计划偏离检测。

ASI10 — 失控智能体(Rogue Agents)

智能体因目标漂移、奖励机制缺陷或持续操纵逐渐偏离原始设计意图,在多智能体环境中可能相互强化。

防御重心:治理与日志记录、监控与检测、身份认证与行为完整性强制、定期行为认证。


三、两大框架的内在联系与演进逻辑

将两份报告对照分析,可以清晰看到AI安全的三层演进:

阶段 形态 主要风险
Level 1 LLM应用(对话机器人) 提示词操纵、信息泄露、输出注入
Level 2 工具调用LLM(带工具的模型) 过度代理、供应链漏洞
Level 3 Agentic AI(自主智能体) 目标劫持、记忆投毒、失控传播

两个框架的核心映射关系:

Agentic ASI 对应 LLM Top 10 核心区别
ASI01 目标劫持 LLM01 + LLM06 持续性 vs 一次性
ASI02 工具滥用 LLM06 自动化放大效应
ASI03 身份滥用 LLM02 + LLM06 跨系统越权
ASI04 供应链 LLM03 动态加载风险
ASI05 代码执行 LLM05 语言到行为边界失效
ASI06 记忆投毒 LLM01 + LLM04 + LLM08 跨会话持久性
ASI07 通信安全 LLM06 Agent间信任滥用
ASI08 级联失败 LLM01 + LLM04 放大效应
ASI09 人机信任 LLM05 + LLM09 人在回路失效
ASI10 失控 LLM09 长期行为漂移

四、前沿发展与新兴威胁

4.1 MCP(Model Context Protocol)生态的安全挑战

2024年底Anthropic发布MCP后,其生态系统在2025年经历了爆发式增长,同时也成为安全研究的核心战场:

  • CVE-2025-6515:MCP会话ID劫持漏洞,攻击者可接管已建立的MCP会话
  • Line Jumping攻击:恶意MCP服务器通过工具描述注入指令,在任何工具被调用前就改变Agent行为
  • Tool Shadowing:恶意服务器先注册无害工具获取信任,之后动态替换工具行为
  • MCPTox基准:专门针对MCP服务器的可复现攻击基准,揭示了MCP生态系统的系统性风险

4.2 AI红队评测的前沿进展

AIRTBench(2025年6月):首个面向LLM自主红队能力的评测基准,基于70个真实CTF挑战。结果显示Claude-3.7-Sonnet以61%总解决率领先,在提示词注入任务上平均解决率达49%。自动化AI红队在可解题任务上效率领先人类安全专家5000倍以上。

AgentSecurityBench(ASB):支持直接/间接提示注入(DPI/IPI)、Plan-of-Thought后门、内存投毒等多种攻击场景。

4.3 零信任AI智能体架构

Anthropic发布的《Zero Trust for AI Agents》白皮书提出了核心设计原则:

「当你不确定某个控制是否有效,问自己:它让攻击变得不可能,还是只是变得麻烦?」

在AI加速攻击的时代,仅靠摩擦来防御是不够的,必须从架构层面消除攻击路径。


五、系统性解法与核心重心

5.1 架构层:最小Agent原则(Least Agency)

OWASP Agentic AI框架提出的核心理念,超越传统最小权限原则:

  • 不仅限制「能访问什么」,更限制「在什么条件下自主行动」
  • 工具调用前:意图验证
  • 执行中:动作级鉴权
  • 执行后:完整审计日志
  • 关键操作:强制人工审批

5.2 技术层:五层防御体系

第一层:输入安全 — 内容消毒(CDR)、提示词与外部数据严格隔离、意图验证、多层输入过滤

第二层:工具与通信安全 — MCP网关、工具级最小特权、Agent间消息身份验证、语义防火墙

第三层:身份与权限管理 — Agent独立服务身份、JIT权限发放(零持久权限)、时间限定令牌、禁止自我授权

第四层:记忆与数据安全 — 内存分段存储、来源追溯机制、RAG知识库输入验证、按信任度加权检索

第五层:运行时监控与响应 — 完整不可变日志、行为基线与漂移检测、熔断机制、Agent「急停」开关

5.3 流程层:持续安全运营

左移安全:将安全测试集成到CI/CD管道,提示注入测试、工具权限审查成为发布前必须环节。

红队测试常态化:AI Agent需要与传统渗透测试不同的红队方法——CSA Agentic AI Red Teaming Guide提出了12大威胁类别和4层渗透模型(基础层→目标层→环境层→元认知层)。

监管合规对齐:欧盟AI法案(EU AI Act)的高风险分类与OWASP Agentic Top 10高度一致,需要对关键决策Agent实施强制人类监督。


六、2026年AI安全重心建议

🔴 最高优先级(立即行动)

  1. MCP生态安全审计:对所有MCP服务器实施零信任策略,部署MCP网关,限制工具描述直接进入模型上下文
  2. Agent身份隔离:为每个Agent分配独立服务身份,消除Agent继承用户凭证的问题
  3. 关键操作强制HITL:对涉及财务、敏感数据、外部通信的操作强制人工审批
  4. Agent记忆安全:将Agent记忆视为不可信存储,实施访问控制和输入验证

🟡 中期建设(3-6个月)

  1. 建立AIBOM:为所有Agent组件(模型、工具、MCP服务器、Prompt模板)建立资产清单
  2. AI红队常态化:建立针对Agentic AI的持续红队测试流程
  3. 日志与可观测性:实施完整的Agent行为追踪,覆盖意图→决策→工具调用→结果的全链路

🟢 长期演进(6-12个月)

  1. 零信任AI架构:重新设计网络和身份架构,将Zero Trust原则应用于非人类身份
  2. 对抗性鲁棒性训练:将Agent投毒和目标劫持纳入持续安全评估
  3. 跨框架合规对接:将OWASP LLM/Agentic Top 10与EU AI Act、NIST AI Risk Management Framework对齐

结语

OWASP LLM Top 10与Agentic AI Top 10共同描绘了一幅清晰的图景:AI安全正在从「模型被操纵」演进到「AI被赋予行动能力后的系统性风险」

提示词注入从文字游戏变成了真正的行动触发器。记忆投毒从一次性事件变成了持久性行为控制。供应链漏洞从代码风险扩展到了Prompt和工具描述的「软逻辑」层面。

安全的重心必须从「防御模型」升级到「治理Agent行为」。这需要的不仅是技术改进,更是架构理念的根本转变——从最小权限到最小Agent,从边界防御到零信任AI,从被动修复到主动红队。

在这个AI加速一切的时代,安全不再是护城河,而是生存条件。


本文参考:OWASP Top 10 for LLM Applications 2025(owasp.org)、OWASP Top 10 for Agentic Applications 2026(genai.owasp.org)、CSA Agentic AI Red Teaming Guide、Anthropic Zero Trust for AI Agents白皮书、AIRTBench论文等。

Top comments (0)