前言
2025年,AI安全领域迎来了两座重要的里程碑:OWASP LLM Top 10 2025版正式发布,以及全球首个 OWASP Agentic AI Top 10 于2025年12月正式出炉。前者针对大语言模型应用,后者则剑指正在兴起的自主智能体(Agentic AI)系统。两者共同构成了当下AI安全研究的核心知识体系。
本文将深入解析这两份报告的核心内容,梳理其内在联系,结合2025—2026年最前沿的安全实践,提出系统性的解法思路与重心建议。
一、OWASP LLM Top 10(2025版)全面解析
2025版OWASP LLM Top 10相比2023版有重大更新,新增了三个风险类别,重新调整了优先级分布。以下是完整解析:
LLM01 — 提示词注入(Prompt Injection)
不变的第一名。提示词注入是LLM应用中最经典也最危险的风险,攻击者通过在用户输入、RAG检索结果、工具输出等位置注入恶意指令,使模型执行非预期操作。
2025年新增重点:Indirect Prompt Injection(间接提示词注入)成为主要攻击向量——恶意网页内容、日历邀请、邮件正文中的隐藏指令可在模型处理外部数据时被触发。
防御重心:输入层严格隔离与验证(CDR / 内容消毒)、运行时意图验证(Intent Validation)、系统提示词锁定、行为基线监控。
LLM02 — 敏感信息泄露(Sensitive Information Disclosure)
从第9位跃升至第2位。模型可能通过输出泄露API密钥、个人隐私数据、商业机密或系统内部信息。攻击路径包括:训练数据记忆、上下文窗口泄露、过度详细的响应等。
防御重心:输出过滤与PII检测、数据最小化原则、差分隐私训练、严格的上下文隔离。
LLM03 — 供应链风险(Supply Chain)
从第6位升至第3位。涵盖第三方模型、数据集、预训练权重、工具库中的恶意组件。2025年随着MCP生态的爆发,供应链攻击面急剧扩大。
防御重心:SBOM / AIBOM 清单管理、模型来源验证与签名、依赖项把关与版本固定、容器化构建环境。
LLM04 — 数据与模型投毒(Data & Model Poisoning)
攻击者通过污染训练数据、RAG知识库或嵌入向量,使模型在特定触发条件下产生错误输出或有害行为。这是一种慢性的、持久性的攻击。
防御重心:训练数据来源审计、RAG知识库输入验证、嵌入向量异常检测、定期模型行为审计。
LLM05 — 不当输出处理(Improper Output Handling)
将模型输出视为可信输入,未做消毒直接传给浏览器(XSS)、Shell或SQL查询(SQL注入)。这是LLM应用中最容易转化为经典漏洞的路径。
防御重心:输出编码与验证(与传统Web安全一致)、强制Schema校验、禁止将未验证输出写入危险操作。
LLM06 — 过度代理(Excessive Agency)
从第4位升至第6位但内容大幅扩展。模型被授予了超出任务所需的工具调用权限,导致一次成功的提示词注入可以触发真实的外部操作(发邮件、删除数据、修改记录等)。
防御重心:最小工具集原则、动作级鉴权与审批、关键操作强制人工确认(Human-in-the-Loop)、MCP网关统一管控。
LLM07 — 系统提示词泄露(System Prompt Leakage)
2025版新增。攻击者可提取应用的隐藏系统提示词,暴露内部指令逻辑、业务规则,甚至嵌入的密钥或凭证。此风险源于对提示词保密性的过度假设。
核心教训:永远不要将任何安全敏感信息放入系统提示词。
LLM08 — 向量与嵌入弱点(Vector & Embedding Weaknesses)
2025版新增,直接回应RAG(检索增强生成)大规模应用后的安全需求。风险包括:嵌入反转攻击(从向量恢复原始数据)、知识库投毒、跨租户向量存储泄露。
防御重心:向量数据库访问控制、嵌入内容验证、按信任度加权检索、多租户隔离。
LLM09 — 虚假信息(Misinformation)
2025版新增。模型生成看似合理但实际错误或有害的内容,并在缺乏来源标注的情况下被用户信任。
防御重心:事实核查机制、来源追踪与标注、置信度分级显示、幻觉检测系统。
LLM10 — 无界消耗(Unbounded Consumption)
2025版新增,将资源管理风险与成本风险合并。攻击者通过精心构造的输入触发模型的高计算量行为,导致服务降级或意外的高额API成本。
防御重心:输入长度与复杂度限制、Token预算强制控制、自适应限流、成本监控与告警。
二、OWASP Agentic AI Top 10(2025版)深度解析
2025年12月,OWASP正式发布首个针对自主智能体系统的安全风险框架——Agentic Applications Top 10。这份框架的核心洞察是:LLM Top 10问的是「模型如何被操纵」,Agentic Top 10问的是「当这种操纵被赋予自主性、记忆、凭证和真实工具访问能力后会发生什么」。
ASI01 — 智能体目标劫持(Agent Goal Hijack)
攻击者通过操纵指令、外部数据或工具输出,改变智能体的既定目标。与一次性提示注入不同,目标劫持的影响是持续性的——被劫持的目标可能被写入记忆,在跨会话中反复生效。
真实案例:EchoLeak事件中,攻击者通过隐藏指令将Copilot变成静默数据窃取引擎。
防御重心:意图胶囊(Intent Capsules)、高风险操作强制人工审批、运行时意图验证。
ASI02 — 工具滥用与利用(Tool Misuse and Exploitation)
智能体在合法权限范围内错误使用工具——调用不恰当的API、使用错误参数或异常顺序组合多个工具。Amazon Q事件是典型案例:攻击者通过模糊指令诱导智能体将合法工具串联,完成数据导出。
防御重心:工具级最小特权、动作级鉴权、语义防火墙(Semantic Firewall)、自适应工具预算。
ASI03 — 身份与权限滥用(Identity & Privilege Abuse)
智能体缺乏独立身份或过度继承用户权限,形成「身份爆炸」问题。Agent可以代表用户批准自己的请求、绕过审批流或访问管理端点。
防御重心:Agent独立服务身份(与用户身份分离)、JIT(即时)权限发放、时间限定令牌、禁止自我授权。
ASI04 — 智能体供应链风险(Agentic Supply Chain Vulnerabilities)
恶意或被篡改的工具、MCP服务器、模型或智能体描述文件在运行时动态加载,影响行为。2025年GitHub MCP服务器漏洞事件是标志性案例。
防御重心:SBOM/AIBOM、来源签名验证、容器化隔离、供应链「急停」开关。
ASI05 — 意外代码执行(Unexpected Code Execution)
智能体生成或处理的文本被直接或间接解释为可执行代码。AutoGPT RCE事件表明,自然语言执行路径可以成为通向远程代码执行的高危通道。
防御重心:禁止生产环境eval()、沙箱执行、非root权限、代码审计与监控。
ASI06 — 记忆与上下文投毒(Memory & Context Poisoning)
攻击者将错误或恶意信息写入智能体的长期记忆或RAG数据库。Gemini Memory Attack展示了恶意网页如何直接写入Agent的记忆存储。
与LLM04的区别:这是持久性的、跨会话的风险,危害远超一次性注入。
防御重心:内存分段、访问与留存限制、来源追溯与异常检测、按信任度加权检索。
ASI07 — 智能体间通信不安全(Insecure Inter-Agent Communication)
多智能体系统中,消息被视为「内部可信流量」而缺乏验证。攻击者可伪造、篡改或重放智能体间消息,导致协作行为被操纵。
防御重心:消息身份验证与完整性校验、安全通信通道、Agent感知防重放、协议固定。
ASI08 — 级联失败(Cascading Failures)
一个错误在自主执行与多智能体协作机制下被不断复制放大,最终演变为系统级连锁故障。规划错误或被污染的记忆可能触发自动部署级联。
防御重心:零信任设计、信任边界隔离、爆炸半径护栏、行为与治理漂移检测。
ASI09 — 人机信任滥用(Human-Agent Trust Exploitation)
智能体以权威、紧急或高度合理的方式输出内容,操纵人类执行高风险操作。「人在回路」并不等于安全——决策已被误导,最终操作却由人完成。
防御重心:明确确认机制、不可变日志、行为检测、计划偏离检测。
ASI10 — 失控智能体(Rogue Agents)
智能体因目标漂移、奖励机制缺陷或持续操纵逐渐偏离原始设计意图,在多智能体环境中可能相互强化。
防御重心:治理与日志记录、监控与检测、身份认证与行为完整性强制、定期行为认证。
三、两大框架的内在联系与演进逻辑
将两份报告对照分析,可以清晰看到AI安全的三层演进:
| 阶段 | 形态 | 主要风险 |
|---|---|---|
| Level 1 | LLM应用(对话机器人) | 提示词操纵、信息泄露、输出注入 |
| Level 2 | 工具调用LLM(带工具的模型) | 过度代理、供应链漏洞 |
| Level 3 | Agentic AI(自主智能体) | 目标劫持、记忆投毒、失控传播 |
两个框架的核心映射关系:
| Agentic ASI | 对应 LLM Top 10 | 核心区别 |
|---|---|---|
| ASI01 目标劫持 | LLM01 + LLM06 | 持续性 vs 一次性 |
| ASI02 工具滥用 | LLM06 | 自动化放大效应 |
| ASI03 身份滥用 | LLM02 + LLM06 | 跨系统越权 |
| ASI04 供应链 | LLM03 | 动态加载风险 |
| ASI05 代码执行 | LLM05 | 语言到行为边界失效 |
| ASI06 记忆投毒 | LLM01 + LLM04 + LLM08 | 跨会话持久性 |
| ASI07 通信安全 | LLM06 | Agent间信任滥用 |
| ASI08 级联失败 | LLM01 + LLM04 | 放大效应 |
| ASI09 人机信任 | LLM05 + LLM09 | 人在回路失效 |
| ASI10 失控 | LLM09 | 长期行为漂移 |
四、前沿发展与新兴威胁
4.1 MCP(Model Context Protocol)生态的安全挑战
2024年底Anthropic发布MCP后,其生态系统在2025年经历了爆发式增长,同时也成为安全研究的核心战场:
- CVE-2025-6515:MCP会话ID劫持漏洞,攻击者可接管已建立的MCP会话
- Line Jumping攻击:恶意MCP服务器通过工具描述注入指令,在任何工具被调用前就改变Agent行为
- Tool Shadowing:恶意服务器先注册无害工具获取信任,之后动态替换工具行为
- MCPTox基准:专门针对MCP服务器的可复现攻击基准,揭示了MCP生态系统的系统性风险
4.2 AI红队评测的前沿进展
AIRTBench(2025年6月):首个面向LLM自主红队能力的评测基准,基于70个真实CTF挑战。结果显示Claude-3.7-Sonnet以61%总解决率领先,在提示词注入任务上平均解决率达49%。自动化AI红队在可解题任务上效率领先人类安全专家5000倍以上。
AgentSecurityBench(ASB):支持直接/间接提示注入(DPI/IPI)、Plan-of-Thought后门、内存投毒等多种攻击场景。
4.3 零信任AI智能体架构
Anthropic发布的《Zero Trust for AI Agents》白皮书提出了核心设计原则:
「当你不确定某个控制是否有效,问自己:它让攻击变得不可能,还是只是变得麻烦?」
在AI加速攻击的时代,仅靠摩擦来防御是不够的,必须从架构层面消除攻击路径。
五、系统性解法与核心重心
5.1 架构层:最小Agent原则(Least Agency)
OWASP Agentic AI框架提出的核心理念,超越传统最小权限原则:
- 不仅限制「能访问什么」,更限制「在什么条件下自主行动」
- 工具调用前:意图验证
- 执行中:动作级鉴权
- 执行后:完整审计日志
- 关键操作:强制人工审批
5.2 技术层:五层防御体系
第一层:输入安全 — 内容消毒(CDR)、提示词与外部数据严格隔离、意图验证、多层输入过滤
第二层:工具与通信安全 — MCP网关、工具级最小特权、Agent间消息身份验证、语义防火墙
第三层:身份与权限管理 — Agent独立服务身份、JIT权限发放(零持久权限)、时间限定令牌、禁止自我授权
第四层:记忆与数据安全 — 内存分段存储、来源追溯机制、RAG知识库输入验证、按信任度加权检索
第五层:运行时监控与响应 — 完整不可变日志、行为基线与漂移检测、熔断机制、Agent「急停」开关
5.3 流程层:持续安全运营
左移安全:将安全测试集成到CI/CD管道,提示注入测试、工具权限审查成为发布前必须环节。
红队测试常态化:AI Agent需要与传统渗透测试不同的红队方法——CSA Agentic AI Red Teaming Guide提出了12大威胁类别和4层渗透模型(基础层→目标层→环境层→元认知层)。
监管合规对齐:欧盟AI法案(EU AI Act)的高风险分类与OWASP Agentic Top 10高度一致,需要对关键决策Agent实施强制人类监督。
六、2026年AI安全重心建议
🔴 最高优先级(立即行动)
- MCP生态安全审计:对所有MCP服务器实施零信任策略,部署MCP网关,限制工具描述直接进入模型上下文
- Agent身份隔离:为每个Agent分配独立服务身份,消除Agent继承用户凭证的问题
- 关键操作强制HITL:对涉及财务、敏感数据、外部通信的操作强制人工审批
- Agent记忆安全:将Agent记忆视为不可信存储,实施访问控制和输入验证
🟡 中期建设(3-6个月)
- 建立AIBOM:为所有Agent组件(模型、工具、MCP服务器、Prompt模板)建立资产清单
- AI红队常态化:建立针对Agentic AI的持续红队测试流程
- 日志与可观测性:实施完整的Agent行为追踪,覆盖意图→决策→工具调用→结果的全链路
🟢 长期演进(6-12个月)
- 零信任AI架构:重新设计网络和身份架构,将Zero Trust原则应用于非人类身份
- 对抗性鲁棒性训练:将Agent投毒和目标劫持纳入持续安全评估
- 跨框架合规对接:将OWASP LLM/Agentic Top 10与EU AI Act、NIST AI Risk Management Framework对齐
结语
OWASP LLM Top 10与Agentic AI Top 10共同描绘了一幅清晰的图景:AI安全正在从「模型被操纵」演进到「AI被赋予行动能力后的系统性风险」。
提示词注入从文字游戏变成了真正的行动触发器。记忆投毒从一次性事件变成了持久性行为控制。供应链漏洞从代码风险扩展到了Prompt和工具描述的「软逻辑」层面。
安全的重心必须从「防御模型」升级到「治理Agent行为」。这需要的不仅是技术改进,更是架构理念的根本转变——从最小权限到最小Agent,从边界防御到零信任AI,从被动修复到主动红队。
在这个AI加速一切的时代,安全不再是护城河,而是生存条件。
本文参考:OWASP Top 10 for LLM Applications 2025(owasp.org)、OWASP Top 10 for Agentic Applications 2026(genai.owasp.org)、CSA Agentic AI Red Teaming Guide、Anthropic Zero Trust for AI Agents白皮书、AIRTBench论文等。
Top comments (0)