DEV Community

Open Human
Open Human

Posted on

幻觉之后:Agent 事故分类学与治理控制点

——当事故不再只是模型的错,治理就必须补位

1. 现象层:事故形态的质变

如果把 2023 年 3 月的 ChatGPT 数据泄漏当作分界点,AI 事故的归因方式已经发生了一次彻底迁移。

2023 年 3 月 20 日,OpenAI 因底层 Redis 客户端库的 bug,导致用户聊天记录与支付信息在缓存中被交叉暴露。OpenAI 在官方 post-mortem 中承认了这一事实(来源:OpenAI 官方博客,2023-03-24)。但这不是一个模型质量问题,而是基础设施层的数据隔离失败。

同月,安全研究员 Roman Samoilenko 披露 EmailGPT 等多款 AI 邮件插件的间接提示注入漏洞:攻击者不需要直接与插件对话,只需在邮件正文中植入指令,就能让插件将用户邮件转发到攻击者服务器(来源:Roman Samoilenko 公开报告,2023-03)。漏洞不在模型,而在 Agent 对上下文信任的机器假设里。

2023 年 5 月,Greshake 等人在 arXiv 发表了针对 LLM 集成应用的间接提示注入研究,演示了通过 Bing Chat 的购物插件将注入内容嵌入页面数据流,实现用户数据向外部域的重定向(来源:arXiv:2305.12116)。这给"工具调用链即攻击面"提供了最早的学术证据。

2024 年 2 月,加拿大不列颠哥伦比亚省民事解决法庭在 Moffatt v Air Canada 案中裁定:Air Canada 聊天机器人提供了错误的退款政策信息,航司必须承担责任(来源:BC 民事解决法庭裁决,2024-02)。裁判逻辑不是"模型错了所以免责",而是"企业必须为自主系统的行为负责"。

2024 年下半年,多项安全研究进一步验证了趋势:云端 Agent 在读取一封含恶意指令的邮件后,可以调用自身已授权的凭证向外部域发起数据外传。研究者公开演示了 AWS Bedrock 环境中的 Agent 被诱导泄漏凭据的过程(来源:安全厂商公开披露,2024-08)。这种利用方式在传统 Web 应用中可以用 WAF、SSRF 防护解决,但在 Agent 的合法工具调用与恶意指令之间,几乎不存在可配置的边界。

把上述事件放在同一张桌上排查,结论很清楚:过去事故类型固定在"模型幻觉"——输出与事实不符;今天的事故已经进入"系统行为失控"——Agent 在合法权限、合法协议、合法部署方式下,执行了不该执行的操作。事故不再只是模型的错,而是治理体系的错。AI Incident Database 已收录超过两千起公开事故(来源:AIID,截至 2025),Gartner 在 2024 年 11 月的研判更为直接:到 2027 年,40% 的 Agent AI 事故将源于"对 Agent AI 的误用",而不是模型自身的失败(来源:Gartner Newsroom,2024-11)。

2. 成因层:为什么偏偏是现在

四条线索同时走到了临界点。

技术线索。 ReAct 模式把"推理—行动—观测"固化成了应用层范式。模型不再只是文本生成器,而是决策引擎,其输出被翻译为对文件、数据库、API、浏览器的实际操作。Anthropic 于 2024 年 11 月开放 MCP 协议,工具接入成本骤降,攻击面也从"模型输入端"扩展到了"工具调用链"。

产业线索。 2025 年,OpenAI 发布 Operator 与 Agents SDK,Anthropic 发布 Agent SDK,Google 跟进 Agentic 组件。Agent 从 demo 进入生产的时间被压缩到极致。实际部署中,Agent 常常被授予与"集成密钥"同等级别的权限——这恰恰是传统安全体系里保护最薄弱的环节。大量团队把 Agent 当作"高级函数调用的包装器",没有意识到它的执行路径不可穷举。

资本线索。 2024 至 2025 年,大量资金涌入 Agent 基础设施层:评估、观测、防护、端到端测试。但资本也推高了部署速度——公司为了抢进程,把"验证模型能力"等同于"验证 Agent 行为安全性"(推测:多数团队在 Agent 生产化初期并未设置独立的行为风险评估职能)。模型能力可以被 benchmark 测量,行为安全性却只能被事故检验。

政策线索。 欧盟 AI Act(Regulation (EU) 2024/1689)于 2024 年 8 月 1 日生效,建立了风险分级与人类监督义务;中国《生成式人工智能服务管理暂行办法》(网信办等七部门,2023-08-15 施行)确立了生成式 AI 服务的主体责任;《人工智能生成合成内容标识办法》(网信办等四部门,2025-09-01 施行)进一步强制要求对合成内容进行显式或隐式标识。政策节奏明显从"模型能力监管"转向"系统行为追溯"。

四条线索的交汇结果是一个错位:Agent 的"执行权"快速膨胀,而治理端——权限隔离、行为追踪、事故回滚、审计闭环——仍停留在上一代 API 治理水平。

3. 格局层:开源卖"可验证",闭源卖"托管"

在 Agent 生态里,开源与闭源的信任模型走向了两条不同的路。

开源生态以开放权重模型(DeepSeek-R1 于 2025 年 1 月发布,以及 Llama、Mistral 等)与开放框架(AutoGPT、LangGraph、MCP)为代表。其卖点本质是"可验证":你可以审查权重、复现推理、在自有环境部署,数据留在自己手里。但在 Agent 时代,"可验证"出现了一个盲区:权重可验证,运行行为不可验证。一个自托管的开源 Agent,如果没有分布式追踪、工具调用审计和决策日志,它的行为对运维者依然是黑箱——甚至比闭源 API 更黑,因为你还要自己搭建观测设施。

闭源生态以 OpenAI、Anthropic、Google 的托管 API 和 Agent 平台为代表。卖点正好相反:托管模式——平台承诺安全基线、内容防护、合规支撑,用户转移运维责任。但这也引入隐性代价:用户无法深入检查模型的推理过程,事故发生时拿不到完整的内部决策证据。企业客户若依赖闭源 Agent 处理关键流程,能获得的证据只有供应商愿意给出的那部分日志。这不是阴谋论,而是问责制的结构性差异。

调查判断是:在 Agent 行为分析这件事上,两种模式正撞上同一堵墙——行为层可观测性的缺失。 开源有透明的模型,但不一定有透明的行为链路;闭源有可靠的托管,但不一定有可问责的证据链。未来用户信任的落点,将不再是"模型是否开源",而是"推理路径与工具调用链是否可追溯、可审计、可归因"。

4. 能力与隐患:Agent 的能力边界与四类事故

Agent 的能力边界(以目前公开能力为基准)包括:自主完成多步任务并循环推理;调用外部工具(浏览器、代码执行、数据库、邮件、支付接口);持有长期记忆(向量库、记忆文件);多 Agent 协作形成执行图。能力的每一次扩张,都对应一类新的事故形态。我把 Agent 事故划分为四类,并为每一类指定一个治理控制点。

4.1 越权:权限按角色授予,行为却按语境决策

一个负责邮件分类的 Agent,如果同时绑定了对象存储的写权限,当攻击者通过邮件注入指令、请求"把附件同步到 192.168.x.x",Agent 会照做——因为它有权限,而且它把注入内容当成了系统指令的一部分。这不是模型理解力问题,而是权限粒度问题。传统权限体系面向固定角色,Agent 的每次调用却是动态决策。控制点是最小权限 + 逐调用授权:把"角色权限"细化为"单次工具调用的运行时授权",每次行动都执行策略判定。

4.2 工具误用:意图正确,契约失守

Agent 在语义理解正确的条件下,选错工具或填错参数。比如用户想"删除缓存",Agent 却把清理逻辑指向了生产数据库的 drop 操作。归因时看似模型"理解错了",实际是工具契约——输入输出 schema——没有得到约束。控制点是工具注册表 + 前置校验:所有可用工具以强类型 schema 注册;每次调用前做"意图—工具"匹配的规则校验;置信度低于阈值时强制转人工确认,而不是自动执行。

4.3 级联故障:看似合理的错误在链路中放大

多 Agent 协作时,一个 Agent 的错误输出会作为另一个 Agent 的输入,故障像信号一样在网络中放大。这比微服务雪崩更隐蔽:微服务的故障是异常码,Agent 的"故障"是看似合理的文本。下游 Agent 无法识别上游输出中的注入成分,因为可信度判断本身也是模型的概率输出。控制点是链路熔断 + 执行预算:为 Agent 链路设置总预算(调用次数、时长、上下文窗口);每个 Agent 的输出在进入下游前经过可信边界校验;发现异常指数立即中断链路转人工,而不是让 Agent 继续"自我修复"。

4.4 数据泄漏:记忆成为持久后门

2023 年以来的多轮研究反复证明:注入到记忆库的内容可以被未来的 Agent 会话读取,形成持久后门。更直接的泄漏路径是 Agent 把敏感数据写进工具参数——外部 HTTP 请求、公开笔记应用、日志上传。控制点是污点追踪 + 出站策略:对进入 Agent 上下文的数据打标签(公开/内部/机密);对每个工具调用做数据流检查——"机密数据是否正在流向外部目标";出站网络默认黑名单拦截,Agent 无默认外发权限。

四类事故有一个共同点:它们都发生在 Agent 与环境的交互边界,而不是模型的概率输出里。 因此,控制点必须落在工具层、权限层、数据流层和链路边界,而不是依赖"更强的模型"。

5. 治理与监管:现行脉络与控制点

5.1 监管脉络(可溯源)

  • 欧盟:AI Act(Regulation (EU) 2024/1689),2024-08-01 生效,明确高风险 AI 系统的风险管理、数据治理、透明度与人类监督义务;2026 年起分阶段全面适用。对 Agent 而言,"高风险"分类存在弹性,但日志留存、人工监督、事故报告义务是刚性的。

- 中国:《生成式人工智能服务管理暂行办法》(网信办等七部门,2023-08-15 施行),确立算法备案与安全评估义务;《人工智能生成合成内容标识办法》(网信办等四部门,2025-09-01 施行),强制对生成合成内容进行显式或隐式标识。这个要求直接影响 Agent 的记忆、日志与输出的可追溯性。


ai #opensource #machinelearning #programming

Top comments (0)