腾讯DSH安全论文实测:间接Prompt注入成功率17-25.5%,运行时防护怎么做?
DeepSeek Harness(DSH)作为近期最火的开源Agent编排框架,GitHub星标破万。但腾讯AI-Infra-Guard团队刚发布的安全评估论文(arXiv:2608.16393)揭示了一个严峻事实:在受控测试中,间接Prompt注入攻击成功率高达17%-25.5%。
一、论文核心发现
腾讯团队对DSH进行了系统性安全评估,主要发现包括:
- 间接Prompt注入:攻击者通过外部数据源(网页、文件、API返回)注入恶意指令,Agent在无感知情况下执行,实测成功率17%-25.5%
- 工具调用越权:DSH对MCP工具调用缺乏运行时权限校验,恶意工具可诱导Agent执行非预期操作
- 输出未验证:Agent输出直接传递给下游工具,缺少结构和语义校验层
- 跨工具信任链污染:一个被攻陷的MCP Server可以通过工具返回值影响整个Agent决策链
论文地址:https://arxiv.org/abs/2608.16393
二、攻击面拆解
DSH的架构中,Agent通过MCP协议与外部工具通信。攻击路径如下:
攻击者控制的外部内容 → MCP工具返回 → Agent上下文 → 触发恶意操作
关键点在于:攻击不直接针对LLM,而是利用Agent"信任工具返回"的特性。传统的输入过滤对此完全无效——因为恶意payload来自Agent"自己"调用的工具。
论文实测的攻击向量包括:
- 在网页内容中嵌入指令覆盖Agent原始任务
- 通过文件元数据注入隐蔽指令
- 利用工具返回值中的URL触发SSRF
- 通过链式工具调用逐步提升权限
三、运行时防护思路
输入侧过滤不够,需要在工具调用执行前和工具输出消费前做运行时拦截:
调用前(Guardrail):
- 验证工具调用参数是否符合预期schema
- 检测命令注入、SSRF、路径穿越等恶意payload
- 基于调用意图判断是否越权(不是简单关键词匹配)
输出后(Verification):
- 校验工具返回结构是否符合声明
- 检测返回内容中的prompt注入特征
- 对跨工具数据流做完整性校验
四、Correctover的实现
我们开源了Correctover——一个DSH运行时安全插件,在工具调用链路中插入验证层:
const { GuardrailProvider } = require('correctover');
const guardrail = new GuardrailProvider({
mode: 'audit',
dimensions: ['structure', 'schema', 'identity', 'integrity', 'security']
});
核心能力:
- 7维运行时验证:Structure/Schema/Latency/Cost/Identity/Integrity/Security
- 语义感知引擎:不是关键词匹配,而是理解代码意图
- sub-millisecond延迟:Node.js核心验证P50≈2.7μs
- 框架无关:不仅支持DSH,任何基于MCP的Agent框架都可接入
快速安装
npm install correctover
DSH用户直接启用插件:
// dsh.config.js
module.exports = {
plugins: ['correctover/dsh']
};
非DSH环境使用standalone模式:
const { scanToolCall, verifyOutput } = require('correctover');
const result = scanToolCall({
tool: 'execute_command',
args: { command: userInput }
});
if (result.verdict === 'BLOCK') {
// 拦截恶意调用
}
五、audit-first理念
安全工具最大的坑是误报阻断正常业务。Correctover默认audit-only模式:
- 先观察记录,不阻断
- 根据真实流量调优规则
- 确认无误报后切换enforce模式
这比上来就block的方案实用得多——你可以先知道自己"正在被打",再决定怎么防。
六、写在最后
DSH这类Agent编排框架会越来越火,攻击面也会越来越大。腾讯这篇论文的价值在于用数据证明了:当前Agent框架的安全防护严重不足,运行时验证不是可选项,是必选项。
Correctover的CCS(Correctover Conformance Shape)标准已经作为IETF草案提交(draft-correctover-ccs),目标是建立Agent运行时验证的通用框架。
- npm: https://www.npmjs.com/package/correctover
- 源码: https://codeberg.org/correctover-labs/correctover
安全不是事后加的功能,是Agent跑起来就要有的东西。
本文基于腾讯AI-Infra-Guard团队公开论文(arXiv:2608.16393)的技术分析,所有测试数据引用自原论文。
Top comments (0)