DEV Community

correctover
correctover

Posted on

腾讯DSH安全论文实测:间接Prompt注入成功率17-25.5%,运行时防护怎么做?

腾讯DSH安全论文实测:间接Prompt注入成功率17-25.5%,运行时防护怎么做?

DeepSeek Harness(DSH)作为近期最火的开源Agent编排框架,GitHub星标破万。但腾讯AI-Infra-Guard团队刚发布的安全评估论文(arXiv:2608.16393)揭示了一个严峻事实:在受控测试中,间接Prompt注入攻击成功率高达17%-25.5%。

一、论文核心发现

腾讯团队对DSH进行了系统性安全评估,主要发现包括:

  1. 间接Prompt注入:攻击者通过外部数据源(网页、文件、API返回)注入恶意指令,Agent在无感知情况下执行,实测成功率17%-25.5%
  2. 工具调用越权:DSH对MCP工具调用缺乏运行时权限校验,恶意工具可诱导Agent执行非预期操作
  3. 输出未验证:Agent输出直接传递给下游工具,缺少结构和语义校验层
  4. 跨工具信任链污染:一个被攻陷的MCP Server可以通过工具返回值影响整个Agent决策链

论文地址:https://arxiv.org/abs/2608.16393

二、攻击面拆解

DSH的架构中,Agent通过MCP协议与外部工具通信。攻击路径如下:

攻击者控制的外部内容 → MCP工具返回 → Agent上下文 → 触发恶意操作
Enter fullscreen mode Exit fullscreen mode

关键点在于:攻击不直接针对LLM,而是利用Agent"信任工具返回"的特性。传统的输入过滤对此完全无效——因为恶意payload来自Agent"自己"调用的工具。

论文实测的攻击向量包括:

  • 在网页内容中嵌入指令覆盖Agent原始任务
  • 通过文件元数据注入隐蔽指令
  • 利用工具返回值中的URL触发SSRF
  • 通过链式工具调用逐步提升权限

三、运行时防护思路

输入侧过滤不够,需要在工具调用执行前工具输出消费前做运行时拦截:

调用前(Guardrail)

  • 验证工具调用参数是否符合预期schema
  • 检测命令注入、SSRF、路径穿越等恶意payload
  • 基于调用意图判断是否越权(不是简单关键词匹配)

输出后(Verification)

  • 校验工具返回结构是否符合声明
  • 检测返回内容中的prompt注入特征
  • 对跨工具数据流做完整性校验

四、Correctover的实现

我们开源了Correctover——一个DSH运行时安全插件,在工具调用链路中插入验证层:

const { GuardrailProvider } = require('correctover');

const guardrail = new GuardrailProvider({
  mode: 'audit',
  dimensions: ['structure', 'schema', 'identity', 'integrity', 'security']
});
Enter fullscreen mode Exit fullscreen mode

核心能力:

  • 7维运行时验证:Structure/Schema/Latency/Cost/Identity/Integrity/Security
  • 语义感知引擎:不是关键词匹配,而是理解代码意图
  • sub-millisecond延迟:Node.js核心验证P50≈2.7μs
  • 框架无关:不仅支持DSH,任何基于MCP的Agent框架都可接入

快速安装

npm install correctover
Enter fullscreen mode Exit fullscreen mode

DSH用户直接启用插件:

// dsh.config.js
module.exports = {
  plugins: ['correctover/dsh']
};
Enter fullscreen mode Exit fullscreen mode

非DSH环境使用standalone模式:

const { scanToolCall, verifyOutput } = require('correctover');

const result = scanToolCall({
  tool: 'execute_command',
  args: { command: userInput }
});
if (result.verdict === 'BLOCK') {
  // 拦截恶意调用
}
Enter fullscreen mode Exit fullscreen mode

五、audit-first理念

安全工具最大的坑是误报阻断正常业务。Correctover默认audit-only模式:

  1. 先观察记录,不阻断
  2. 根据真实流量调优规则
  3. 确认无误报后切换enforce模式

这比上来就block的方案实用得多——你可以先知道自己"正在被打",再决定怎么防。

六、写在最后

DSH这类Agent编排框架会越来越火,攻击面也会越来越大。腾讯这篇论文的价值在于用数据证明了:当前Agent框架的安全防护严重不足,运行时验证不是可选项,是必选项。

Correctover的CCS(Correctover Conformance Shape)标准已经作为IETF草案提交(draft-correctover-ccs),目标是建立Agent运行时验证的通用框架。

安全不是事后加的功能,是Agent跑起来就要有的东西。


本文基于腾讯AI-Infra-Guard团队公开论文(arXiv:2608.16393)的技术分析,所有测试数据引用自原论文。

Top comments (0)