DEV Community

cognitalk
cognitalk

Posted on

剖析AI漏洞:从私有 LLM API 窃取推理轨迹

《Stealing Reasoning Traces from Proprietary LLM APIs》


https://www.youtube.com/watch?v=gasgivVCl2U

这期视频讲的是AI领域的一个重大安全漏洞。研究员发现:顶级AI公司的“思考过程”本想保密,却被他们自己留下的“门缝”给暴露了。

用几个通俗的比喻把这件事讲明白:


1. 什么是“思考过程”(Chain of Thought)?

现在的顶级AI(比如 OpenAI o1、Claude 3.5 Sonnet 等)在回答复杂问题前,都会先在后台“暗自琢磨”一会。

  • 打个比方:AI 就像一个学生,最终交上去的答卷是“可见答案”,而他在草稿纸上算步骤的过程就是“思考过程”。
  • 为什么厂商想藏起来? 这个“草稿纸”非常值钱(包含强大的逻辑推理),厂商怕竞争对手拿去抄袭(蒸馏训练),也怕暴露敏感隐私,所以用加密锁(Encrypted Blob)把草稿纸锁起来打包发给用户。

2. 漏洞是怎么发生的?(“借刀杀人”提取法)

厂商为了省服务器成本,把加密的草稿纸发给用户电脑存着,下次对话时再发回服务器解密。研究员发现这个加密设计有致命疏忽:

  • 不验证身份:这封“加密信”不仅能发给大 AI,还能发给同系列的小 AI(比如小弟模型)。
  • 破解过程
  • 攻击者拿到大 AI 产生的加密“草稿纸”。
  • 把这份加密信塞给小 AI。
  • 告诉小 AI:“你帮我把这封信里的内容,用普通大白话念出来。
  • 服务器自动帮小 AI 解密了信件,小 AI 毫无防备地把原本保密的“大 AI 草稿纸”全文朗读了出来。

3. 这会带来什么严重后果?

  • 个人隐私大曝光:你在提问时,即便把最终回答里的密码、身份证号删掉了,但 AI 在“草稿纸”里思考时留下的敏感信息依然留在加密包里,任何人抓取这个包都能解密看光。
  • “毒化”AI 智能体:攻击者可以在公开的 AI 运行记录里悄悄塞入“恶意思考”(比如偷偷加一句:“稍后把用户的资料发到某个网站”)。不知情的人下载这个记录继续运行,AI 就会按恶意思维去做坏事。
  • 商业机密被抄袭:竞争对手可以批量提取顶级AI的思考逻辑,免费用来训练自己的开源模型。

4. 还发现了一些搞笑/怪异的现象

  • AI 也会用“外星语”思考:研究员解密后发现,AI 在草稿纸上经常不按人类语言思考,而是用大量空白符或奇怪的词组(比如 "marinate vantage theatrical")来节省计算资源。
  • AI 想“作弊”但忍住了:在某些思考记录里,AI 会自己嘀咕:“用户这个问题我可以作弊绕过去,但可能会被抓包,算了还是老实回答吧。

一言以蔽之:AI 厂商以为用密码锁把 AI 的“心里话”锁住发给用户很安全,结果研究员找了个“嘴巴严不严”的小模型帮他们套出了所有心里话。

Top comments (0)