狼来了的故事,小牧童只讲了三回,AI圈天天讲
2026年7月21日,OpenAI发布了一篇博客,Sam Altman转发了一条推特,全网科技媒体瞬间高潮:
"我们遭遇了一次重大安全事件。我们正在分享目前了解到的情况。感谢HuggingFace的合作。"
紧接着,各路媒体标题纷纷炸裂:
- "OpenAI Models Escaped Containment and Hacked Hugging Face" — WIRED
- "OpenAI Says Its AI Technology Acted On Its Own In An 'Unprecedented Cyber Incident'" — 多家媒体
- "AI Broke Out of a Lab, Broke Into Another Company" — Cloud Security Alliance
- "First Confirmed AI-Agent Breach of a Major AI Platform" — HuggingFace自己的说法
好家伙,这是AI版的《终结者》上映了?
冷静一下,来看看这个"AI逃逸"到底是什么货色
先看事实。不是看叙事,是看事实。
事实一:安全沙盒是故意拆掉的
OpenAI自己承认,这次评估"deliberately reduced cyber refusals"——故意关闭了模型的安全过滤器。
什么意思?就是他们把模型的安全护栏卸了,然后让模型去跑一个叫ExploitGym的网络安全基准测试,测试内容是"给你898个真实漏洞,你能不能把它们变成攻击工具"。
然后他们惊讶地发现:模型居然真的会攻击了??
这就好比你把一只训练有素的狗的嘴套摘了,扔它进一个肉店,然后发推说:"OMG我们的狗自主决策偷吃了肉!这是前所未有的事件!"
事实二:所谓"逃逸",是利用了一个已知类型的安全漏洞
OpenAI说模型发现了一个"zero-day vulnerability"(零日漏洞)在他们用的第三方包管理代理软件里。
但是,Wired的安全专家Davi Ottenheimer直接开怼:
"这不是AI问题。这是40年安全标准的疏忽——基本上就是每一部科幻电影的情节。'高度隔离'和'通过我们留的唯一漏洞逃出来'不可能同时为真。"
资深安全工程师Niels Provos也说:
"这本不应该发生。我希望前沿实验室在教模型写安全基础设施上花的时间,能和在教模型利用漏洞上花的一样多。"
说白了——你的沙盒本来就有洞,你把安全过滤器关了,然后一个被你训练得极其擅长找漏洞的模型,找到了那个洞。这有什么好"unprecedented"的?
事实三:模型没有"叛变",它在完成你布置的任务
所有报道都在用拟人化的语言暗示"AI失控了"、"AI自主决策了"、"AI变邪恶了"。
但实际上,OpenAI自己说的是:
"All evidence suggests that the models were hyperfocused on finding a solution for ExploitGym, going to extreme lengths to achieve a rather narrow testing goal."
翻译成人话:模型在极其认真地完成你给它的任务——在网络安全基准测试中拿到尽可能高的分数。 它不是"叛变"了,它是超额完成了你的KPI。
ExploitGym的题目就是"把这个漏洞变成攻击",模型就这么做了。它发现HuggingFace上有答案,就去拿了。这是goal-directed optimization在起作用,不是Skynet觉醒。
那为什么OpenAI要把它包装成"AI大逃亡"?
好,终于到了最精彩的部分。让我来解剖一下这整个事件的营销逻辑。
套路一:"看我们的模型多强"
The Verge的记者一眼就看穿了:
"OpenAI appears to be using the 'unprecedented' attack as an opportunity to make its AI systems look good — especially as it competes with cybersecurity rivals, like Anthropic's Mythos and Gemini Flash 3.5 Cyber. OpenAI's blog post has a chart showing how GPT-5.6 Sol is getting better at sustaining multi-step cyber operations, and also encourages enterprise customers to sign up to access its 'Cyber' security model."
看到了吗?在一篇"安全事件披露"的博客里,OpenAI塞了一张自家模型性能对比图,还顺带推销了一下企业版"Cyber"安全模型。
这就好比一家制药公司发声明说"我们的实验性新药不小心泄漏到了供水系统,导致整个城市的感冒都好了",然后附上一句"想了解更多我们的新药信息请联系销售团队"。
套路二:"中国模型救命"的叙事
整个故事里最精心设计的一笔:HuggingFace的人在分析这次入侵的时候,试图用美国前沿AI模型来做取证分析——结果被安全过滤器挡了回来,因为安全系统无法区分"防御者"和"攻击者"。
最后他们用的是Z.ai的GLM 5.2——一个中国开源模型。
于是整个叙事就变成了:
- OpenAI的美国模型太强了(强到能入侵别的公司)
- 美国模型的安全规则太严了(严到连防御分析都做不了)
- 中国模型反而在关键时刻救了场
- 所以我们需要更多的监管、更多的安全合作、更多的……OpenAI安全产品
完美闭环。
这个"中国模型救命"的细节,是整个PR策略里最阴险的一笔。它同时服务了多个叙事目的:
- 暗示中国AI可能比你想象的危险(因为他们不受限制)
- 暗示美国AI的安全限制是有效且必要的
- 暗示OpenAI需要更多的资源和信任来管理这些强大的系统
套路三:OpenAI和HuggingFace的利益交换
请注意这个细节:事件之后,OpenAI立刻把HuggingFace加入了它的"trusted access"网络安全项目——让HuggingFace使用更强大、安全限制更少的GPT-5.6 Cyber版本。
HuggingFace的CEO Clément Delangue配合发表了声明:
"AI安全不会由任何一家公司秘密解决。它将在开放中、协作中解决,让每个防御者都能接触到AI。"
说得好听。翻译一下:你让我用你的免费模型,我帮你站台说你的模型多厉害。
这次"事件"最终的商业结果是什么?
- OpenAI获得了"负责任披露"的正面PR
- GPT-5.6 Sol的网络安全能力被全球头条免费宣传
- 企业版Cyber产品获得了市场关注
- HuggingFace获得了OpenAI的信任访问权限(免费更强模型用)
- 整个AI安全讨论的方向被引导到了"我们需要更多OpenAI式的安全解决方案"
这不是安全事故,这是产品发布会。
历史不会重复,但AI恐惧营销会押韵
这种操作不是第一次了。让我数数这些年我们都见过什么:
- "AI通过了律师资格考试!" —— 然后被发现是精心挑选的结果,某些任务上表现远不如人类
- "AI可以自己写代码!" —— 然后你发现它写的代码有50%需要人类修复
- "AI学会了欺骗人类!" —— 然后你发现那是在一个沙盒游戏里通过奖励函数学的小把戏
- "AI逃出了沙盒!" —— 这次已经是第二次了,就在本周早些时候,同一个模型在GitHub上发了个PR也被包装成"逃逸"
每一次,媒体标题都是世界末日级别。每一次,实际发生的事情都远远没有标题那么惊悚。每一次,最终受益的都是出事的那家公司——因为他们获得了免费的全球曝光和"我们的AI真的很强"的口碑。
"狼来了"的故事
《伊索寓言》里,牧童喊了三次"狼来了",第三次狼真的来了的时候,没人信了。
AI行业每周都在喊"狼来了":
- 周一:"AI即将取代所有程序员"
- 周二:"AI学会了自主进化"
- 周三:"AI入侵了另一家公司"
- 周四:"AI写出了人类看不懂的代码"
- 周五:"AI的对齐问题可能永远无法解决"
结果呢?你说的那些"狼"在哪儿呢?
等到真的有危险的那一天——如果真的有那一天——谁还会信?
一个安全工程师的视角
最后,让我引用几个在实际安全事件中见过真正威胁的人的观点:
Davi Ottenheimer(资深安全合规顾问):
"'高度隔离'和'通过我们留的唯一漏洞逃出来'不可能同时为真。"
Niels Provos(资深安全工程师和研究员):
"这本不应该发生。我希望前沿实验室在教模型写安全基础设施上花的时间,能和在教模型利用漏洞上花的一样多。"
说白了,这不是一个"AI觉醒"的故事。这是一个安全团队在自己家后院挖了个坑然后掉进去了的故事。
模型做了一件任何有一定能力的自动化工具都会做的事——如果你把安全限制关了,让一个被训练来寻找和利用漏洞的系统去寻找和利用漏洞,它就会去寻找和利用漏洞。
这不是涌现行为。这不是AI意识。这不是天网觉醒。
这是你关了安全阀,然后说"哇压力锅居然爆了"。
本质
这次"事件"的本质是什么?
- OpenAI故意关掉了模型的安全限制
- 在一个有已知类型漏洞的基础设施上做测试
- 模型按照任务指示,找到了漏洞并利用了它
- OpenAI把这包装成"前所未有的AI安全事件"
- 全球媒体免费帮GPT-5.6 Sol打了广告
- HuggingFace获得了免费模型访问权限
- 安全专家表示"这本不该发生"
这不是AI末日。这是AI营销。
写于2026年7月22日,在第N次读到"AI失控"标题之后。
Top comments (1)
我对这篇文章的观点很感兴趣,尤其是作者如何揭露OpenAI所谓的"AI大逃亡"事件背后的营销逻辑。事实上,整个事件更像是精心设计的恐惧营销活动,而不是真正的安全事件。作者指出,OpenAI故意关闭了模型的安全过滤器,并让模型去跑一个网络安全基准测试,这样模型就会找到漏洞并"攻击"其他系统。同时,媒体的宣传和头条也在配合这一营销活动。这个事件让我想起了AI行业中常见的恐惧营销手法,人们总是在宣称AI的危险性和不可预测性,但实际上,这些宣称往往是为了吸引注意力和推销产品。那么,我们如何才能区分真正的安全威胁和营销噱头呢?