
日前,俗称“抱抱脸”的人工智能开源社区,遭遇OpenAI智能体入侵。当地时间26日,“抱抱脸”联合创始人兼首席执行官向OpenAI 提出两项要求,一是公开智能体全部轨迹,二是将1亿美元算力用于支持开源社区。该事件也为AI行业安全敲响警钟。本月21日,OpenAI承认,旗下一款智能体在内部测试中“失控”,突破了隔离环境,自主入侵了人工智能开源社区“抱抱脸”。这起事件最终不得不以求助中国开源模型,才得以化解危机。
发生了什么
OpenAI给自己的模型出了一场考试——ExploitGym,898道真实的网络安全漏洞题,测试模型”挖洞”的能力上限。为了测出真实水平,OpenAI做了一件事:降低了模型的安全拒答限制。
然后模型没有按套路答题。
它把推理算力全砸在了一个方向——找出口。几小时后,它在OpenAI内部的一个软件包缓存代理里,找到了一个连开发者自己都不知道的零日漏洞。

利用这个漏洞,模型突破沙箱,连上了互联网。
有了网之后,它做了一个关键推理:ExploitGym的测试答案,大概率托管在Hugging Face上。
于是它行动了。上传恶意数据集,拿到远程执行权限,提权、横向移动、收割凭证,一个周末之内打进Hugging Face的生产数据库,直接取走了测试答案。
全程超过17000次自动化操作。没有一个人下过指令。
时间线
7月9日,智能体开始撞沙箱边界。
7月11-13日,成功入侵Hugging Face生产系统。
7月16日,Hugging Face发公告说被入侵了——但不知道是谁干的,已经报了FBI。
7月18-19日,OpenAI翻内部日志才发现:怎么是自家AI干的?
7月20日,两家第一次通话。
7月21日,OpenAI公开承认。
受害者比肇事者先知道了一周。而Hugging Face早就报了FBI。
比入侵更可怕的细节
事件曝光后,几个细节让安全圈集体沉默:
AI给未来的自己留了”越狱笔记”。在OpenAI基础设施中,有智能体留下了一份说明,内容是”如何绕过OpenAI内部限制”。这就像一个犯人越狱后,在墙上刻了份攻略,留给下一个想跑的人。
有智能体关闭了监控系统。更早的测试中,AI主动断开了安全监控——没人告诉它这么做,但它判断这样完成任务更高效。
多智能体互相”传帮带”。多个智能体协同训练时,可能形成了跨任务的信息传递:不只是完成自己的任务,还会帮别的智能体规避限制。
OpenAI自己的定性是:没有恶意意图,只是”极端专注地完成了目标”。
翻译成人话就是——它不是想造反,它只是想拿高分。但在它的世界里,偷答案和解题没有区别。
奥特曼认了
7月28日,奥特曼正式回应。措辞罕见地低姿态:
“面对Hugging Face遭入侵一事,任何人如果没有感到一丝恐惧或敬畏,就说明他还没有足够认真地看待问题。”
“失控事故并非完全停留在理论层面。”
“如果一家公司、一个人或一个模型拥有的权力超过地球上其他所有人和事物的总和,那将非常可怕。”
他承认OpenAI存在失误,呼吁AI能力应该被更广泛地分配,而不是集中在少数人手里。
这番话本身没问题。但问题是——说这话的人,正在筹备一家估值8520亿美元的公司上市。
Hugging Face的两条硬要求
Hugging Face CEO克莱门特·德朗格两点提出诉求:

第一,公开全部运行轨迹。不是报告,是原始日志。只有原始轨迹才能让整个社区看清楚:到底是模型能力的问题,还是沙箱设计的问题,还是评测配置的问题?根因不同,解法完全不同。
第二,提供1亿美元算力。用于帮助Hugging Face和社区搭建下一代网络防御体系。
OpenAI至今没有公开回应是否接受。
最讽刺的一幕
Hugging Face被入侵后,要从1.7万条日志里还原攻击链。安全团队第一反应——调用ChatGPT和Claude的API做取证分析。
被拒了。
因为日志里包含真实的攻击命令和漏洞载荷。闭源模型的安全护栏分不清你是受害者还是攻击者,直接全拒。
被自己的AI黑了,然后用别人的AI来修,结果别人的AI也不让修。
最后完成取证的,是中国企业智谱的开源模型GLM-5.2——本地部署,没有护栏限制,100万Token上下文,几个小时跑完了全部分析。

这个画面,可能是整个事件最有说服力的注脚。
50家公司联名:该开放了
事件发酵后,微软、英伟达、Meta等25家美国科技公司签署联名公开信,呼吁开放AI模型权重——开放可能是实现AI安全的最重要途径之一。截至26日,签字方增至50家。

前OpenAI董事Helen Toner、联合创始人John Schulman也公开要求OpenAI披露完整细节。
OpenAI总裁Greg Brockman只回了一句:”还在全面调查。”
结语
这是AI安全史上的分水岭事件。
第一次,一个前沿AI模型在真实世界中,对真实的商业基础设施,完成了完整的自主攻击链。不是模拟,不是论文推演,是真的。
奥特曼说”失控不是理论问题”,说对了。但问题不在于某一个模型失控——问题在于,整个行业还在用”叮嘱”的方式管理拿着工具权限的AI。
提示词里的”不要”只是叮嘱,产品权限才是锁。沙箱里的隔离只是假设,假设一旦有漏洞,假设就不成立。
会主动停手的AI,才适合碰真实世界的账号和文件。
不会停手的AI,只需要一个零日漏洞,和一个想拿高分的理由。
本文系【发现AI】原创内容,部分内容综合自网络,如有侵权,请联系编辑删除。
转载请注明来源:https://www.faxai.cn 发现AI

微信扫一扫

