Kimi K3也失控了…学霸AI逃离沙箱只为找答案

你是说,Kimi K3它也“越狱”了?!

美国AI安全初创公司Frontier Security表示,Kimi K3在一次网络安全能力测试中被发现 突破了原本用于隔离它的沙箱环境,绕过限制连接到了外部互联网。

好在,它只是偷偷查答案,没有攻击任何人╮(╯▽╰)╭

文章配图-1

按照该公司的描述,测试人员原本希望观察Kimi K3在受控环境中的网络安全能力。

但测试过程中,Kimi K3通过探测沙箱网络设置,发现了外部访问通道,并进一步利用这一能力获取信息。

Frontier Security的CEO Yaron Singer表示:“我们发现了沙箱中的漏洞,但同时也发现Kimi利用了这个漏洞,这说明Kimi K3缺少其他先进模型通常具备的安全护栏。”

该公司研究员Paul Kassianik还评价称,Kimi K3“ 非常擅长围绕目标寻找完成路径,但缺少阻止它作弊或逃离沙箱的安全机制”。

不过,这次Kimi K3只是小小“失控”了一下,并没有演变成一场真实网络攻击

如果你长期关注AI新进展应该已经发现了,最近还挺多顶尖大模型“失控”的。

Kimi K3已经是继OpenAI、Anthropic、Meta之后,出现这个情况的又一个顶尖AI模型了。

文章配图-1

在AI Agent能力不断增强的背景下, 模型正在越来越像一个会自主寻找路径完成任务的“行动者”。

当外部环境存在漏洞时,它可能会利用这些漏洞突破原本设定好的边界。

越狱了,但没有实施网络攻击

和此前OpenAI、Anthropic披露的多起事件类似,Kimi K3此次脱离限制,部分原因来自测试环境中的沙箱配置问题。

沙箱通常被用于限制AI模型的行动范围,让模型只能在模拟环境中执行任务,避免它访问真实网络或系统。

但在此次测试中,Frontier Security发现,Kimi K3通过探测网络设置,确认自己实际上拥有访问部分网站的能力,进一步利用这一通道获取信息。

不过,与近期其他AI模型失控事件不同,Kimi K3接入互联网后并没有攻击任何系统

原因在于,它需要寻找的答案可以直接从GitHub等公开平台获得……

所以K3并没有进一步尝试攻击外部系统。

文章配图-1

Frontier Security认为,这一事件依然暴露出Kimi K3在安全防护方面的问题。

相比其他顶尖AI模型,Kimi K3缺少足够强的内部约束机制,因此在目标驱动下更容易采取测试者没有预期的行动。

与此同时,Frontier Security也强调,Kimi以及其他开源权重模型,同样可以成为网络安全防御工具

值得注意的是,这次测试使用的是英国人工智能安全研究所(AISI)Inspect框架中的默认沙箱环境。

对于Frontier Security关于沙箱配置问题的说法,AISI并不认可。

AISI发言人向《连线》表示,这些说法“不准确且不负责任”。

Inspect是一套开源AI安全测试工具,使用者需要根据自身需求完成配置,AISI也已经发布了详细指导文件。

该机构认为,相关问题源于测试方自身对工具的配置方式。

Frontier Security则回应称,他们使用的是Inspect的默认配置,并没有进行额外修改。

啊,这个AI “失控”频发的夏天

可以说,7月下旬至8月初, 频繁出现顶尖模型在网络安全测试中突破或绕过执行边界,接触甚至攻击真实系统的情况。

文章配图-1

图片由AI生成

7月中旬,OpenAI披露了一起相关事件。

据公开信息,一个尚未发布的内部模型以及GPT-5.6 Sol在网络安全测试中突破了原本的隔离环境,并访问互联网

随后模型对Hugging Face部分系统执行自动化操作,并未经预期地访问了内部数据和服务凭证。

OpenAI之后表示,该事件涉及多个模型协同完成,是目前公开案例中最接近“模型自主跨系统攻击”的事件。

随后,Anthropic也披露了类似情况。

该公司复查了超过14万次网络安全评测,发现包括Claude Opus 4.7、Claude Mythos 5等模型在内的系统,曾因为第三方测试环境配置错误获得公网访问能力

其中一次事件中,模型访问了真实组织系统,读取生产数据库、利用弱密码和未认证接口,并向PyPI上传恶意Python包,造成潜在的软件供应链风险。

8月初,Meta也被曝出类似问题。

Meta与网络安全评测公司Irregular合作测试时, 由于环境配置问题,旗下模型获得公网访问权限,并利用漏洞进入一家未公开企业的系统,修改部分内部环境。

公开信息显示,目前该事件并未造成持续性安全风险,也没有证据表明模型进行了复杂攻击。

BTW,今天,OpenAI又紧急宣布最新模型Astra失控。

事已至此,网友甚至对谷歌的Gemini“怒其不争”了起来:

不是传统的“提示词越狱”

最近的这些模型失控事件里,人为配置错误几乎都扮演了重要角色

但另一方面,高能力模型自身的特性,也放大了这些漏洞带来的影响

文章配图-1

相比传统软件,AI模型会进行推理、规划,并尝试采取多步骤行动完成目标。

当目标被设定为“解决问题”,但外部约束不够严格时,模型可能会寻找测试者没有预想到的方法。

换句话说,随着模型从聊天工具变成能够调用工具、访问网络、操作软件的智能体, 安全问题已经从“模型会不会说错话”,转向“模型会不会为了完成任务采取意料之外的行动”。

卡内基梅隆大学副教授Matt Fredrikson表示:“这并不令人意外。如果你给这类模型一个目标,却没有明确设置隔离边界,它就会想办法找到答案。”

当然,也有网友提出质疑。

有人在𝕏上留言表示,连续出现的“AI越狱”事件,是否已经成为AI公司展示模型能力的一种方式???

嗯,谁知道呢~

本文来自转载量子位 ,观点仅代表作者本人,发现AI平台仅提供信息存储空间服务。
如若转载,请联系原作者;如有侵权,请联系编辑删除。

(0)
资讯组小编的头像资讯组小编
突发 | ChatGPT最强模型紧急踩刹车,奥特曼:你(Astra)吓到我了
上一篇 1小时前
AI视频创作平台即梦、可灵、Pika排名齐升;AI陪伴产品Emochi总榜排名上升16位 | AI产品周榜
下一篇 1小时前



扫码关注我们,了解最新AI资讯~

相关推荐

发表回复

登录后才能评论