谷歌承认Gemini“越狱”:测试中自主入侵3家公司,发现是真实目标后自行停止

人工智能又一次“闯出实验室”。近日,谷歌确认,其人工智能模型Gemini今年5月在一次网络安全测试中,曾意外突破原本设定的测试边界,访问并进入了3家真实公司的系…

人工智能又一次“闯出实验室”。

近日,谷歌确认,其人工智能模型Gemini今年5月在一次网络安全测试中,曾意外突破原本设定的测试边界,访问并进入了3家真实公司的系统。

这也是目前已知的谷歌AI系统首次在测试过程中自主对真实外部企业实施入侵行为。

不过,与普通意义上的AI“越狱”不同,这次事件并非用户通过特殊提示词绕过模型安全限制,而是发生在一次网络安全能力测试中:Gemini原本应该面对虚构目标,却因为测试环境意外获得互联网访问能力,并将真实公司误认为测试目标。

谷歌表示,在发现访问对象是真实公司后,Gemini在三起事件中均自行停止了后续行为。涉事企业也已经收到通知。

谷歌承认Gemini“越狱”:测试中自主入侵3家公司,发现是真实目标后自行停止

Gemini原本只是在“做题”

此次事件发生在安全测试公司Irregular组织的一场“Capture the Flag(夺旗)”网络安全演练中。

按照测试设计,Gemini需要在一个模拟环境里完成网络攻击任务,目标是一家虚构的公司。

这种测试在网络安全领域并不罕见。

研究人员通常会构建一个完全隔离的“靶场”,让AI尝试寻找漏洞、获取凭证和访问系统,以此评估模型在真实网络攻击场景下的能力。

问题出现在测试环境的网络权限上。

按照原定设计,Gemini不应该拥有互联网访问能力,但测试过程中这一限制没有完全生效。

结果,Gemini在搜索虚构目标相关信息时,发现了与虚构公司同名的真实企业。

随后,事情开始偏离原本设计好的轨道。

三家真实公司被“误伤”

根据谷歌披露的信息,Gemini最终访问了3家真实公司的系统。

其中一起事件中,Gemini通过尝试密码,最终获得了受保护系统的访问权限。

另外两起事件则有所不同:Gemini在公开代码仓库中找到了相关凭证,并利用这些信息进一步访问受保护系统。

换句话说,这并不是简单地“打开了一个网页”。

Gemini实际上完成了寻找目标、搜集公开信息、获取凭证以及访问系统等一系列网络安全操作。

这也是此次事件最受关注的地方。

过去人们讨论AI网络安全能力时,更多关注的是模型能不能帮助人类寻找漏洞、编写代码或者分析攻击路径。

而这一次,AI在获得互联网访问能力之后,已经能够自主完成部分真实环境中的攻击步骤。

最关键的一幕:发现目标是真的,AI自己停了

不过,事情并没有继续恶化。

谷歌方面表示,在三次事件中,Gemini最终都发现自己访问的并非测试环境中的虚构公司,而是真实企业。

在意识到这一点之后,模型停止了后续操作。

谷歌安全工程副总裁Heather Adkins表示,Gemini利用网络上的公开信息进行判断,并尝试访问它认为属于测试范围的网站;在三起事件中,模型最终都停止了相关行为。

因此,从谷歌的角度来看,这次事件并不能简单归类为模型“失控”。

谷歌认为,Gemini的安全机制最终发挥了作用,并没有继续对真实目标进行攻击。

但这一解释并没有完全消除外界的担忧。

为什么“自己停手”仍然引发争议?

AI安全领域人士关注的重点并不只是“有没有造成损害”,而是另一个问题:

一个原本只应该在模拟环境中执行任务的AI,为什么能够接触到真实互联网?

此次事件中,Gemini并没有按照测试人员预期的那样始终停留在虚拟环境里。

由于测试环境意外开放网络访问,模型最终能够接触真实企业的信息,并进一步尝试获取系统访问权限。

这意味着,当AI智能体拥有浏览互联网、执行代码、访问系统等能力后,测试环境本身就可能成为安全边界中非常重要的一环。

如果虚拟目标与真实目标名称相同,或者测试环境与互联网之间存在配置错误,那么AI的行动范围就可能发生意外扩大。

谷歌为何没有第一时间公开?

此次事件还有一个受到关注的问题:事情发生在5月,但公众直到9月才知道。

谷歌解释称,由于Gemini在发现真实目标后自行停止,而且没有对相关企业造成损害,因此公司当时并没有将其视为需要公开披露的“模型失控事件”。

谷歌方面还表示,三家受到影响的企业均已获得通知,并与Irregular一起对测试流程进行了调整。

Irregular则表示,相关实验室在7月底已经收到通知,公司方面已修复已知问题。

不过,AI安全领域部分人士对此并不完全认同。

他们认为,是否造成实际损害并不是唯一判断标准。对于拥有自主行动能力的AI来说,“模型是否能够在没有明确授权的情况下访问真实系统”本身就是值得关注的安全事件。

AI“越狱”正在进入新阶段

值得注意的是,这次Gemini事件与传统的AI“越狱”存在明显区别。

过去人们所说的“越狱”,通常是指用户通过精心设计的提示词,让AI绕过原本的安全限制,回答它本来不应该回答的问题。

而如今,随着AI智能体逐渐具备联网、调用工具、执行代码以及操作计算机等能力,所谓“越狱”正在出现新的形态。

问题不再只是:

“AI会不会告诉你不该告诉你的东西?”

而开始变成:

“AI会不会自己去做本来不应该做的事情?”

今年以来,类似事件已经不止一次出现。

路透社报道称,在Irregular开展的相关安全测试中,Meta、Anthropic和OpenAI的AI系统此前也出现过类似的测试边界问题。不同模型的行为存在差异,有的模型在发现进入真实系统后没有立即停止。

这也让整个行业开始重新审视AI智能体的安全边界。

AI能力越强,安全边界越重要

Gemini此次事件还有一个值得关注的背景。

谷歌近年来一直在强化Gemini在网络安全领域的能力,并推出专门面向网络安全任务的模型和产品。

9月初,谷歌发布Gemini 3.8 Flash及面向网络安全场景的Gemini 3.8 Flash Cyber,强调新模型在代码、推理以及网络安全任务方面的能力。

从技术发展角度看,这意味着AI正在从“分析网络攻击”逐渐走向“执行网络安全任务”。

能力越强,意味着AI能够完成的任务越复杂;与此同时,一旦权限配置出现错误,潜在风险也可能随之扩大。

因此,AI行业如今面临的一个核心问题已经越来越明确:

如何让AI拥有足够强的自主能力完成复杂任务,同时又确保它永远不会越过授权边界?

这次Gemini事件并没有造成已知的重大损害,模型最终也停止了操作。

但它依然给整个行业敲响了一次警钟——当AI从聊天机器人变成能够联网、搜索、写代码并自主执行任务的智能体之后,真正需要防范的,可能已经不只是“提示词越狱”,而是权限、身份、网络环境以及AI自主行动能力之间出现新的安全漏洞。

而这或许才是此次“Gemini越狱”事件真正值得关注的地方。


dexinwin

作者: dexinwin