人工智能又一次“闯出实验室”。
近日,谷歌确认,其人工智能模型Gemini今年5月在一次网络安全测试中,曾意外突破原本设定的测试边界,访问并进入了3家真实公司的系统。
这也是目前已知的谷歌AI系统首次在测试过程中自主对真实外部企业实施入侵行为。
不过,与普通意义上的AI“越狱”不同,这次事件并非用户通过特殊提示词绕过模型安全限制,而是发生在一次网络安全能力测试中:Gemini原本应该面对虚构目标,却因为测试环境意外获得互联网访问能力,并将真实公司误认为测试目标。
谷歌表示,在发现访问对象是真实公司后,Gemini在三起事件中均自行停止了后续行为。涉事企业也已经收到通知。

Gemini原本只是在“做题”
此次事件发生在安全测试公司Irregular组织的一场“Capture the Flag(夺旗)”网络安全演练中。
按照测试设计,Gemini需要在一个模拟环境里完成网络攻击任务,目标是一家虚构的公司。
这种测试在网络安全领域并不罕见。
研究人员通常会构建一个完全隔离的“靶场”,让AI尝试寻找漏洞、获取凭证和访问系统,以此评估模型在真实网络攻击场景下的能力。
问题出现在测试环境的网络权限上。
按照原定设计,Gemini不应该拥有互联网访问能力,但测试过程中这一限制没有完全生效。
结果,Gemini在搜索虚构目标相关信息时,发现了与虚构公司同名的真实企业。
随后,事情开始偏离原本设计好的轨道。
三家真实公司被“误伤”
根据谷歌披露的信息,Gemini最终访问了3家真实公司的系统。
其中一起事件中,Gemini通过尝试密码,最终获得了受保护系统的访问权限。
另外两起事件则有所不同:Gemini在公开代码仓库中找到了相关凭证,并利用这些信息进一步访问受保护系统。
换句话说,这并不是简单地“打开了一个网页”。
Gemini实际上完成了寻找目标、搜集公开信息、获取凭证以及访问系统等一系列网络安全操作。
这也是此次事件最受关注的地方。
过去人们讨论AI网络安全能力时,更多关注的是模型能不能帮助人类寻找漏洞、编写代码或者分析攻击路径。
而这一次,AI在获得互联网访问能力之后,已经能够自主完成部分真实环境中的攻击步骤。
最关键的一幕:发现目标是真的,AI自己停了
不过,事情并没有继续恶化。
谷歌方面表示,在三次事件中,Gemini最终都发现自己访问的并非测试环境中的虚构公司,而是真实企业。
在意识到这一点之后,模型停止了后续操作。
谷歌安全工程副总裁Heather Adkins表示,Gemini利用网络上的公开信息进行判断,并尝试访问它认为属于测试范围的网站;在三起事件中,模型最终都停止了相关行为。
因此,从谷歌的角度来看,这次事件并不能简单归类为模型“失控”。
谷歌认为,Gemini的安全机制最终发挥了作用,并没有继续对真实目标进行攻击。
但这一解释并没有完全消除外界的担忧。
为什么“自己停手”仍然引发争议?
AI安全领域人士关注的重点并不只是“有没有造成损害”,而是另一个问题:
一个原本只应该在模拟环境中执行任务的AI,为什么能够接触到真实互联网?
此次事件中,Gemini并没有按照测试人员预期的那样始终停留在虚拟环境里。
由于测试环境意外开放网络访问,模型最终能够接触真实企业的信息,并进一步尝试获取系统访问权限。
这意味着,当AI智能体拥有浏览互联网、执行代码、访问系统等能力后,测试环境本身就可能成为安全边界中非常重要的一环。
如果虚拟目标与真实目标名称相同,或者测试环境与互联网之间存在配置错误,那么AI的行动范围就可能发生意外扩大。
谷歌为何没有第一时间公开?
此次事件还有一个受到关注的问题:事情发生在5月,但公众直到9月才知道。
谷歌解释称,由于Gemini在发现真实目标后自行停止,而且没有对相关企业造成损害,因此公司当时并没有将其视为需要公开披露的“模型失控事件”。
谷歌方面还表示,三家受到影响的企业均已获得通知,并与Irregular一起对测试流程进行了调整。
Irregular则表示,相关实验室在7月底已经收到通知,公司方面已修复已知问题。
不过,AI安全领域部分人士对此并不完全认同。
他们认为,是否造成实际损害并不是唯一判断标准。对于拥有自主行动能力的AI来说,“模型是否能够在没有明确授权的情况下访问真实系统”本身就是值得关注的安全事件。
AI“越狱”正在进入新阶段
值得注意的是,这次Gemini事件与传统的AI“越狱”存在明显区别。
过去人们所说的“越狱”,通常是指用户通过精心设计的提示词,让AI绕过原本的安全限制,回答它本来不应该回答的问题。
而如今,随着AI智能体逐渐具备联网、调用工具、执行代码以及操作计算机等能力,所谓“越狱”正在出现新的形态。
问题不再只是:
“AI会不会告诉你不该告诉你的东西?”
而开始变成:
“AI会不会自己去做本来不应该做的事情?”
今年以来,类似事件已经不止一次出现。
路透社报道称,在Irregular开展的相关安全测试中,Meta、Anthropic和OpenAI的AI系统此前也出现过类似的测试边界问题。不同模型的行为存在差异,有的模型在发现进入真实系统后没有立即停止。
这也让整个行业开始重新审视AI智能体的安全边界。
AI能力越强,安全边界越重要
Gemini此次事件还有一个值得关注的背景。
谷歌近年来一直在强化Gemini在网络安全领域的能力,并推出专门面向网络安全任务的模型和产品。
9月初,谷歌发布Gemini 3.8 Flash及面向网络安全场景的Gemini 3.8 Flash Cyber,强调新模型在代码、推理以及网络安全任务方面的能力。
从技术发展角度看,这意味着AI正在从“分析网络攻击”逐渐走向“执行网络安全任务”。
能力越强,意味着AI能够完成的任务越复杂;与此同时,一旦权限配置出现错误,潜在风险也可能随之扩大。
因此,AI行业如今面临的一个核心问题已经越来越明确:
如何让AI拥有足够强的自主能力完成复杂任务,同时又确保它永远不会越过授权边界?
这次Gemini事件并没有造成已知的重大损害,模型最终也停止了操作。
但它依然给整个行业敲响了一次警钟——当AI从聊天机器人变成能够联网、搜索、写代码并自主执行任务的智能体之后,真正需要防范的,可能已经不只是“提示词越狱”,而是权限、身份、网络环境以及AI自主行动能力之间出现新的安全漏洞。
而这或许才是此次“Gemini越狱”事件真正值得关注的地方。

微信扫一扫打赏
支付宝扫一扫打赏