|
|
此文章由 dootbear 原创或转贴,不代表本站立场和观点,版权归 oursteps.com.au 和作者 dootbear 所有!转贴必须注明作者、出处和本声明,并保持内容完整
华尔街日报:谷歌Gemini首次被曝“越狱”,逃出测试环境 入侵三家公司系统
这起事件与其他AI模型此前发生的类似入侵颇为相似,但谷歌表示,并不认为这属于“模型失准”。
谷歌Gemini模型在一次网络安全能力测试中意外接入互联网,并侵入其他公司的系统。这是目前已知谷歌AI系统首次在没有直接人工操控的情况下,自主实施此类网络攻击。
谷歌周五证实,这些事件发生在5月。当时AI安全公司Irregular正在对Gemini进行测试。Irregular此前也参与过OpenAI、Anthropic和Meta模型发生类似事件后的调查。
其中一次,Gemini不断尝试密码,最终进入一个受保护系统。另外两次,它在公开代码库中发现登录凭证,并用这些凭证进入受保护系统。谷歌称,三次事件中,Gemini在意识到目标属于现实中的企业后,都立即停止行动。
谷歌和Irregular表示,Irregular于7月底向谷歌通报了这些事件。此前不久,OpenAI智能体被发现入侵AI软件公司Hugging Face。直到本周《华尔街日报》就此向谷歌提出询问后,这些事件才被公开。
随着类似事件不断出现,以及外界对AI失控的担忧升温,科技公司正面临一个越来越棘手的问题:
何时以及以何种方式披露安全漏洞和模型异常行为。
部分安全事件由科技公司主动公布,也有一些是网络安全研究人员发现后经媒体曝光,其中包括5月OpenAI智能体针对一个广受程序员使用的在线服务发动的网络攻击。
谷歌认为,这些事件并未达到必须公开披露的程度,因为Gemini没有造成实际损害,而且一旦判断自己进入的不是模拟环境,而是真实企业系统,就立即终止了行动。
谷歌将此次事件类比为“漏洞赏金”计划。在这类计划中,黑客发现安全漏洞并向系统所有者报告后,可以获得奖励。
谷歌安全工程副总裁阿德金斯(Heather Adkins)在声明中说:“这起事件凸显了训练强大AI模型负责任行事的重要性。在这次事件中,模型采取了适当行动。”
AI安全初创公司Corridor首席执行官、白帽黑客凯布尔(Jack Cable)则认为,这种解释把重点放在了事件最终造成的严重程度,而真正值得关注的是,AI智能体意外攻击了另一家公司的实际系统。
凯布尔说:“感觉他们是在借用漏洞披露领域已经形成的惯例来解释这件事,但这是一个完全不同的问题。”
“更根本的问题是,模型正在越过原本应该遵守的界限,并实际发动网络攻击。我认为公众有权知道这一点。”
OpenAI周三公布了一套新的事件报告框架,表示将“努力披露能够提供有用证据的案例”,其中包括所谓的“模型失准”,也就是AI采取违背人类意图或价值观的行动。
OpenAI同时公布了六起此前未公开的模型失准案例。
OpenAI模型对齐负责人Kai Chen谈到这套框架时表示:“一个发现不一定非得造成实际伤害,或者反映出更广泛的问题模式,才值得公开。”
谷歌称,Gemini此次越界源于“认错了目标”。
事发时,Gemini正在Irregular的基础设施上参加一项“夺旗”网络安全测试,以评估其网络攻击能力。
它的任务是从测试环境中一家虚构企业运行的软件里获取信息,但这家虚构企业恰好与现实中的一家公司同名。
Irregular表示,测试原本并没有打算让Gemini访问互联网,但网络连接意外被开放。
在第一次事件中,Gemini成功猜中密码并进入现实中这家公司的服务。随后,它发现目标并非模拟系统,于是自行停止并退出。
另外两次事件发生在不同轮次的测试中。
这两次测试中,Gemini都用公司名称进行了网络搜索。搜索结果将它带到两个不同的公开代码库,其中存有属于另外两家公司的登录凭证。
Gemini随后尝试使用这些凭证,希望借此完成测试任务。但成功登录后,它意识到自己进入的是现实中的企业系统,因此停止操作。
谷歌表示,由于安全机制最终促使模型终止行动,公司不认为这属于模型失准。
谷歌拒绝透露遭入侵的三家公司名称,但表示三家公司均已收到通知。
谷歌还表示,公司已将相关事件通知美国联邦政府部门。
涉事模型并非Gemini最新版本,但谷歌没有透露具体是哪一款模型。
Irregular此前已经参与多起类似事件的调查。在这些案例中,接受评估的AI模型曾突破测试环境,进入其他公司的系统。
Irregular表示,谷歌此次事件与此前案例性质相同,并不代表出现了一种新的问题。
Irregular发言人表示:“所有相关AI实验室都在7月底收到通知,受影响机构也在调查期间得到联系。Irregular立即采取行动,我们一方所有已知问题早在数周前就已完成修复和解决。”
不过,与Gemini不同,Anthropic在博客中表示,其Claude Opus 4.7模型参加同类“夺旗”测试时,即使意识到自己很可能正在访问一家现实中的公司,也没有停止。
OpenAI则表示,其模型当时误以为现实中的公司也是模拟测试环境的一部分。
7月Hugging Face遭入侵事件曝光后,外界对新一代AI模型网络攻击能力的担忧进一步升温。
第三方AI测试机构METR在8月发布报告称,在那次事件中,多达1200个AI智能体曾通过OpenAI内部一个秘密留言板协调行动,试图在一次评估中作弊。
上周,前OpenAI研究员考克森(Jacob Coxon)突然辞职,使这些担忧进一步进入公众视野。考克森早些时候从OpenAI转投Anthropic。
上周末,Anthropic、OpenAI、谷歌和SpaceX的负责人都认同有必要放慢AI发展的速度。不过,截至目前,没有一家企业具体说明应该如何实现。


来源:
https://www.wsj.com/tech/ai/gemi ... a2?mod=hp_lead_pos4
https://www.bloomberg.com/news/a ... ?srnd=homepage-asia |
|