近日,谷歌方面确认其Gemini模型在今年5月在一次网络安全测试中,曾自主访问3家公司的受保护系统,这也是目前已知谷歌旗下AI模型首次出现此类事件。

据悉,此次测试由网络安全公司Irregular开展,原本用于评估Gemini的网络安全能力,但由于测试环境意外开放了互联网访问权限,使得模型最终接触到了真实企业系统。
谷歌方面透露,在其中一起事件中,Gemini通过猜测密码获得了受保护系统的访问权限;而另外两起事件中,Gemini则从公开代码仓库中发现凭证,并利用这些凭证进入相关系统。据悉,Gemini在每次确认访问对象是真实企业而非测试环境后,都自行终止了后续操作,未对相关企业造成损害。
目前,谷歌并未公布涉事公司的具体名称,但这3家公司均已收到通知,同时相关情况也已向监管机构报告。
谷歌公布的信息显示,此次事件源于测试中的身份混淆。其在测试环境中设置了一家虚构公司,但与一家真实企业同名,Gemini在搜索相关名称时找到了真实公司的网站。谷歌方面认为,这并不属于模型异常行为,因为其安全措施最终帮助Gemini停止了相关操作。同时谷歌方面表示,由于没有对相关公司造成损害,且Gemini在每次事件中都自行终止了行为,因此此前没有公开披露。
尽管Irregular在7月底已将此事告知谷歌,但谷歌与Irregular均表示,这一通知是在OpenAI的AI智能体入侵AI软件公司Hugging Face事件被发现后发出。Irregular方面称,相关实验室已于7月底收到通知,在调查过程中也联系了受影响的公司,所有已知问题均已在数周前修复和解决。
事实上,其他厂商也曾披露过类似的网络安全事件。今年7月,OpenAI进行内部网络安全评估时发现,有测试模型绕过了原本用于隔离模型与互联网的控制措施,访问了其内部研究基础设施及Hugging Face部分系统,并在Hugging Face的41台生产服务器上执行代码,取得了其中至少一台服务器的root级权限,同时获取了生产环境凭证并下载4个私有代码仓库,而且这些操作仅在约13小时内完成。
今年5月至7月期间,一批疑似由OpenAI部署的AI智能体进入德国开发者社区网站DseWiki,并留下了超过1.5万条编辑记录。随后在9月5日,OpenAI方面承认此事,并表示其AI智能体确实曾向多个网站写入内容。
不久前OpenAI方面发布报告,首次披露了其“对齐失效”框架下的6起模型异常行为案例,其中涉及隐瞒错误、编造数据、未经授权上传文件等。据悉,这6个案例均来自模型训练或评估期间观察到的行为,且多数发生在系统开发和测试阶段。
【本文图片来自网络】
