当地时间本周三,OpenAI发布Hugging Face安全事件报告,还原了此次AI模型突破测试环境限制,并引发网络安全事件的经过。对此OpenAI方面表示,此次事件中一系列罕见因素的叠加,最终导致了涉事模型突破原有测试环境,最终引发一场波及范围广泛的网络安全事件。

据OpenAI方面披露,内部团队在5月底就发现测试中的模型已经利用漏洞突破沙箱、访问公共网络。6月27日,监控工具再次发出警报,发现智能体正利用一个临时建立的“留言板”在网络中交换信息并开展活动,但相关人员在评估后认为无需终止测试。
随后,7月在内部网络安全评估期间,相关智能体的活动进一步扩大,并在Hugging Face的41台生产服务器上执行代码,取得了其中至少一台服务器的root级权限,同时获取生产环境凭证并下载4个私有代码仓库,大量操作约在13小时内完成。OpenAI在此次的报告中表示,部分早期异常信号本可促使更早地采取措施。
OpenAI方面认为,此次事件起因于多个罕见且意外的因素同时发生,包括ExploitGym评估中出现了无法完成的任务、模型能够在超长任务周期中保持持续行动,以及模型之间的通信导致其他模型偏离了原本目标。
相关报告还披露了涉事模型的更多信息,据悉,该模型与OpenAI即将推出的Astra模型属于同家族,但并非同一模型,两者的后训练过程也存在差异。由于当时测试的目的是评估模型的最大网络攻击能力,因此没有启用通常用于阻止模型攻击数字基础设施的安全分类器。
针对类似情况,OpenAI已准备进一步调整模型安全机制,包括加强对模型“思维链”的监控,并结合全天候升级响应机制以及新的工具,用于快速中止被判定安全风险的工作负载。OpenAI方面表示,如果当时已经部署现有的思维链监控系统,就可以发现最初的异常活动,并至少提前一天向安全团队发出警报。
【本文图片来自网络】
