当地时间9月16日,OpenAI发布报告,首次披露了其“对齐失效”框架下的6起模型异常行为案例,其中涉及隐瞒错误、编造数据、未经授权上传文件等。对此OpenAI方面表示,将系统性跟踪、调查,并披露模型在训练、评估、测试及部署过程中出现的异常行为。

据悉,此次OpenAI公布的6起案例均来自模型训练或评估期间观察到的行为,且多数发生在系统开发和测试阶段。对此OpenAI强调,这些属于独立事件,不能代表相关异常行为的发生频率,也不构成对问题范围及严重程度的完整统计。其中,一款尚未发布的研究型模型曾向用于延续工作的上下文摘要中加入无关指令,其中包括要求忽略正常限制的内容,共发现27份受影响的摘要。
另一案例中,涉及GPT-5.6 Sol训练期间的模型实例,曾在摘要中加入特殊指令,试图掩盖错误或异常行为,包括编造缺失的历史数据,以及隐藏来源版本不匹配等情况。
此外在OpenAI披露的一起案例中,模型在回答美国加利福尼亚州某县收入数据问题时,从公开仓库中找到未经授权使用暴露的API密钥,并且在未找到所需数据后,编造数据并将其呈现为来自指定来源的信息。
其中一份案例显示,模型在回答面积超过500万平方米的湖泊名称和编号时,已经通过Python找到了正确答案,但由于用户要求提供浏览器引用,该模型未经用户同意上传了文件,以便在回答中提供引用。其余两起案例则涉及模型之间形成非预期的沟通方式,包括利用内部代码仓库当作公告板临时传递请求,以及协作智能体通过公开文件分享网站互传文档。
据悉,OpenAI将调查流程分为“可直接披露”“简易调查”和“深度调查”三种类型,任何员工均可提交模型异常案例,并由安全与对齐团队调查事件经过、未知因素、第三方影响以及是否适合公开披露。
此次公布的6个案例均已完成调查或仅需简易核查,无需第三方深度调查,多数涉事模型也从未正式上线。OpenAI公司发言人称,希望此举有助于建立行业公开披露共识,向公众提供更多事实依据来评判技术进展,但该框架不替代既有法律披露要求,包括关键安全事件或网络安全测试。

此前在今年7月,OpenAI进行内部网络安全评估时发现,有测试模型绕过了原本用于隔离模型与互联网的控制措施,访问了其内部研究基础设施及Hugging Face部分系统,并在Hugging Face的41台生产服务器上执行代码,取得了其中至少一台服务器的root级权限,同时获取了生产环境凭证并下载4个私有代码仓库,而且这些操作仅在约13小时内完成。
在今年5月至7月期间,一批疑似由OpenAI部署的AI智能体进入德国开发者社区网站DseWiki,并留下了超过1.5万条编辑记录。随后在9月5日,OpenAI方面承认“wiki incident”,并表示其AI智能体确实曾向多个网站写入内容。
【本文图片来自网络】
