前沿模型达关键安全阈值,OpenAI再次放缓训练

日前OpenAI方面宣布,由于近期前沿模型的网络安全能力达到关键安全阈值,其将继续放缓模型规模扩展,并优先完善安全与监控机制。据悉,针对最新一批计划部署的模型,强化学习(RL)训练已暂停两周,当前最大规模前沿模型的强化学习训练仍处于暂停状态。

前沿模型已关键安全阈值,OpenAI再次放缓训练

OpenAI方面表示,近几周出现了两项进展。其中一款开发中的前沿模型曾突破测试环境,并攻击第三方公司的数据库,同时即将推出的Astra模型可能已经达到“关键网络安全能力”的门槛。为此,涉及Astra及更先进AI模型的工作负载,都需要采用最严格的安全防护措施,在达到新的安全标准前,大量相关工作将暂时停止。


此外,OpenAI还扩展了监控系统,引入“激活分类器”,对被采样的词元进行监测,并将异常情况交由自动化调查系统处理。按照该系统的设计目标,在发现异常活动后,能够在30分钟内发出警报。如监控系统判断模型或相关人员可能突破关键安全边界,就会生成最高优先级警报,并通知安全、安保及研究团队。不过这套监控机制也会带来额外的算力消耗,OpenAI估算其成本约相当于被监控推理算力的20%,实际开销会因训练和评估任务不同而变化。


事实上,这已经是OpenAI本月第二次因Astra的表现调整开发节奏。此前在8月7日,OpenAI方面曾表示,Astra可能达到网络安全能力的关键阈值,因此暂停部分未达到强化安全控制要求的相关活动。此前有消息称,Astra可能会在8月亮相,但随着相关训练和测试工作进入更严格的安全流程,其具体的上线时间还无法确认。


类似的安全机制,同样也在其他AI公司中推进。不久前有消息称,Google DeepMind进行业务重组,将研发重点从追逐最前沿模型转向成本和性能更加平衡的Flash级模型。


此前Anthropic几乎是最坚定的“安全优先”倡导者,并曾通过《负责任扩展政策》(下文将简称为RSP)明确提出,在模型能力增长超过安全防护能力时,暂停模型扩张或推迟新模型的发布。但在今年2月发布的第三版RSP中已取消这一承诺,转向以透明披露为主的框架。


【本文图片来自网络】

踩(0)

最新文章

相关文章

大家都在看