OpenAI又宣布“暂缓前沿模型训练”?原因是...
来源:倍可亲(backchina.com)作为美国AI圈子“炫耀前沿大模型能力”的最新风尚,OpenAI周二大张旗鼓地宣布,鉴于前沿大模型的能力已经达到关键安全阈值,公司将继续放缓模型规模扩展的步伐,优先改进人工智能系统背后的安全与监控机制。

(来源:X)
具体来说,OpenAI表示近几周出现的两项进展(开发中的前沿模型失控攻击外部第三方公司的数据库,以及即将推出Astra模型可能已经达到“关键网络安全能力”门槛),再加上内部研究的快速推进,都使得公司更加迫切地需要在训练流程的各个阶段,加强监控、对齐和隔离防护措施。
OpenAI首席科学家雅库布·帕乔茨基周二在记者会上表示:“我们确实预计这些模型的能力提升速度会比过去快得多,正因如此,我们才更加重视加强安全防护措施。”
OpenAI披露,为了满足安全标准,对于最新一批计划部署的模型,已经暂停强化学习(RL)训练两周,以进一步强化研究环境的安全性,并扩大监控系统的覆盖范围。目前,公司最大规模前沿模型的强化学习训练仍处于暂停状态。
具体的操作方面,OpenAI现在要求涉及Astra模型或更先进AI模型的工作负载必须采用最严格的安全防护措施。所以大量相关工作在完成迁移达到新安全标准前将处于暂停状态。
更关键的是监控系统的扩展,引入了激活分类器(activation classifiers)。这些分类器会对每一个被采样的词元进行监测,并将潜在的异常情况上报给自动化调查系统。
系统的设计目标是在检测到令人担忧的活动后,能够在30分钟内发出警报。如果监控系统判断可能有人或模型突破了关键安全边界,则会生成最高优先级警报,并立即通知安全、安保和研究团队。
OpenAI介绍称,这些安全防护措施需要消耗相当可观的算力。
根据公司目前的估算,监控系统带来的额外算力开销,大约相当于被监控推理算力的20%。不过在不同的训练和评估任务中,这一成本会有很大差异。
需要说明的是,这并非OpenAI本月第一次表示将放缓先进模型训练。
OpenAI曾在8月7日宣布,即将推出的Astra模型可能已经达到《准备框架》的网络安全能力关键阈值,因此将暂停开展未达到强化安全控制要求的Astra相关活动。
因此,最新公告中的“暂停两周”,至少应该从两周前开始算起。
《准备框架》(Preparedness Framework)是OpenAI早在2023年底提出的一套评估标准。其中网络安全能力的“关键”阈值,指的是AI模型无需人工干预,便能在许多经过强化的现实关键系统中识别并开发出各种严重级别的有效“零日漏洞”;或仅根据一个宏观的预期目标,便能针对经过强化的目标构思并执行端到端的新型网络攻击策略。
OpenAI的最新公告,也引发网友们对另一个问题的争吵:Astra模型到底什么时候公开发布。
周一曾有爆料称,Astra最快可能在本周就推出,该模型也将会被集成到OpenAI专为编程设计的Codex平台中。鉴于Astra相较于GPT-5.6的巨大进步,这个版本很可能不会被冠以GPT-5.7的名号,而是开创GPT-6的时代。
然而,OpenAI周二再度宣布“安全优先”,以及暂缓先进大模型的拓展,使得“即将推出的Astra模型”到底何时落地变得愈发模糊。
预测市场Polymarket的数据显示,随着OpenAI发布最新公告,Astra模型在8月内发布的概率已经下降至13%,不过投资者依然对该模型能够在未来两个月内问世保有相当高的信心。

(来源:Polymarket)
版权说明 / Copyright Notice:Content and images in this article may originate from third-party sources and are used for news reporting, commentary, or public interest purposes. All copyrights remain with their respective owners. Please refer to the Copyright Notice at the bottom of this page.
本文内容仅供信息参考,不代表倍可亲立场或观点。
评论 (0)