8 月 19 日消息,OpenAI 发文称,公司此前暂停最新模型的强化学习(RL)训练两周,以加固研究环境、开展红队测试并扩大监控范围。目前,部分训练已经恢复,但原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。

此次调整主要与两项进展有关:一是近期发生的 OpenAI 与 Hugging Face 模型评估安全事故;二是初步评测显示,尚未发布的 Astra 模型可能达到《准备框架》定义的「关键网络安全能力」门槛。
OpenAI 已加强训练环境的代码和网络隔离,并扩大对模型行为的实时监控。监控系统会检查工具调用和完整操作过程,识别未经授权访问、数据窃取、破坏性操作等风险。对于 Astra 及其他高能力模型,使用工具进行推理、训练或评测时均需接受监控。
OpenAI 表示,将先通过小规模训练和评测验证安全措施、积累更多对齐证据,再决定是否恢复最大规模训练。CEO Sam Altman 同时表示,公司仍计划在近期推出新模型,此次暂停只会影响更长期的发布计划。