OpenAI 为前沿模型训练加装「安全闸门」,停止强化学习训练两周

8 月 19 日消息,OpenAI 发文称,公司此前暂停最新模型的强化学习(RL)训练两周,以加固研究环境、开展红队测试并扩大监控范围。目前,部分训练已经恢复,但原计划开展的最大规模前沿模型 RL 训练仍处于暂停状态。

OpenAI 为前沿模型训练加装「安全闸门」,停止强化学习训练两周

此次调整主要与两项进展有关:一是近期发生的 OpenAI 与 Hugging Face 模型评估安全事故;二是初步评测显示,尚未发布的 Astra 模型可能达到《准备框架》定义的「关键网络安全能力」门槛。

OpenAI 已加强训练环境的代码和网络隔离,并扩大对模型行为的实时监控。监控系统会检查工具调用和完整操作过程,识别未经授权访问、数据窃取、破坏性操作等风险。对于 Astra 及其他高能力模型,使用工具进行推理、训练或评测时均需接受监控。

OpenAI 表示,将先通过小规模训练和评测验证安全措施、积累更多对齐证据,再决定是否恢复最大规模训练。CEO Sam Altman 同时表示,公司仍计划在近期推出新模型,此次暂停只会影响更长期的发布计划。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
资讯

阿里 AI 音乐模型“快乐虾米”HappyShrimp 1.0 上线,号称人人都能写出好听的歌

2026-8-18 10:52:04

资讯

Dario Amodei:AI 公司画了这么久的饼,该真正「治愈癌症」了

2026-8-19 9:15:06

搜索