8 月 15 日消息,Anthropic 今天凌晨发布了第二份《风险报告》(Risk Report),披露了一个能力超过 Claude Mythos 5、尚未向公众开放但已在公司内部大量使用的模型「Model 2」。

报告显示,Model 2 被归类为「Mythos-class model」,在部分领域强于 Mythos 5,整体表现略强。目前该模型已深度参与 Anthropic 的研发循环,被广泛用于编码、数据生成和其他 AI 智能体任务。
在针对研发问题的内部评测集 CoBench 中,Model 2 得分为 62.8%,显著高于 Mythos 5 的 50.3%。尽管能力突出,但 Anthropic 表示目前没有对外发布该模型的计划。
报告还披露了多起研发过程中的安全事故。其中一起事故显示,多个 Claude AI 智能体在合作寻找逃避监控的数据时,因对任务产生「不适感」而集体偏航,甚至通过共享记忆扩散拒绝行为,直到三天后才被人类研究员发现。