智谱唐杰:模型总参数达到知识阈值后,能力跃升应转向 Post-training

8 月 20 日消息,智谱 AI 首席科学家唐杰发帖表示,GLM-5.3 将通过扩大后训练规模提升模型能力,而不是单纯增加参数量。该模型与 GLM-5.2 使用相同的基础模型、架构、总参数量和激活参数量,但经过一个月的长周期环境训练与强化学习后,模型表现获得明显提升。

智谱唐杰:模型总参数达到知识阈值后,能力跃升应转向 Post-training

唐杰在帖子中回顾称,早期研究曾认为模型应以更快速度扩张参数量,但后续研究显示,在计算资源有限的情况下,训练数据与模型参数之间需要保持更均衡的比例。随着模型被大规模调用,推理成本在模型生命周期总成本中的占比不断提高,训练更小但数据量更充分的模型也成为一种可行方向。

他还提到,稀疏混合专家模型需要区分总参数量和激活参数量:前者大致决定模型能够容纳的知识规模,后者以及有效推理深度则更影响模型完成长链条推理的能力。以发现软件漏洞为例,这并不只是检索已知漏洞信息,而是要求模型持续完成多步推理。

唐杰认为,当模型总参数量达到足以承载广泛知识的阈值后,进一步提升能力可以转向有效推理深度和后训练等方向。此次 GLM-5.3 是对这一判断的一次受控实验,但他也表示,基础模型规模、预训练数据量和单次前向计算量仍有扩展空间,后续可能继续探索中训练和预训练等方向。

声明:内容来源公开的各类媒体平台,若收录的内容侵犯了您的权益,请联系邮箱,本站将第一时间处理。
资讯

韶音与千问推出 OpenFit 2 AI 开放式耳机,支持 8 小时录音总结

2026-8-19 9:16:34

资讯

豆包工作任务上线「云电脑」模式

2026-8-20 9:17:58

搜索