8 月 20 日消息,智谱 AI 首席科学家唐杰发帖表示,GLM-5.3 将通过扩大后训练规模提升模型能力,而不是单纯增加参数量。该模型与 GLM-5.2 使用相同的基础模型、架构、总参数量和激活参数量,但经过一个月的长周期环境训练与强化学习后,模型表现获得明显提升。

唐杰在帖子中回顾称,早期研究曾认为模型应以更快速度扩张参数量,但后续研究显示,在计算资源有限的情况下,训练数据与模型参数之间需要保持更均衡的比例。随着模型被大规模调用,推理成本在模型生命周期总成本中的占比不断提高,训练更小但数据量更充分的模型也成为一种可行方向。
他还提到,稀疏混合专家模型需要区分总参数量和激活参数量:前者大致决定模型能够容纳的知识规模,后者以及有效推理深度则更影响模型完成长链条推理的能力。以发现软件漏洞为例,这并不只是检索已知漏洞信息,而是要求模型持续完成多步推理。
唐杰认为,当模型总参数量达到足以承载广泛知识的阈值后,进一步提升能力可以转向有效推理深度和后训练等方向。此次 GLM-5.3 是对这一判断的一次受控实验,但他也表示,基础模型规模、预训练数据量和单次前向计算量仍有扩展空间,后续可能继续探索中训练和预训练等方向。