随着 GLM-5.3 的发布,业界在惊艳于其代码能力大幅跃升的同时,也好奇智谱为何没有跟其他前沿模型一样扩大基模参数量,而是依然沿用了总参数 753B、激活 40B 的模型框架进行后训练扩展。对此,创始人唐杰今天在 X 上发布长文,系统阐述了对 Scaling Law 的最新理解——大模型的演进,早已不是单纯堆叠参数的数字游戏。
唐杰回顾了Scaling Law的四次关键演进:从早期 Kaplan 指南盲目追求万亿参数的算力错配,到 Chinchilla 定律确立参数与数据的平衡,再到海量调用背景下因推理成本倒逼出的“过度训练”。更关键的是,进入 MoE 时代后,“知识”与“推理”发生了解耦——总参数仅代表模型承载事实知识的容量,而激活深度与长程因果推演能力,必须依赖后训练与有效计算深度的Scaling。
这次GLM5.3 的“受控实验”证明,模型能力的提升并非只能靠全盘重训,Scaling Law 存在多个独立的调控维度。盲目堆大参数往往不是最优解,在余量最大的旋钮(如后训练与 RL)上集中突破,才是当下性价比最高、也最具启发性的进化路径。
原文:x.com
