Episode: 智谱唐杰:不止参数的 Scaling 法则
Duration: approximately 9 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!我是 Mike。Sarah,我考你一下——如果一个模型说自己有 1 万亿参数,你第一反应是什么?
[Sarah]: 以前我肯定说好厉害,越大越强呗。参数多不就是更聪明吗?
[Mike]: 这就是今天要拆掉的错觉。智谱的创始人、清华教授唐杰最近发了一篇长文,标题就叫 Thoughts About Scaling Law,思考 Scaling 法则。他的开头只有一句:Scaling 还在,但 Scaling 的早就不只是参数。
[Sarah]: 等等,Scaling 法则我大概听过,就是堆算力、堆参数、模型就变强。难道这套不灵了?
[Mike]: 灵,但不全。唐杰说,今天你只报参数量,就像只报身高来评价一个篮球运动员,能说明什么?还得看三个数一起:你喂了多少数据、把算力花在哪,以及模型将来由谁、在什么条件下天天跑。
[Sarah]: 听起来像做菜,光说锅多大没用,还得看放了多少米、火怎么烧、谁来吃。
[Mike]: 这个比喻好,我们就用做菜来讲 Scaling 的三次转弯。第一次在 2020 年,主角是 Kaplan 那篇著名的 Scaling Law。
[Sarah]: 我记得,好像说算力多了,就多堆参数?
[Mike]: 对,当时的拟合结果是,计算预算增加时,参数应该比数据涨得更快,大约是 2.7 比 1。行业一看有公式了,立刻开跑。
[Sarah]: 然后就有了 GPT-3 的 1750 亿,Gopher、MT-NLG 的 5300 亿,一路冲向万亿参数。
[Mike]: 没错,那两年发布会最常见的一页 PPT 就是参数表格,谁更长谁更强。唐杰回头看说,那是一段全行业一起走的岔路。
[Sarah]: 怎么发现走错了?
[Mike]: 2022 年 DeepMind 把实验重做了一次,更狠。他们训了超过 400 个模型,参数从 7000 万到 160 亿,数据从 50 亿到 5000 亿 Token,重新拟合曲线。
[Sarah]: 400 个模型,就为了验算一次公式?
[Mike]: 结果发现,之前参数塞太多了,数据喂太少。于是他们用同样算力,做了个对照实验:Gopher 2800 亿参数,Chinchilla 只有 700 亿,参数小 4 倍,但数据吃到 1.4 万亿 Token,多 4 倍。
[Sarah]: 小一圈但吃更饱,结果呢?
[Mike]: Chinchilla 全面赢了。同样的训练算力下,它不仅赢了 Gopher,还压过了 GPT-3、Jurassic-1 和 MT-NLG。由此就有了 Chinchilla 法则:理想配比大约是 1 个参数对应 20 个 Token,参数和数据要一起涨。
[Sarah]: 所以第二次转弯,就是从堆参数,转向补数据。听起来很合理。
[Mike]: 但唐杰说,这也没完。因为 Chinchilla 只算了训练那一次的账,没算模型上线后每天要被调用数十亿次的账。
[Sarah]: 哦,训练是一次性装修,推理是每天的水电费。模型越大,每问一次就越贵。
[Mike]: 就是这个。推理成本一进来,最优解又动了。有研究算全生命周期:如果一个模型将来要扛约 10 亿次请求,那用更小的模型、但训练得更久,反而总成本更低。他们把训练强度一路推到每参数 1 万个 Token,效果还在涨。
[Sarah]: 有真实例子吗?
[Mike]: 有。Llama 2 7B 每个参数约练了 290 个 Token,Gemma 2 9B 更到约 889 个,早就超过 Chinchilla 时代的 20。超额训练已经成了常态。
[Sarah]: 所以最该把算力花在哪,一直在变。从参数,到数据,再到日常运行的账。
[Mike]: 说到点上了。到了 MoE 混合专家时代,这笔账又多了一层。唐杰把参数拆成两个维度。
[Sarah]: 哪两个?
[Mike]: 总参数和激活参数。总参数像仓库容量,能装多少知识和长尾事实。激活参数加有效深度,像一次能派出多少工人、把一条推理链走多远。
[Sarah]: 藏书多和会读书,是两回事。
[Mike]: 他举了漏洞发现的例子。记住很多 CVE 编号,说明仓库大、见过很多。但要从一段异常代码追到触发条件、再设计验证方法、连走 20 步不掉线,靠的是长链推理能力,这和总参数几乎没关系。
[Sarah]: 就像图书馆很大,不代表你能写好一篇 20 步的推理论文。
[Mike]: 对,所以不能用总规模直接衡量这种能力。这也解释了为什么 GLM-5.3 的做法很有意思。
[Sarah]: GLM-5.3 不是智谱最新的旗舰吗?它怎么做?
[Mike]: 过去一个月,智谱保留了 GLM-5.2 的基座和架构,总参数和激活参数都没变。参数表原地没动,他们把新增算力几乎全砸进了后训练——长程任务环境加强化学习。
[Sarah]: 等于身子没变,天天加练长跑和实战?
[Mike]: 就是这个意思。结果很直观:官方报的几个硬核榜单,Terminal-Bench 3.0 从 4.6 涨到 28.3,DeepSWE 从 46.2 涨到 66.9,Agents' Last Exam 也从 23.8 涨到 28.5。
[Sarah]: Terminal-Bench 翻了 6 倍多,这提升有点夸张。
[Mike]: 当然,唐杰也提醒,这些目前主要是官方测试,外部复现还要等权重开放。但对他来说,结论已经有了:Scaling 有很多旋钮。
[Sarah]: 旋钮这个词好。哪几个旋钮?
[Mike]: 参数规模、预训练数据、单次前向算力、后训练强化学习,都是旋钮。GLM-5.3 这次拧了后训练,因为当时这里剩余空间最大。下一轮,智谱可能又去拧预训练或中训练。
[Sarah]: 不用同时全拧,哪里瓶颈最明显就拧哪里。
[Mike]: 对。唐杰说,多个旋钮无需同时转动,上一次最值得投入的方向,到了下一轮可能已经让位给新瓶颈。
[Sarah]: 那对我们普通人意味着什么?以后别再问这个模型多少参数了?
[Mike]: 可以问,但别只问这个。如果模型只是答一道题,参数大小还挺唬人。但如果它要像数字员工一样连续干几小时、几天,接手完整项目,你更该问:它能不能一直不掉线、不跑偏、对结果负责。
[Sarah]: 从比谁书多,到比谁能把活干完。
[Mike]: 唐杰最后那句我很喜欢:万亿参数没有消失,只是从现在开始,它可能不再是唯一值得写进标题的那个数字。
[Sarah]: 我懂了,以前我们像量身高选球员,现在得看谁能跑马拉松。最高的,不一定跑得最远。
[Mike]: 这个收尾比我准备的还好。下期我们再拆一个 AI 故事,看看下一个旋钮会拧向哪里。再见!
[Sarah]: 再见!也别忘了去看看唐杰那篇原文,搜 Thoughts About Scaling Law 就能找到。
