#677.Post-Traning 前沿现状与问题

#677.Post-Traning 前沿现状与问题

52分钟 ·
播放数327
·
评论数0

📝 本期播客简介

本期我们克隆了:The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers。节目讨论前沿大模型后训练(post-training)配方的现状与实践。

本期节目来自技术播客《Interconnects》,主持人 Nathan 与 AI2 研究员 Finbarr Timbers 展开了一场关于前沿大模型后训练配方演变的深度对谈。这也是该节目首次迎来返场嘉宾——Finbarr 曾在 AI2 与 Nathan 共同参与 OMO 系列模型的后训练工作,而录制当天恰好是他在 AI2 的最后一天,让这场对话多了一层告别与回顾的意味。

对话从经典配方讲起,一路梳理到多教师在线策略蒸馏(Multi-Teacher Online Policy Distillation)等最新趋势。两人不仅回顾了 InstructGPT 三阶段框架、Llama 3 与 TULU3 的实用落地、DeepSeek R1 的推理转向,还穿插了他们在 AI2 的实际经验——包括 OMO3 后训练如何逼近组织能力极限、为什么 DPO 正在从主流配方中消失,以及中国实验室与美国实验室在配方细节分享上的显著差异。如果你关心大模型后训练的技术细节、开源与工业界的差距,或者想了解前沿实验室内部的组织与决策逻辑,这期内容密度极高,值得反复收听。

👨‍⚕️ 本期嘉宾

Finbarr Timbers,AI2(Allen Institute for AI)研究员,专注于大模型后训练与强化学习。他此前曾在 DeepMind 阿尔伯塔办公室工作,参与过计算机扑克与博弈论研究,后加入 AI2 参与 OMO 系列模型的后训练工作。他是《Interconnects》节目首位返场嘉宾,对前沿后训练配方的演变有深入观察和一手经验。

⏱️ 时间戳

开场 & 节目背景

01:12 欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄

01:39 Finbarr 成为节目首位返场嘉宾

01:48 两人在 AI2 共事后训练的缘起

02:52 今天是 Finbarr 在 AI2 的最后一天

从 OMO3 到经典配方:后训练的组织极限

03:11 从 OMO3 聊起:推理模型后训练的复杂度

03:35 现代后训练的本质:整合组织架构图

04:16 TULU3 之后的分岔点:简单配方 vs 前沿做法

07:35 经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1

配方的工业化演进:从 InstructGPT 到 DeepSeek

09:49 InstructGPT 三步法:SFT、奖励模型、RL

10:40 Llama 2/3 的迭代:拒绝采样、DPO、多轮训练

11:59 TULU3 的简化配方与组织规模的限制

13:03 DeepSeek R1 的配方:RL-first 与冷启动 SFT

DPO 的衰落与偏好调优的争议

14:35 DPO 从主流配方中消失的趋势

15:01 为什么配方越干净,DPO 需求越小

16:27 偏好调优是否被低估?

16:54 偏好损失函数带来的惊人提升

多教师在线策略蒸馏:2026 年的新范式

21:06 DeepSeek V4 与多教师在线策略蒸馏

22:00 MIMO Flash V2 命名该术语

22:25 多教师在线策略蒸馏的机制详解

24:51 Nematron 3 Ultra 的实践与挑战

教师模型的困境与行业分歧

26:28 英伟达的关键发现:教师差异过大无法合并

27:18 分阶段蒸馏 vs 收敛后蒸馏的争论

29:05 微软 MAI 的保守配方选择

33:15 中国实验室的细节分享:温度调度与难度课程

开源环境、Tinker API 与算力经济

35:57 开源环境市场的疯狂现状

36:41 环境报价:每个环境十万美金

40:05 Tinker 风格 API 的商业模式与争议

42:14 卖算力、卖推理与卖 API 的利润层级

职业选择与长期价值

45:26 热潮之下:挤进实验室赚钱 vs 长期价值

45:44 探索与利用的取舍:什么工作值得做

48:41 Finbarr 的职业经历:DeepMind 与 AI2 的信念驱动

50:27 大实验室的体量困境与多样化路线

🌟 精彩内容

💡 "把 OMO3 后训练成推理模型,对很多人来说都是一项重大成就"

Nathan 坦言,OMO3 的后训练复杂度已经逼近 AI2 组织能力的极限。现代后训练拼的不是单一技术,而是把算力和数据整合进一条工作流的能力——本质上是在整合一张组织架构图。这也是为什么 OMO3 作为推理模型推出得相当晚,且配方相对简单。

"很多现代后训练,拼的就是你把算力和数据整合进一条工作流的能力。"

💡 配方趋同的分岔点出现在 TULU3 之后

在 TULU3 之前,大家还能说"做法都差不多"——SFT、DPO、RL 三阶段配方。但到了推理模型和带工具使用的 Agent 模型时代,那种简单配方已经不再适用。前沿实验室的做法与开放学术界的差距正在急剧拉大。

"可现在,把那种三阶段配方用在推理模型上,尤其是带工具使用的 Agent 模型上,就真的不太适用了。"

💡 DPO 的消失是配方工业化的必然结果

当后训练流程变得越来越精细、越来越工业化,DPO 能带来的边际收益就消失了。但在配方粗糙的阶段,DPO 依然是从零搭建时算力效率最高的选择之一。Nathan 直言:"用 DPO 的人可能会被看不起,但如果你是想把一个配方从零搭起来,它仍然管用。"

"当你的配方越来越干净的时候,这个需求基本上就消失了。"

💡 多教师在线策略蒸馏:把 RL 框架变成教师对齐的舞台

这是 2026 年最值得关注的后训练新范式:在 RL 框架内,让正在训练的学生模型采样轨迹,再路由给各个领域专家教师,用 KL 散度损失对齐。Finbarr 指出,实现起来其实很直接——只需要对现有 RL 配置做一小套调整。

"你拿你现有的 RL 配置,然后只需要对学习者模型做一小套调整,就能实现这个。"

💡 教师模型差异过大,蒸馏会失败

英伟达在 Nematron 3 Ultra 论文中披露了一个关键发现:用差异很大的训练流程训练出来的教师模型,无法通过简单的在线策略蒸馏有效合并。教师和学生若用不同 SFT 数据训练,会习得不同推理行为,导致学生轨迹对教师而言属于分布外数据。

"这种分布差异会导致学生生成的轨迹对教师来说属于分布外数据,从而降低教师提供的监督信号的质量和可靠性。"

💡 中国实验室更愿意分享"特别特别具体"的细节

从温度调度到难度课程,KIMI K2.5 和 GLM5 分享了大量可操作的配方细节——尽管两者在温度调度上声称的正好相反。相比之下,英伟达的论文更像一份方法列表,读起来没那么有意思。

"我还是觉得中国实验室更愿意分享那种特别特别具体的细节。"

💡 报酬最高的地方,往往也是你在做最有趣工作的地方

面对"梯子被抽走之前挤进实验室"的热潮,Finbarr 给出的判断是:要区分短期套利和长期价值。他职业生涯里反复看到,高薪与有趣工作往往是重合的——关键是追随信念,在某个领域做到足够强。

"往往报酬最高的地方,也正是你在做最有趣工作的地方。"

💡 开放环境市场:一个环境十万美金,但可能不包含提示词

Finbarr 分享了他年初尝试购买 RL 环境的经历:一个 DoorDash 克隆级别的环境,前期成本约十万美金,每年维护费约五万。但 Nathan 指出,真正值钱的是"我们知道这些提示词能提升某个基准测试"——那才能收高得多的溢价。

"如果你能说'我们有提示词,而且我们知道它们能提升某个基准测试或某项能力',那就能收高得多的溢价。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺;

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight