📝 本期播客简介
本期我们克隆了:The State of Frontier Post-Training Recipes | Conversation with Finbarr Timbers。节目讨论前沿大模型后训练(post-training)配方的现状与实践。
本期节目来自技术播客《Interconnects》,主持人 Nathan 与 AI2 研究员 Finbarr Timbers 展开了一场关于前沿大模型后训练配方演变的深度对谈。这也是该节目首次迎来返场嘉宾——Finbarr 曾在 AI2 与 Nathan 共同参与 OMO 系列模型的后训练工作,而录制当天恰好是他在 AI2 的最后一天,让这场对话多了一层告别与回顾的意味。
对话从经典配方讲起,一路梳理到多教师在线策略蒸馏(Multi-Teacher Online Policy Distillation)等最新趋势。两人不仅回顾了 InstructGPT 三阶段框架、Llama 3 与 TULU3 的实用落地、DeepSeek R1 的推理转向,还穿插了他们在 AI2 的实际经验——包括 OMO3 后训练如何逼近组织能力极限、为什么 DPO 正在从主流配方中消失,以及中国实验室与美国实验室在配方细节分享上的显著差异。如果你关心大模型后训练的技术细节、开源与工业界的差距,或者想了解前沿实验室内部的组织与决策逻辑,这期内容密度极高,值得反复收听。
👨⚕️ 本期嘉宾
Finbarr Timbers,AI2(Allen Institute for AI)研究员,专注于大模型后训练与强化学习。他此前曾在 DeepMind 阿尔伯塔办公室工作,参与过计算机扑克与博弈论研究,后加入 AI2 参与 OMO 系列模型的后训练工作。他是《Interconnects》节目首位返场嘉宾,对前沿后训练配方的演变有深入观察和一手经验。
⏱️ 时间戳
开场 & 节目背景
欢迎回到 Interconnects,Nathan 与 Finbarr 的开场寒暄
Finbarr 成为节目首位返场嘉宾
两人在 AI2 共事后训练的缘起
今天是 Finbarr 在 AI2 的最后一天
从 OMO3 到经典配方:后训练的组织极限
从 OMO3 聊起:推理模型后训练的复杂度
现代后训练的本质:整合组织架构图
TULU3 之后的分岔点:简单配方 vs 前沿做法
经典配方综述:InstructGPT、Llama 3、TULU3、DeepSeek R1
配方的工业化演进:从 InstructGPT 到 DeepSeek
InstructGPT 三步法:SFT、奖励模型、RL
Llama 2/3 的迭代:拒绝采样、DPO、多轮训练
TULU3 的简化配方与组织规模的限制
DeepSeek R1 的配方:RL-first 与冷启动 SFT
DPO 的衰落与偏好调优的争议
DPO 从主流配方中消失的趋势
为什么配方越干净,DPO 需求越小
偏好调优是否被低估?
偏好损失函数带来的惊人提升
多教师在线策略蒸馏:2026 年的新范式
DeepSeek V4 与多教师在线策略蒸馏
MIMO Flash V2 命名该术语
多教师在线策略蒸馏的机制详解
Nematron 3 Ultra 的实践与挑战
教师模型的困境与行业分歧
英伟达的关键发现:教师差异过大无法合并
分阶段蒸馏 vs 收敛后蒸馏的争论
微软 MAI 的保守配方选择
中国实验室的细节分享:温度调度与难度课程
开源环境、Tinker API 与算力经济
开源环境市场的疯狂现状
环境报价:每个环境十万美金
Tinker 风格 API 的商业模式与争议
卖算力、卖推理与卖 API 的利润层级
职业选择与长期价值
热潮之下:挤进实验室赚钱 vs 长期价值
探索与利用的取舍:什么工作值得做
Finbarr 的职业经历:DeepMind 与 AI2 的信念驱动
大实验室的体量困境与多样化路线
🌟 精彩内容
💡 "把 OMO3 后训练成推理模型,对很多人来说都是一项重大成就"
Nathan 坦言,OMO3 的后训练复杂度已经逼近 AI2 组织能力的极限。现代后训练拼的不是单一技术,而是把算力和数据整合进一条工作流的能力——本质上是在整合一张组织架构图。这也是为什么 OMO3 作为推理模型推出得相当晚,且配方相对简单。
"很多现代后训练,拼的就是你把算力和数据整合进一条工作流的能力。"
💡 配方趋同的分岔点出现在 TULU3 之后
在 TULU3 之前,大家还能说"做法都差不多"——SFT、DPO、RL 三阶段配方。但到了推理模型和带工具使用的 Agent 模型时代,那种简单配方已经不再适用。前沿实验室的做法与开放学术界的差距正在急剧拉大。
"可现在,把那种三阶段配方用在推理模型上,尤其是带工具使用的 Agent 模型上,就真的不太适用了。"
💡 DPO 的消失是配方工业化的必然结果
当后训练流程变得越来越精细、越来越工业化,DPO 能带来的边际收益就消失了。但在配方粗糙的阶段,DPO 依然是从零搭建时算力效率最高的选择之一。Nathan 直言:"用 DPO 的人可能会被看不起,但如果你是想把一个配方从零搭起来,它仍然管用。"
"当你的配方越来越干净的时候,这个需求基本上就消失了。"
💡 多教师在线策略蒸馏:把 RL 框架变成教师对齐的舞台
这是 2026 年最值得关注的后训练新范式:在 RL 框架内,让正在训练的学生模型采样轨迹,再路由给各个领域专家教师,用 KL 散度损失对齐。Finbarr 指出,实现起来其实很直接——只需要对现有 RL 配置做一小套调整。
"你拿你现有的 RL 配置,然后只需要对学习者模型做一小套调整,就能实现这个。"
💡 教师模型差异过大,蒸馏会失败
英伟达在 Nematron 3 Ultra 论文中披露了一个关键发现:用差异很大的训练流程训练出来的教师模型,无法通过简单的在线策略蒸馏有效合并。教师和学生若用不同 SFT 数据训练,会习得不同推理行为,导致学生轨迹对教师而言属于分布外数据。
"这种分布差异会导致学生生成的轨迹对教师来说属于分布外数据,从而降低教师提供的监督信号的质量和可靠性。"
💡 中国实验室更愿意分享"特别特别具体"的细节
从温度调度到难度课程,KIMI K2.5 和 GLM5 分享了大量可操作的配方细节——尽管两者在温度调度上声称的正好相反。相比之下,英伟达的论文更像一份方法列表,读起来没那么有意思。
"我还是觉得中国实验室更愿意分享那种特别特别具体的细节。"
💡 报酬最高的地方,往往也是你在做最有趣工作的地方
面对"梯子被抽走之前挤进实验室"的热潮,Finbarr 给出的判断是:要区分短期套利和长期价值。他职业生涯里反复看到,高薪与有趣工作往往是重合的——关键是追随信念,在某个领域做到足够强。
"往往报酬最高的地方,也正是你在做最有趣工作的地方。"
💡 开放环境市场:一个环境十万美金,但可能不包含提示词
Finbarr 分享了他年初尝试购买 RL 环境的经历:一个 DoorDash 克隆级别的环境,前期成本约十万美金,每年维护费约五万。但 Nathan 指出,真正值钱的是"我们知道这些提示词能提升某个基准测试"——那才能收高得多的溢价。
"如果你能说'我们有提示词,而且我们知道它们能提升某个基准测试或某项能力',那就能收高得多的溢价。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺;
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight
