📝 本期播客简介
本期我们克隆了:知名播客 Training Data Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again。原内容更新时间:2026-08-18。嘉宾 Rich Sutton 与 Khurram Javed 讨论持续学习、合成数据、大世界假设、灾难性遗忘和能持续学习的智能体;由 Sequoia Capital 的 Sonya Huang 与 Alfred Lin 主持。
原内容更新时间:2026-08-18
本期嘉宾是强化学习领域的奠基人 Rich Sutton,以及他的联合创始人、前学生 Khurram Javed。主持人是红杉资本的 Sonya Huang 与 Alfred Lin。Rich Sutton 是那篇经典文章《苦涩的教训》的作者,也是阿尔伯塔大学强化学习研究的核心人物。这期对话围绕持续学习、合成数据的局限,以及他们创办的 Oak Lab 想要实现的新一代智能体展开。
这场对话从《苦涩的教训》出发,直指当前 AI 领域的核心矛盾:大语言模型在部署后权重不再更新,本质上不是持续学习者。Rich 与 Khurram 提出了"大世界假说",认为世界远比互联网上的一切都要大得多,合成数据无法替代真实经验。他们还分享了 Oak Lab 的野心——打造一个能持续学习、形成抽象、并保持自洽的智能体,并给出了具体的技术路径,包括持续反向传播算法和步长优化。如果你关心 AI 的下一个范式是什么,这期节目会给你一个完全不同的视角。
👨⚕️ 本期嘉宾
Rich Sutton,强化学习领域的奠基人之一,阿尔伯塔大学教授,著有奠基性教科书《Reinforcement Learning: An Introduction》,培养了大批该领域的关键学生(如 AlphaGo 的 David Silver)。他的文章《苦涩的教训》被视为深度学习领域的"圣经"。Khurram Javed 是 Rich 在阿尔伯塔大学的学生,也是 Oak Lab 的联合创始人,专注于持续学习与"大世界假说"的研究。
⏱️ 时间戳
开场 & 播客简介
"我不怪,这个领域才怪"
Rich Sutton 的开场宣言:持续学习才是正常思考方式
主持人介绍 Rich Sutton 与 Khurram Javed
为什么在 AI 寒冬押注强化学习
2003 年与癌症搏斗的经历
《苦涩的教训》与大语言模型的局限
2019 年写下《苦涩的教训》的契机
苦涩的教训的本质:别被人类知识带偏
大语言模型是正面还是反面例子?
合成数据是"大错误":大世界假说
为什么合成数据无法替代真实经验
大世界假说:世界比互联网大得多
谁来判定合成数据的好坏?
世界无限复杂,任何模拟都渺小得可怜
自动驾驶模拟器:人类在循环里的瓶颈
持续学习:算法缺口与解药
大语言模型不是经验型学习者
预训练与后训练之后,模型就不再学习了
持续深度学习是算法缺口
解药:步长优化与持续反向传播
Oak Lab 的野心与未来
从空谈到行动:创办 Oak Lab
最有野心的目标:拥有完整跨度的知识
"这是触手可及的":五到十年的判断
如果一切顺利,Oak Lab 会变成什么样?
🌟 精彩内容
💡 "我不怪,这个领域才怪"
Rich Sutton 反复强调自己并不激进,他只是在用"普通的方式思考"。在他看来,所有学习都是持续的,我们一直在行动、一直在学习,这才是正常的思考方式。是 AI 领域把"持续学习"当成了一个特殊概念,才显得他奇怪。
"所有学习都是持续的。我们一直在行动,一直在学习。这才是正常的思考方式。"
💡 大语言模型既是《苦涩的教训》的正面例子,也是反面例子
正面在于它把计算规模的扩展做到了极致,直接吞下整个互联网;反面在于它最终会被人类知识限制住——互联网是有限的,而世界比互联网上的一切都要大得多得多。
"互联网是有限的,很难再拿到更多样本。而世界很大,世界比我们存在互联网上的一切都要大得多得多。"
💡 合成数据是"大错误"
Rich 与 Khurram 直言,合成数据生成是当前扩展范式的根本问题。谁来判定什么样的合成数据是好的?这需要人类专家,而这就是瓶颈所在。更根本的是,世界无限复杂,任何对它的模拟都渺小得可怜。
"世界是无限复杂的,任何对它的模拟都渺小得可怜。"
💡 大语言模型的权重永远不会变
这是 Rich 对当前主流范式最尖锐的批评:模型在部署后就不再学习了。你可以给它更多上下文,但模型本身已经停止学习。相比之下,Cursor 和 Tab 这类产品因为持续更新权重,反而是真正的持续学习例子。
"它们的权重永远不会变。……他们声称能从一种完全不再学习的东西里,榨出博士级的经验和专业能力。"
💡 学校其实无关紧要
Rich 认为,没有哪种动物是通过监督学习来学习的。松鼠不上学也能学会那些东西,学校是非常特殊的东西,就连人类也是直到几百年前才有的。把监督学习当成学习的主要例子,是一种干扰。
"你看,松鼠不上学,也能学会那些东西。动物不是那样学习的。"
💡 我们卡在了一个局部最优里
Khurram 认为,当前的大实验室被产品绑得太死,无法去走一条"事情会先变差"的路。新范式在变好之前几乎不可避免地会先变差,而那些大实验室不可能接受这一点。
"当我们开始探索这些新方向时,你不可能第一天就拿到最先进的性能。但这是因为,它是一个不同的范式。"
💡 大语言模型大概只占智能的 20%
Rich 明确表示,大语言模型是了不起的科学突破,但它被过度包装成了"全部 AI"。全部智能并不只是流畅的语言运用能力,语言只是重要的一部分,还有太多别的东西没做完。
"全部智能并不只是流畅的语言运用能力。还有太多别的东西。语言是重要的一部分。它大概占智能的 20% 或者四分之一。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺;
如果有后续想要听中文版的其他外文播客,也欢迎联系微信:iEvenight
