#718. RSI:人工智能研究人员就当前范式能走多远展开辩论

#718. RSI:人工智能研究人员就当前范式能走多远展开辩论

90分钟 ·
播放数137
·
评论数0

📝 本期播客简介

本期我们克隆了:Dwarkesh Podcast · AI researchers debate how close we are to recursive self-improvement

原内容更新时间:Fri, 11 Sep 2026

Dwarkesh Patel 邀请 Xyphra 的 CTO Beren Millidge、Thinking Machines 的首席科学家 John Schulman,以及 Base10 的模型训练负责人 Charlie O’Neill,讨论 AI 距离递归自我改进(RSI)还有多远。三位嘉宾都来自相对开放的 AI 实验室和公司,因此对强化学习、模型训练、部署数据与 AI 研究自动化展开了大量具体讨论。

本期的核心分歧,不是 AI 能否继续变强,而是它能否泛化到自己提出正确目标、设计有效实验,并在很长时间跨度内持续修正认知。嘉宾讨论了 sim-to-real(从仿真到真实世界的迁移)、持续学习、蒸馏、RLVR、数据瓶颈与强化学习的真实作用,也追问了为什么模型在基准测试中越来越强,却仍可能在现实世界的复杂任务上受限。

节目后半段进入未来预测:从能独立完成一个月白领工作的远程员工,到在所有电脑可完成的认知工作上压制人类顶尖专家,再到 AI 研究自动化是否等同于 ASI 完全。相比具体时间线,更值得关注的是三位研究者对“人类最后的工作是什么”以及“真正的智能爆炸会卡在哪里”的不同判断。

👤 本期嘉宾

Beren Millidge 是 Xyphra 的 CTO,所在团队正在开发开源模型。他重点讨论了强化学习为何比预期更有效、mid-training 如何为 RL 做准备、模型的熵坍塌与时间跨度泛化,以及持续学习面临的可塑性和灾难性遗忘问题。

John Schulman 是 Thinking Machines 的首席科学家,曾任 OpenAI 联合创始人,并带队开展 ChatGPT 背后的 RLHF(基于人类反馈的强化学习)研究。他从一线研究经验出发,解释了下一个 token 预测为何意外地成为有效目标,也讨论了 AI 研究自动化、目标定义与对齐之间的关系。

Charlie O’Neill 是 Base10 的模型训练负责人,参与讨论模型蒸馏、部署数据、在线学习、环境设计和强化学习训练。他尤其强调真实世界任务与刷榜分布之间的差异,以及模型要成为可靠远程员工,关键取决于在线学习和长时间跨度任务的解决速度。

⏱️ 时间戳

00:31 2036年仍未起飞的原因

07:01 AI研究最后的人类工作

16:18 蒸馏如何对抗模型中心化

24:55 自动化AI研究的训练路径

54:51 数据、环境与缩放瓶颈

1:11:22 强化学习为何有效又失真

1:21:32 从远程员工到ASI的时间表

🌟 精彩内容

💡 RSI 最大的难题可能不是能力,而是目标

AI 可以在明确目标上不断优化,但递归自我改进要求它自行提出目标、判断目标是否正确、设计实验并持续修正认知。真正的闭环不能只靠把已有环境做得更大。

"AI 到底能多好地泛化到自己摸索出目标?"

💡 sim-to-real 可能决定 AI 能否走出仿真

在数据中心里构建强化学习环境相对可控,但经营公司、打赢官司、与客户互动等任务包含复杂的非平稳分布。若模型无法从仿真迁移到真实世界,长时间跨度任务就可能成为递归自我改进的瓶颈。

"但另一种可能是,你确实需要通过这些真实的互动来进行权重更新,才能在这些事情上做得更好。"

💡 AI 研究自动化的最后一道门是定义问题

模型已经能帮助执行实验、写代码和分析结果,但研究的关键往往在于决定“该做什么实验”。人类可能会长期保留定义目标、判断品味和决定模型应如何表现的工作。

"我觉得人类的最后一份工作,或者说能留存最久的人类角色,就是定义目标,决定我们到底想要什么。"

💡 强化学习的成功,建立在一个足够好的起点上

RL 并不是从零创造全部能力。大量 mid-training 数据、合成推理轨迹和预训练,已经让模型接近最终能力;强化学习提供的是高信噪比的策略微调,因此少量信息也可能显著改变模型行为。

"它只需要从这些 episode 里拿到几个 bit,而这些你确实能拿到。"

💡 环境的真实度比难度更重要

容易验证的复杂任务可以带来刷榜,但不一定能训练出适用于现实工作的模型。要复制老师模型的真实能力,必须覆盖多轮人类交互、多重目标和不确定反馈,而不是只匹配容易评分的任务分布。

"你可以说这就是刷榜分布,因为很多最主流的基准测试其实就是做一些非常难、像解谜一样但容易验证的任务。"

💡 持续学习的瓶颈可能是技术,而不只是模型容量

把新能力蒸馏进另一个模型并不难,但在同一个模型上持续更新,容易出现灾难性遗忘、通用能力退化和知识注入困难。问题因此不只是模型够不够大,也在于现有训练方法会破坏什么。

"所以这很像是一个瓶颈阻碍了我们无休止地训练同一个模型,逼得我们只能从旧模型里提取所有数据,然后从零开始训练一个新模型。"

💡 第 37 手式的创造力不必然来自更高的输出多样性

RL 可能让模型的输出分布变窄,但这不等于它无法产生超越人类的解法。只要任务可搜索、奖励信号可靠,模型仍可能找到人类数据中没有出现过的策略;真正的问题在于环境是否足够多样,以及评审员是否被奖励黑客利用。

"而且我觉得很多情况,比如 RL 导致的熵坍塌,基本上是因为在环境缺乏多样性时,模型钻了那些相当简单的验证器的空子。"

💡 AI 研究自动化可能接近 ASI 完全

如果 AI 能在较长时间跨度内吸收实验结果、做出贝叶斯最优决策,并持续推进新的研究,那么自动化 AI 研究本身就可能意味着它已经跨过了最关键的能力门槛。嘉宾因此把 AI 研究员的自动化,与 ASI 完全联系在一起。

"所以基本上,你觉得实现 AI 研究的自动化,本身就相当于 ASI 完全,对吧?"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺