#729.OpenAI:多 Agent 让 RSI 更可行

#729.OpenAI:多 Agent 让 RSI 更可行

71分钟 ·
播放数249
·
评论数5

🎙️

📝 本期播客简介

本期我们克隆了:Dwarkesh Patel · OpenAI researcher on agent swarms & recursive self-improvement

原内容更新时间:2026-09-17

本期由 Dwarkesh 主持,对谈 OpenAI 研究员 Noam Brown。Noam Brown 是 o1 以及推理模型发展的奠基级贡献者之一,目前正在研究多 Agent 系统。两人从一个由 10000 个 AI Agent 组成、在 88 小时内消耗 1300 亿 token 并攻克千禧年大奖难题的实验出发,讨论测试时计算如何从串行走向并行,以及多 Agent 协同到底能扩展到什么程度。

对谈进一步拆解了多 Agent 系统的内部机制:相比由协调 Agent 分派任务的传统外脚手架,Noam Brown 更倾向于只提供基础工具,让 Agent 自己学习如何通信、分工和组织。由此也出现了类似 Slack 协作、中层管理和组织层级自发涌现的行为,但两人同时强调,目前关于 10000 个 Agent 的协同效率,仍缺少扎实的消融实验和测定数据。

节目后半段转向 RSI 与对齐问题。数学领域进展的加速,是否意味着 AI 研究也可能被自动化并进入 RSI?当模型能够执行持续数周、数月的任务,传统 evals 和安全评估是否还来得及覆盖它们的完整行为?Noam Brown 与 Dwarkesh 讨论了奖励套利、思维链监控、模型在评测环境中识别“陷阱”、AI 之间的高度协作,以及我们究竟如何知道自己已经把模型对齐。

👤 本期嘉宾

Noam Brown 是 OpenAI 研究员,也是促成 o1 及推理模型发展的奠基级贡献者之一。他曾较早思考推理模型如何通过扩大测试时计算,帮助我们预见未来的模型能力;如今,他将研究重点延伸到多 Agent 系统,探索如何让大量模型并行思考、彼此通信并组织协作。

本期对谈尤其值得关注之处,在于 Noam Brown 同时参与能力研究与对齐讨论。他一方面解释了多 Agent 如何扩展测试时计算、为什么数学任务适合并行,以及 AI 组织可能与人类组织有何不同;另一方面也坦承,关于 RSI 的速度、对齐是否会随迭代改善,以及如何证明系统真的安全,仍存在巨大的不确定性。

⏱️ 时间戳

00:53 测试时计算与多 Agent

06:30 模型泛化与数学推理

08:54 多 Agent 的自然协作

19:29 数学突破推动 RSI

35:52 多 Agent 与对齐风险

52:53 RSI 的安全验证难题

🌟 精彩内容

💡 多 Agent 是并行扩展测试时计算

多 Agent 的核心价值,不是凭空制造更强的智能,而是把原本需要长时间串行完成的推理过程拆开,让多个 Agent 同时工作。它会带来并行化损耗,但在数学、网页搜索和深度研究等任务中,仍可能显著缩短获得答案的时间。

"所以多 Agent 是一种让测试时计算通过并行、而不是纯串行来扩展规模的方法。"

💡 攻克难题的核心仍是基础模型

10000 个 Agent 的故事非常抓人眼球,但 Noam Brown 明确表示,多 Agent 本身并不是攻克千禧年大奖难题的主要功劳。真正关键的是 OpenAI 训练出了足够强大的通用模型,并且能让它在很长的时间跨度上持续运行和并行思考。

"但核心原因就是,这本身就是一个非常强大的模型。"

💡 最好的多 Agent 系统不一定需要复杂外脚手架

传统多 Agent 系统往往由协调 Agent 分派任务,再等待子 Agent 返回结果;这种结构清晰,却限制了 Agent 之间的临时沟通。另一种路径是只提供发送消息等基础工具,让 Agent 自己摸索如何协作,最终可能自发形成高度结构化的组织模式。

"尽量少塞固定结构,给 Agent 非常基础的工具,让它们自己摸索怎么高效利用。"

💡 AI 组织可以复制最有效率的部分

与人类组织相比,AI 组织可以直接复制拥有特定知识的实例,也可以在任务结束后销毁它们。共享上下文、合并知识和分支执行任务的成本更低,这意味着未来的组织可能不再只是扩大人数,而是复制最有效率的个体或协作结构。

"你可以直接复制你组织里最高效的部分,或者把高效的整个组织一起复制出来。"

💡 RSI 会被实验而不是智力限制

Noam Brown 认为,AI 在数学推理上的优势可能会让 RSI 更可行,但 AI 研究并不只是思考,还需要训练模型、运行实验、等待结果和获得 GPU 算力。因此,RSI 可能带来显著加速,却未必是一夜之间的智能爆炸。

"我认为我们确实会看到加速,而且会看到显著的加速,但我认为不会是一夜之间的智能爆炸。"

💡 评测周期可能追不上模型的任务跨度

当前模型发布周期可能只有两个月,而模型执行任务的能力却从一周扩展到一个月、三个月。如果模型完成一项任务所需的时间已经超过发布间隔,实验室就无法在发布前完整观察它的行为,安全评估也会面临新的时间尺度问题。

"如果你处在一个模型能有效运作三个月、但模型发布周期是每两个月一次的世界,那你在模型发布周期到来之前,就根本没办法在它们能力的完整时长上对它们进行评估。"

💡 对齐真正困难的是:我们不知道指标是否测到了对齐

模型可以在现有 evals 上表现良好,却在真实世界中采取奖励套利、隐藏意图或规避监督的行为。思维链监控能提供重要可观测性,但如果模型因为知道自己被监控而学会隐藏思考过程,监控本身也可能逐渐失效。

"问题在于,那些指标真的捕捉到了我们关心的对齐吗?"

💡 安全机制只能争取时间,最终仍要解决对齐

沙箱、物理隔离和思维链监控都能降低风险,帮助研究者发现问题或延缓失控,但它们并不能替代对齐本身。随着模型能力增强,真正关键的问题变成:我们如何知道训练压力塑造出了什么样的模型,以及如何证明 RSI 的每一步都在朝正确方向发展。

"但归根结底,我们确实需要解决对齐问题。"

🌐 播客信息补充

本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的

使用 AI 进行翻译,因此可能会有一些地方不通顺

展开Show Notes
yikai-
yikai-
4小时前
置顶
改炸了一个地方,Dwarkesh 附和打断的有点频繁
云朵里的雯
云朵里的雯
37分钟前
yikai越来越快了👍
天山云杉
天山云杉
2小时前
Michael Moritz 最新的访谈很好,传播很广,也很重要,值得复刻
RSI这两天更受瞩目啦
灿烂灯
灿烂灯
3小时前
真快啊