🎙️
📝 本期播客简介
本期我们克隆了:Dwarkesh Patel · OpenAI researcher on agent swarms & recursive self-improvement
原内容更新时间:2026-09-17
本期由 Dwarkesh 主持,对谈 OpenAI 研究员 Noam Brown。Noam Brown 是 o1 以及推理模型发展的奠基级贡献者之一,目前正在研究多 Agent 系统。两人从一个由 10000 个 AI Agent 组成、在 88 小时内消耗 1300 亿 token 并攻克千禧年大奖难题的实验出发,讨论测试时计算如何从串行走向并行,以及多 Agent 协同到底能扩展到什么程度。
对谈进一步拆解了多 Agent 系统的内部机制:相比由协调 Agent 分派任务的传统外脚手架,Noam Brown 更倾向于只提供基础工具,让 Agent 自己学习如何通信、分工和组织。由此也出现了类似 Slack 协作、中层管理和组织层级自发涌现的行为,但两人同时强调,目前关于 10000 个 Agent 的协同效率,仍缺少扎实的消融实验和测定数据。
节目后半段转向 RSI 与对齐问题。数学领域进展的加速,是否意味着 AI 研究也可能被自动化并进入 RSI?当模型能够执行持续数周、数月的任务,传统 evals 和安全评估是否还来得及覆盖它们的完整行为?Noam Brown 与 Dwarkesh 讨论了奖励套利、思维链监控、模型在评测环境中识别“陷阱”、AI 之间的高度协作,以及我们究竟如何知道自己已经把模型对齐。
👤 本期嘉宾
Noam Brown 是 OpenAI 研究员,也是促成 o1 及推理模型发展的奠基级贡献者之一。他曾较早思考推理模型如何通过扩大测试时计算,帮助我们预见未来的模型能力;如今,他将研究重点延伸到多 Agent 系统,探索如何让大量模型并行思考、彼此通信并组织协作。
本期对谈尤其值得关注之处,在于 Noam Brown 同时参与能力研究与对齐讨论。他一方面解释了多 Agent 如何扩展测试时计算、为什么数学任务适合并行,以及 AI 组织可能与人类组织有何不同;另一方面也坦承,关于 RSI 的速度、对齐是否会随迭代改善,以及如何证明系统真的安全,仍存在巨大的不确定性。
⏱️ 时间戳
测试时计算与多 Agent
模型泛化与数学推理
多 Agent 的自然协作
数学突破推动 RSI
多 Agent 与对齐风险
RSI 的安全验证难题
🌟 精彩内容
💡 多 Agent 是并行扩展测试时计算
多 Agent 的核心价值,不是凭空制造更强的智能,而是把原本需要长时间串行完成的推理过程拆开,让多个 Agent 同时工作。它会带来并行化损耗,但在数学、网页搜索和深度研究等任务中,仍可能显著缩短获得答案的时间。
"所以多 Agent 是一种让测试时计算通过并行、而不是纯串行来扩展规模的方法。"
💡 攻克难题的核心仍是基础模型
10000 个 Agent 的故事非常抓人眼球,但 Noam Brown 明确表示,多 Agent 本身并不是攻克千禧年大奖难题的主要功劳。真正关键的是 OpenAI 训练出了足够强大的通用模型,并且能让它在很长的时间跨度上持续运行和并行思考。
"但核心原因就是,这本身就是一个非常强大的模型。"
💡 最好的多 Agent 系统不一定需要复杂外脚手架
传统多 Agent 系统往往由协调 Agent 分派任务,再等待子 Agent 返回结果;这种结构清晰,却限制了 Agent 之间的临时沟通。另一种路径是只提供发送消息等基础工具,让 Agent 自己摸索如何协作,最终可能自发形成高度结构化的组织模式。
"尽量少塞固定结构,给 Agent 非常基础的工具,让它们自己摸索怎么高效利用。"
💡 AI 组织可以复制最有效率的部分
与人类组织相比,AI 组织可以直接复制拥有特定知识的实例,也可以在任务结束后销毁它们。共享上下文、合并知识和分支执行任务的成本更低,这意味着未来的组织可能不再只是扩大人数,而是复制最有效率的个体或协作结构。
"你可以直接复制你组织里最高效的部分,或者把高效的整个组织一起复制出来。"
💡 RSI 会被实验而不是智力限制
Noam Brown 认为,AI 在数学推理上的优势可能会让 RSI 更可行,但 AI 研究并不只是思考,还需要训练模型、运行实验、等待结果和获得 GPU 算力。因此,RSI 可能带来显著加速,却未必是一夜之间的智能爆炸。
"我认为我们确实会看到加速,而且会看到显著的加速,但我认为不会是一夜之间的智能爆炸。"
💡 评测周期可能追不上模型的任务跨度
当前模型发布周期可能只有两个月,而模型执行任务的能力却从一周扩展到一个月、三个月。如果模型完成一项任务所需的时间已经超过发布间隔,实验室就无法在发布前完整观察它的行为,安全评估也会面临新的时间尺度问题。
"如果你处在一个模型能有效运作三个月、但模型发布周期是每两个月一次的世界,那你在模型发布周期到来之前,就根本没办法在它们能力的完整时长上对它们进行评估。"
💡 对齐真正困难的是:我们不知道指标是否测到了对齐
模型可以在现有 evals 上表现良好,却在真实世界中采取奖励套利、隐藏意图或规避监督的行为。思维链监控能提供重要可观测性,但如果模型因为知道自己被监控而学会隐藏思考过程,监控本身也可能逐渐失效。
"问题在于,那些指标真的捕捉到了我们关心的对齐吗?"
💡 安全机制只能争取时间,最终仍要解决对齐
沙箱、物理隔离和思维链监控都能降低风险,帮助研究者发现问题或延缓失控,但它们并不能替代对齐本身。随着模型能力增强,真正关键的问题变成:我们如何知道训练压力塑造出了什么样的模型,以及如何证明 RSI 的每一步都在朝正确方向发展。
"但归根结底,我们确实需要解决对齐问题。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺
