Rich Sutton:能够持续学习的智能体才是未来

Rich Sutton:能够持续学习的智能体才是未来

51分钟 ·
播放数43
·
评论数0

在Bayt播客上收听任何播客的中文翻译音频,并查看双语字幕:

安卓:baytfm.com

iOS:apps.apple.com

📝 本期播客简介

本期节目我们翻译了知名AI播客《Training Data》。由红杉资本合伙人Sonya Huang与Alfred Lin主持,本期对话了强化学习先驱、《苦涩的教训》作者里奇·萨顿(Rich Sutton)及其共同创始人Khurram Javed。两人联合创立了Oak Lab,致力于打破当前大模型“训练后冻结”的范式,打造能真正从自身经验中持续学习的智能体。萨顿直言:“我不奇怪,奇怪的是整个领域。”他们犀利指出合成数据是“重大错误”,提出“大世界假说”,并分享了解决灾难性遗忘的“持续反向传播”算法。这场对话将带你深入探讨:为何前沿实验室被困于局部最优?AI如何跨越语言模仿,迈向五到十年内功耗仅20瓦的万亿参数持续学习大脑?

⚙️ 本期嘉宾

里奇·萨顿(Rich Sutton):强化学习奠基人之一,阿尔伯塔大学AI研究计划核心推动者,著有AI领域圣经级文章《苦涩的教训》。他长期致力于探索心智与学习的本质,坚信所有学习本质上都是持续的,智能的核心在于不断从行动中更新认知。

Khurram Javed:萨顿的前学生,Oak Lab联合创始人,长期深耕持续学习与智能体架构设计。他深入剖析了当前AI范式的局限性,并阐述了Oak Lab如何通过新算法实现智能体的自我进化与能效突破。

🌟 精彩内容

🧠 “我不奇怪,是领域疯了”:持续学习才是智能的本能

萨顿指出,在AI热潮之前,人们从未区分“持续学习”与“非持续学习”,因为所有真正的学习都发生在行动中。他认为当前AI圈将模型发布后权重冻结的做法才是“奇怪”的,而人类与动物天生就在不断从经验中更新认知。真正的智能不应是一次性预训练,而是贯穿始终的动态过程。

“在所有这些AI热潮之前,你不需要提持续学习,因为谈论非持续的学习是没有意义的。所有学习都是持续的。我们总是在行动中学习。这才是正常的思维方式。我不奇怪。这个领域才奇怪。”

🌍 “大世界假说”与合成数据的陷阱:世界远比模拟器复杂

针对当前大模型依赖合成数据的趋势,嘉宾提出了“大世界假说”:世界的复杂程度远超任何智能体或模拟器。依赖人类专家策划的合成数据终究受限于人类认知,且无法覆盖真实物理世界的无穷变量。智能体必须直接与现实世界交互,从真实经验中不断修正粗糙的近似模型,而非依赖静态的模拟数据。

“合成数据是个大错误。世界极其复杂,任何模拟都显得微不足道。正因为世界极其复杂,你根本不可能做到‘最优’,你必须依赖各种近似处理。所以,我们必须不断学习。”

🛑 告别“训练后冻结”:LLM只占智力的四分之一?

萨顿高度肯定LLM是“未预料的科学突破”,但强调它仅代表了智力的大约四分之一。当前范式过度依赖人类知识灌输,导致模型在部署后停止学习。真正的智能系统应能像人类一样,在交互中不断吸收新知识、更新权重,并保持认知的连贯性,而不是被当作静态的知识库。

“大型语言模型是一项了不起的科学突破……但我要说清楚,所有的智能不仅仅是流利地使用语言。还有更多的东西。这大概占智力的20%或四分之一。我们还没完成。”

🔧 灾难性遗忘“完全可治愈”:持续反向传播算法揭秘

针对持续学习最大的痛点“灾难性遗忘”,嘉宾指出这并非不可逾越的技术鸿沟,而是算法设计问题。Oak Lab提出的“持续反向传播”算法通过为每个权重设置独立的学习步长,并不断注入随机性以生成新特征单元,实现了在吸收新经验的同时保护旧知识。这为构建真正可进化的AI大脑提供了算法基础。

“灾难性遗忘是‘完全可治愈’的。你需要为每个权重元学习步长,并在特征空间中不断提出新单元。持续反向传播就是不断注入随机性生成新种子,再用反向传播进行测试。结合这些,你将迎来新一代的持续深度学习。”

🚀 20瓦的万亿参数大脑:Oak Lab的十年愿景与前沿实验室的“局部最小值”困境

Oak Lab的目标是在5到10年内,打造一个能持续学习、保持连贯且功耗仅20瓦的万亿参数智能体。嘉宾坦言,前沿大厂因受制于当前范式的“局部最小值”,难以承受新范式初期性能下降的阵痛,从而错失范式跃迁。而Oak Lab选择从小团队起步,专注底层算法突破,追求极致的能效比与真正的自主进化能力。

“前沿实验室被困在一个局部最小值里,新范式在变好之前几乎不可能不变糟。他们太执着于现有产品,不可能去走一条事情会越来越糟的路。我们的目标,五到十年后,是一个万亿参数的思维,它能持续学习,保持连贯,并运行在20瓦的功耗上。”

🌐 播客信息补充

翻译克隆自:Rich Sutton and Khurram Javed: Why AI Models Stop Learning, and How to Start It Again

本播客AI进行播客音频制作,如果你对翻译和音频质量有任何意见,随时联系我。

如果有后续想要听中文版的其他外文播客,也欢迎联系微信:caiwenshuo

你可以在Bayt播客上收听任何播客的中文翻译,并查看双语字幕,

安卓 下载地址:baytfm.com

iOS 下载地址:apps.apple.com

=== keywords (plain) ===

强化学习, 持续学习, 大语言模型, 灾难性遗忘, 合成数据, 大世界假说, 持续反向传播, Oak Lab, 里奇·萨顿, 人工智能范式, 智能体架构, 算力能效, 认知科学, 红杉资本, AI前沿