2026年7月19日,世界人工智能大会(WAIC)思想者论坛迎来了一位重量级嘉宾——2024年图灵奖得主、现代强化学习奠基人理查德·萨顿(Richard Sutton)。他现任加拿大阿尔伯塔大学教授、加拿大人工智能研究所(Amii)首席研究员,他关于强化学习的理论构成了AlphaGo、自动驾驶、具身机器人等里程碑式技术的基石。
萨顿此次演讲题为《强化学习的第一线:从经验培育超级智能》。在这场持续近一小时的分享中,他系统阐述了自己追寻数十年的核心命题:如何让超级智能从经验中自主生长,而非依赖人类预先编码的知识。
他重申了著名的"苦涩的教训"——短期来看,把人类知识塞进AI总有成效;长期来看,真正突破永远来自计算规模、搜索与学习。在此基础上,他提出了OAK架构(选项与知识),主张智能体应像婴儿一样,通过与环境交互、获得奖励信号,自主发现特征、创建子问题、学习技能,从而形成开放式的抽象循环。
对于当下大语言模型的热潮,萨顿直言LLM有其局限,通向AGI的路径仍有其他可能。这是萨顿首次在WAIC公开分享这一完整框架,值得每一位关注AI底层演进方向的研究者与从业者细读。




会场实时转写、翻译、辅助来自:younavi.me
