本期要点
· 本期要点
· 1. 世界模型的评判标准被搞错了:今天大家在比谁生成的视频更漂亮、更流畅,但像素只是在模拟"观测",不包含世界背后的语义和因果关系,因此无法支撑规划与预测。
· 2. 讲者用七十年的人工智能史铺垫:从 1956 年达特茅斯会议、感知机与早期机器翻译,到马尔可夫和香农的语言模型、1975 年 IBM 正式提出"语言模型"这一术语。
· 3. 一条被低估的主线:语言模型长期是语音与自然语言处理的核心技术,却在人工智能其他领域几乎无人知晓——大众记忆里的 AI 史被"视觉故事"主导了。
· 4. 大语言模型的真正瓶颈不是数据也不是算力:2007 年谷歌已有两万亿词元规模的语言模型与足够算力,卡住的是模型架构的灵活度;直到 2020 年 GPT-3 时代规模与架构同时到位才爆发。
· 5. Moonlake 的做法是回到代码:在视觉世界之下垫一层代码作为符号表示,用"写代码渲染 → 与真实物理对比 → 找偏差 → 改代码"的循环(Claude Code 式)迭代出可验证的动作条件世界模型,得到神经符号表示——符号部分人类可对接、可编辑、可维护。
· 6. 核心目标:用精确仿真替代真实世界里一万小时的遥操作数据,并且能任意生成真实世界采不到的罕见场景(长尾),这才是人形机器人与自动驾驶落地的真正瓶颈。
· 7. 两个值得记住的判断:其一,"软件吃掉世界"只完成了上半场,软件一直吃不下物理世界,可验证的代码驱动仿真就是下半场;其二,仿真不必在每一个细节上都精确,关键是你能控制哪些部分需要建模、哪些不需要。
