🎙️ 📝 本期播客简介
本期我们克隆了:a16z · Why Fei-Fei Li Is Betting on Spatial Intelligence
原内容更新时间:Fri, 04 Sep 2026
本期 a16z 主持人 Martin Casado 与 World Labs 联合创始人 Fei-Fei、Justin、Ben 对谈,围绕他们最新发布的世界模型 Atlas,解释空间智能究竟需要解决什么问题,以及新视角预测为什么可能成为继 next token prediction、next frame prediction 之后的下一种基础原语。
Atlas 同时具备生成、重建和模拟世界的能力:它可以根据少量带有相机位姿的图像,重建现实空间,并生成任意新视角下的视频帧或 3D 世界。节目详细讨论了 Atlas 与普通视频模型的区别、它如何把生成与重建统一到同一个多模态架构中,以及为什么三张手机拍摄的画面就可能替代数百张传统重建素材。
对谈还延伸到空间智能的未来:动态世界、可编辑的 3D 场景、建筑与创意工作流,以及机器人训练中的 real to sim。Fei-Fei、Justin 和 Ben 认为,机器人真正的瓶颈目前仍是现实世界数据,而能够理解空间、预测动作后果的世界模型,可能同时成为仿真器与规划器。
👤 本期嘉宾
Fei-Fei、Justin、Ben 是 World Labs 的联合创始人,围绕空间智能与世界模型展开研究和产品开发。Ben 是 NeRF 的创造者,长期研究从图像生成 3D、视觉重建与新视角合成;Fei-Fei 在计算机视觉领域已有数十年经验,强调空间几何、物理规律与智能之间的关系;Justin 带领团队推进 Atlas 的模型架构、训练与扩展。
三位嘉宾共同参与了 Atlas 的研发。相比此前聚焦高斯泼溅输出的 Marble,Atlas 将文本、图像、视频、3D 信息与相机位姿统一为原生多模态输入,并以新视角预测作为核心基元。主持人 Martin Casado 是 a16z General Partner,本期负责追问 Atlas 的技术路径、扩展假说、应用场景与发展方向。
⏱️ 时间戳
Atlas的新视角预测
从Marble到Atlas
从创作到空间智能
🌟 精彩内容
💡 新视角预测是 Atlas 的核心原语
Atlas 不只是根据文字生成画面,也不只是预测视频的下一帧。它会读取一个场景的多个视角及其空间信息,再推断虚拟相机位于时空中任意位置时应该看到什么,把空间几何纳入生成过程。
"而 Atlas 做的其实是新视角预测,对吧?"
💡 生成与重建第一次在同一个模型里统一
传统计算机视觉往往把像素生成、识别、3D 重建视为不同赛道。Atlas 则试图让同一套架构同时完成精确重建与具有创造性的生成,在看得见的内容与不可见的空白之间建立连续关系。
"这是我们第一次把像素生成和像素重建统一了起来。"
💡 三张手机视频也能实现《黑客帝国》式子弹时间
经典子弹时间镜头需要围绕主体部署数百台相机,而 Atlas 可以从三台 iPhone 拍摄的素材中重构场景,让镜头在时间冻结的瞬间自由移动,不再依赖影棚、绿幕和昂贵校准。
"但现在用 Atlas,我们最少只要三台相机就能做到。"
💡 空间智能不止是生成 3D
真正的空间智能需要让模型能够生成空间内容,在空间中推理、编辑与交互,并进一步完成渲染、模拟和动作规划。Atlas 的关键进展,在于为每一帧估计相机位姿,让生成的像素拥有空间依据。
"但是生成真正具备空间语境和依据的像素,绝对是另一个重大步骤,而这正是 Atlas 迈出的非常艰难的一步。"
💡 稀疏输入正在改变 3D 重建的数据逻辑
传统稠密重建需要从大量角度覆盖场景的每个角落,甚至要拍摄数百张照片。Atlas 通过生成能力填补不可见区域,把过去无法用于重建的随手视频、旧照片和网络素材,转化为有空间依据的 3D 世界。
"而我们想做的,是把它降到大概 3 张。"
💡 机器人领域最大的瓶颈仍然是现实世界数据
机器人策略不是生成一张图片或一段代码,而是让 Agent 在充满意外的真实世界里行动。Atlas 可以降低 real to sim 的数据采集成本,并为训练机器人策略提供更丰富的环境变化与仿真素材。
"我们应该把视野放宽,认识到目前机器人领域最大的难题其实是数据。"
💡 动态世界与可编辑性是下一阶段
Atlas 的架构已经支持动态内容,但团队认为,未来还需要把动态、静态、多模态控制与可编辑性结合起来,让用户不仅能浏览世界,还能直接控制场景中的物体、布局、特征和时间变化。
"我觉得可编辑性才是这里的关键。"
💡 新视角预测可能像 next token prediction 一样基础
大语言模型通过 next token prediction 建模语言,视频模型通过 next frame prediction 建模时间变化,而 Atlas 试图用新视角预测建模空间变化。嘉宾认为,预测一个世界从新位置看起来会怎样,可能是理解物理世界与智能行为的基础能力。
"所以我们非常坚信,下一视点预测就相当于 next token prediction。"
🌐 播客信息补充
本播客采用原有人声声线进行播客音频制作,也可能会有一些地方听起来怪怪的
使用 AI 进行翻译,因此可能会有一些地方不通顺
