欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。
世界模型,是今年具身智能领域最热的话题之一,围绕它的争论也最多:它和 VLA 到底是什么关系?是不是被叫错了名字?在机器人、游戏、自动驾驶这些场景里,它真的能落地吗?
在前不久我们举办的「干杯吧,具身!」线下聚会上,我们请来两位这一方向的负责人:蚂蚁灵波科技具身世界模型负责人、香港科技大学助理教授徐英豪,自变量机器人世界模型负责人 Shalfun Li,让他们面对面聊一聊,“吵一吵”。
有趣的是,两人恰好是相识十一年的本科同学,如今又因为相近的技术判断走到了同一个方向上,这场对话中既有共识,也有不同观点的碰撞。
这一期播客,呈现他们对谈的原音。
开场互问:具身基础模型未来往哪走?VLA 与 VAM/WAM 之争
比起预测动作,为什么“动态预测”(Dynamics)才是世界模型更核心的能力?
架构不重要、Scaling 更重要?模态对齐才是泛化的关键吗
3D Vision 在机器人 Policy 里到底有没有用?是显性建模还是隐性先验
数据路线之争:Ego-centric 数据真的有效,还是“有人想卖数据”?
世界模型做游戏,是真风口还是伪需求?玩法与成本的现实考量
Diffusion / Flow 能学到物理规律吗?生成方式与物理世界如何映射
数据的“不可能三角”:Diversity、精度与可规模化,怎么平衡
用世界模型做模型评测:现在到了什么程度,靠谱吗
物理规律该放进预训练,还是留到后训练?
欢迎订阅「关键变量」!
更多精彩内容,敬请期待~

