预测每一帧,不如抓住关键事件:自变量世界模型 WALL-WM 的底层逻辑关键变量 Go To WALL-E

预测每一帧,不如抓住关键事件:自变量世界模型 WALL-WM 的底层逻辑

40分钟 ·
播放数55
·
评论数1

欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。

大规模多模态模型和视频基础模型,正在成为具身智能的重要底座。但这些强大的视觉和语言先验,要怎么转化为机器人真正可执行的动作?

WAIC 期间,我们举办的「干杯吧,具身!」线下聚会上,自变量机器人世界模型负责人 Shalfun Li 给出了他的答案:与其让模型按固定频率预测每一帧,不如让它学会"抓重点"——按事件来理解和预演世界。

顺着这条线,他系统拆解了事件级世界模型 WALL-WM 的底层逻辑:等长动作块(chunk)范式为什么天然存在“多解”的歧义,event caption 如何让文本、视频、动作三个模态真正对齐,以及背后的四层标注数据管线、数采的“自研还是采购”辨析。

他还聊了一个更本质的问题:我们能拿到的信号都不本质,本质的信号又拿不到,数据驱动的尽头在哪里?

分享之后的现场 Q&A 同样精彩:具身基模和上层 agent 到底怎么分工?给 VLA 加模态,加到哪里是个头?以及那句很实在的观察——“现在很多灵巧手,其实就是 5 个夹爪的排列组合”。

这期播客,呈现这场分享的原音。

00:08 Robotics Foundation Model:为什么不能只谈模型,要把数采、运控、RL 整条链路串起来

01:45 等长 chunk 的“多解”问题:同一条指令,为什么对应不出同一段动作?

02:45 Event caption:把指令拆到事件粒度,让文本、视频、动作真正对齐

05:40 四层标注的数据管线,与 Multiview 三视角的几何一致性设计

14:00 数据“自研还是采购”?一笔性价比账

17:44 能拿到的信号不本质,本质的信号拿不到:数据驱动的边界在哪

19:22 Language 是最好的 pair:学语言无法描述的“残差”,而不是 from scratch

23:51 一条示教视频就能学会新任务:in-context learning 与 memory 的探索

28:18 行业往哪收敛:往上做原生多模态压缩,往下与硬件运控 co-design

30:00 现场QA:agent 与基模怎么分工?加模态怎么权衡?触觉能不能用来切分事件?

欢迎订阅「关键变量」!有感兴趣的问题,也欢迎在评论区提出~

更多精彩内容,敬请期待!

展开Show Notes