欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。
大规模多模态模型和视频基础模型,正在成为具身智能的重要底座。但这些强大的视觉和语言先验,要怎么转化为机器人真正可执行的动作?
WAIC 期间,我们举办的「干杯吧,具身!」线下聚会上,自变量机器人世界模型负责人 Shalfun Li 给出了他的答案:与其让模型按固定频率预测每一帧,不如让它学会"抓重点"——按事件来理解和预演世界。
顺着这条线,他系统拆解了事件级世界模型 WALL-WM 的底层逻辑:等长动作块(chunk)范式为什么天然存在“多解”的歧义,event caption 如何让文本、视频、动作三个模态真正对齐,以及背后的四层标注数据管线、数采的“自研还是采购”辨析。
他还聊了一个更本质的问题:我们能拿到的信号都不本质,本质的信号又拿不到,数据驱动的尽头在哪里?
分享之后的现场 Q&A 同样精彩:具身基模和上层 agent 到底怎么分工?给 VLA 加模态,加到哪里是个头?以及那句很实在的观察——“现在很多灵巧手,其实就是 5 个夹爪的排列组合”。
这期播客,呈现这场分享的原音。
Robotics Foundation Model:为什么不能只谈模型,要把数采、运控、RL 整条链路串起来
等长 chunk 的“多解”问题:同一条指令,为什么对应不出同一段动作?
Event caption:把指令拆到事件粒度,让文本、视频、动作真正对齐
四层标注的数据管线,与 Multiview 三视角的几何一致性设计
数据“自研还是采购”?一笔性价比账
能拿到的信号不本质,本质的信号拿不到:数据驱动的边界在哪
Language 是最好的 pair:学语言无法描述的“残差”,而不是 from scratch
一条示教视频就能学会新任务:in-context learning 与 memory 的探索
行业往哪收敛:往上做原生多模态压缩,往下与硬件运控 co-design
现场QA:agent 与基模怎么分工?加模态怎么权衡?触觉能不能用来切分事件?
欢迎订阅「关键变量」!有感兴趣的问题,也欢迎在评论区提出~
更多精彩内容,敬请期待!

