


预测每一帧,不如抓住关键事件:自变量世界模型 WALL-WM 的底层逻辑欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 大规模多模态模型和视频基础模型,正在成为具身智能的重要底座。但这些强大的视觉和语言先验,要怎么转化为机器人真正可执行的动作? WAIC 期间,我们举办的「干杯吧,具身!」线下聚会上,自变量机器人世界模型负责人 Shalfun Li 给出了他的答案:与其让模型按固定频率预测每一帧,不如让它学会"抓重点"——按事件来理解和预演世界。 顺着这条线,他系统拆解了事件级世界模型 WALL-WM 的底层逻辑:等长动作块(chunk)范式为什么天然存在“多解”的歧义,event caption 如何让文本、视频、动作三个模态真正对齐,以及背后的四层标注数据管线、数采的“自研还是采购”辨析。 他还聊了一个更本质的问题:我们能拿到的信号都不本质,本质的信号又拿不到,数据驱动的尽头在哪里? 分享之后的现场 Q&A 同样精彩:具身基模和上层 agent 到底怎么分工?给 VLA 加模态,加到哪里是个头?以及那句很实在的观察——“现在很多灵巧手,其实就是 5 个夹爪的排列组合”。 这期播客,呈现这场分享的原音。 00:08 Robotics Foundation Model:为什么不能只谈模型,要把数采、运控、RL 整条链路串起来 01:45 等长 chunk 的“多解”问题:同一条指令,为什么对应不出同一段动作? 02:45 Event caption:把指令拆到事件粒度,让文本、视频、动作真正对齐 05:40 四层标注的数据管线,与 Multiview 三视角的几何一致性设计 14:00 数据“自研还是采购”?一笔性价比账 17:44 能拿到的信号不本质,本质的信号拿不到:数据驱动的边界在哪 19:22 Language 是最好的 pair:学语言无法描述的“残差”,而不是 from scratch 23:51 一条示教视频就能学会新任务:in-context learning 与 memory 的探索 28:18 行业往哪收敛:往上做原生多模态压缩,往下与硬件运控 co-design 30:00 现场QA:agent 与基模怎么分工?加模态怎么权衡?触觉能不能用来切分事件? 欢迎订阅「关键变量」!有感兴趣的问题,也欢迎在评论区提出~ 更多精彩内容,敬请期待!
论文很 fancy,真机见真章:具身智能模型的「冰山之下」藏着什么?欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 最近,自变量机器人联合创始人、算法合伙人甘如饴在清华大学进行了一场分享。 他在分享中提到,fancy的论文只是冰山一角,真正决定一个具身智能基础模型能力的,是冰山之下——硬件、数据、infra、后训练、评测等环节上长久的积累。 顺着这条线,他分享了更多「冰山之下」的部分: 如何“反过来”定义硬件、具身数据到底要采多少、为什么质量比数量更难、怎样的 infra 才能支撑机器人集群在线学习,后训练如何成为模型能力的「放大器」,以及为什么真机评测才是模型进化的「北极星」。 这期播客,呈现这场分享的原音。 时间轴: 00:08 “fancy 的论文只是冰山一角” 01:34 硬件:AI “反过来”定义硬件——量子一号、量子二号与自研灵巧手 04:30 数据:到底要采多少才够?为什么质量比数量更难? 18:34 Infra:D-Muon 优化器与支撑机器人集群在线学习的框架 20:55 后训练:模型能力如何“放大”?为什么要给模型加上“记忆”? 24:31 评测:为什么真机评测是模型进化的“北极星”?仿真又能做什么 欢迎订阅「关键变量」! 更多精彩内容,敬请期待~
世界模型,是不是具身智能的下一站?来听蚂蚁灵波 x 自变量的“交锋”欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 世界模型,是今年具身智能领域最热的话题之一,围绕它的争论也最多:它和 VLA 到底是什么关系?是不是被叫错了名字?在机器人、游戏、自动驾驶这些场景里,它真的能落地吗? 在前不久我们举办的「干杯吧,具身!」线下聚会上,我们请来两位这一方向的负责人:蚂蚁灵波科技具身世界模型负责人、香港科技大学助理教授徐英豪,自变量机器人世界模型负责人 Shalfun Li,让他们面对面聊一聊,“吵一吵”。 有趣的是,两人恰好是相识十一年的本科同学,如今又因为相近的技术判断走到了同一个方向上,这场对话中既有共识,也有不同观点的碰撞。 这一期播客,呈现他们对谈的原音。 01:22 开场互问:具身基础模型未来往哪走?VLA 与 VAM/WAM 之争 02:13 比起预测动作,为什么“动态预测”(Dynamics)才是世界模型更核心的能力? 08:47 架构不重要、Scaling 更重要?模态对齐才是泛化的关键吗 04:53 3D Vision 在机器人 Policy 里到底有没有用?是显性建模还是隐性先验 09:28 数据路线之争:Ego-centric 数据真的有效,还是“有人想卖数据”? 14:04 世界模型做游戏,是真风口还是伪需求?玩法与成本的现实考量 20:43 Diffusion / Flow 能学到物理规律吗?生成方式与物理世界如何映射 34:12 数据的“不可能三角”:Diversity、精度与可规模化,怎么平衡 38:36 用世界模型做模型评测:现在到了什么程度,靠谱吗 41:47 物理规律该放进预训练,还是留到后训练? 欢迎订阅「关键变量」! 更多精彩内容,敬请期待~
大模型很聪明,机器人为什么还“笨笨的”?聊聊我们最近开源的 Wall-OSS-0.5欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。在这里,我们将分享自身的前沿思考与技术实践——无论是创始人的行业洞察,还是实验室里鲜活的研发趣事,都希望能为你带来启发。 同样是大模型,VLM 看起来已经超级聪明,但部署在真机上的具身模型却还是有点“笨笨的”,经常东西拿不稳、找不到、动作还发抖。这中间到底缺了一座什么样的桥,能把“智能”引过去? 就在最近,我们开源了具身智能基础模型 Wall-OSS-0.5,首次实现了预训练后无需针对下游任务做后训练,模型直接部署到机器人上就能完成搬运、分拣、整理绳索等操作,部分任务上的零样本泛化已经接近常规微调后的水平。 前段时间,我们办了一场关于具身智能基础模型的线下聚会「干杯吧,具身!」。在这一期播客里,我们把自变量动作基模负责人 Lucy 在活动上的分享原音重现,听 Lucy 和大家一起聊聊 Wall-OSS-0.5 背后的想法与训练配方。 时间轴: 00:00 同样是大模型,为什么 VLM 很聪明,真机上的具身模型却还是笨笨的? 03:54 既要泛化又要精确操作:离散与连续结合,自变量的做法和主流有何不同 06:38 连接“看懂”与“做到”:拆解 Wall-OSS-0.5 的“两座桥” 09:09 具身评估为什么是个“大麻烦”?我们如何建立科学的真机评测体系 11:04 Unseen Task 的表现,与微调的“能力放大器”效应 14:26 冰山之下:数据采集、质量管理与训练 Infra,才是更重要的一环 15:06 现场 QA:VQA 数据、Loss 权重观察、Sub-task 预测与视觉对齐 Tokenizer 欢迎订阅「关键变量」! 更多精彩内容,敬请期待~
打榜、开源、「被滥用」的世界模型......开年就热闹的2026,具身智能往哪里走?欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 在这期播客,自变量机器人CTO王昊和一位头部科技媒体作者进行了交流: 从最近热闹的具身智能模型“打榜”说起,展开聊聊具身智能行业模型开源、技术路径选择、「新」概念的辨析......以及更多未来趋势。 以下是时间轴: 00:45 打榜之外,为什么具身智能模型需要开源 03:44 “套壳”或基础模型,具身智能公司为什么做出不一样的选择? 09:09 先做专用模型?还是先做通用模型? “偷懒的大模型”面前,应该采用什么样的技术战略? 11:40 从通用模型到不同场景的细化,转折点会出现在什么时候? 17:01 「世界模型」,是否被“滥用”了? 19:59 真开源或假“开源”,如何分辨? 22:18 打榜会成为 2026 年行业大趋势吗?为什么? 24:32 如何评判一个具身智能基础模型的能力? 30:38 如何理解最近出现的“对 VLA 的反思”?业内出现了什么样的新路线? 33:35 行业共识是否正在形成?2026 年可能会有什么样的趋势? 欢迎关注「关键变量」! 更多精彩内容,敬请期待~
关键变量 x 中金研究院:中国具身智能赛道没有“过热”而是“过冷”欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 这期播客,我们与 @中金研究院 共创!《中金机器人播客 | ZHOU ZIPENG PODCAST》由中金研究院创新经济组出品,旨在深入探究人形机器人技术迭代背后的产业逻辑与商业机遇,剖析从技术落地、供应链构建到未来应用场景的根本性议题。和一线的创业者、投资人、研究者一起,展现中国人形机器人产业发展的真实前沿。 在这期内容里,自变量机器人创始人、CEO 王潜 与中金研究院执行总经理、创新经济团队负责人 周子彭 共同交流具身智能的技术路径、商业逻辑、未来图景以及更多「关键变量」。 时间轴: 00:00:09 开场:具身智能的“冲浪”时刻与王潜的背景 00:03:14 顶级学者的遗憾:当年为何错过了 Transformer,又为何坚定回归机器人? 00:07:03 范式转移:GPT-3 带来的启示,机器人领域苦寻 80 年的“金钥匙” 00:10:49 物理世界的 Scaling Law:从“机器制造机器”到星际殖民的资源指数增长 00:16:04 路线之争:为何坚持“端到端”统一大模型?分层架构的 Trade-off 与局限 00:22:13 数据真相:Sim2Real 的鸿沟,为何仿真数据在 Manipulation 上难以成为主流? 00:25:35 惊人判断:真实数据的效用比仿真数据高出 5-6 个数量级 00:29:06 商业逻辑的博弈:为何“先做专用再做通用”在技术上是死路一条? 00:34:42 开源生态:自变量 WALL-OSS 的战略,中国会诞生全球最好的开源具身模型吗? 00:37:04 软硬解耦伪命题:为何机器人领域难现“安卓时刻” 00:40:23 商业版图:字节、阿里入局,大厂与创业公司的双向奔赴 00:47:49 泡沫还是洼地?具身智能可能是中国一级市场历史上泡沫最小的大赛道 00:49:54 警惕误判:美国硬件能力正在回流,中美竞争的胜负手仍在模型 00:52:21 2026 预测:正 ROI 产能将现,具身智能的“狼”真的来了 00:55:50 本体收敛论:一定要五指灵巧手吗?三指或四指或许更符合 ROI 01:01:35 终局思考:AI 对人类劳动的替代不可逆转,UBI(全民基本收入)或许是终解 欢迎关注「关键变量」! 更多精彩内容,敬请期待~
当机器人独立完成外卖配送最后100米 ——聊聊具身智能如何进入真实物理世界欢迎收听自变量机器人的播客「关键变量」!让我们一起捕捉具身智能的关键变量。 在这里,我们将分享自身的前沿思考与技术实践,无论是创始人的行业洞察,还是实验室里鲜活的研发趣事,都希望能为你带来启发。 去年11月,我们完成了全球首例机器人基于端到端vla模型、在真实场景及开放环境下全程自主外卖配送任务; 最近,我们在社交媒体发布了相关视频,引发了不少关注和好奇。 「关键变量」第一期,我们和项目负责人、自变量算法工程师 Ethan 一起聊聊这个项目,以及项目背后的具身智能模型进展。 时间轴: 00:49 机器人配送外卖,包含哪些步骤?涉及什么样的技术点? 09:33 什么情况下,传统规划导航会“失效”,必须由端到端模型来实时分析、应对? 11:49 机器人夹爪如何准确按电梯? 20:51 完成这个任务后,模型的能力有了什么样的提升? 20:13 为什么选择具身智能行业?为什么加入自变量? 欢迎订阅「关键变量」! 更多精彩内容,敬请期待~