机器人基座模型的瓶颈-数据从何而来?|畅聊物理世界AI数据的生态

机器人基座模型的瓶颈-数据从何而来?|畅聊物理世界AI数据的生态

47分钟 ·
播放数835
·
评论数2

一段坐在会议室里聊天的第一视角视频,完全来自真实世界。它看起来很“真实”,但拿去训练机器人,可能没什么用——镜头里没有发生有效的动作,环境状态也没有改变,模型自然学不到任务是怎么完成的。

这让我意识到,具身智能的数据瓶颈,和大模型时代不太一样。互联网上有大量现成的文字,但物理世界的数据不会自动变成一个干净的数据集。机器人要看见物体、理解状态变化、做出动作,还要承担动作带来的后果。真正难的问题,不只是数据够不够多,而是缺什么、怎么造、怎么验证,以及这些数据能不能回到真实部署里产生价值。

这期我邀请了群核科技北美负责人 Anthony,聊聊机器人基座模型背后的数据生态。他长期与北美的机器人实验室和 AI 团队讨论空间智能、仿真数据与模型训练,也在一线看到不同技术路线对数据需求的变化。

我们从机器人为什么没有自己的“ImageNet 时刻”聊起,聊到 YouTube 视频、第一视角数据、遥操作和 3D 合成数据分别能教会模型什么;也聊到为什么视频生成得再逼真,暂时仍很难稳定提供尺寸、碰撞和关节结构等明确的物理信息。再往后,问题又从技术绕回了商业:机器人没有产生价值,就很难进入真实场景;进不了真实场景,又拿不到下一轮训练需要的数据。

有一点想提前说一下:这期中英文夹杂会比平时多一些,很多行业里的说法本来就是英文在先,硬翻成中文反而绕,所以我们选择保留了不少原话的表达方式,想把当时的思考过程尽量原样留下来。如果听着有点跳,也欢迎多包涵。

听完这期,我更确定的一点是:机器人缺的不是一座更大的数据仓库,而是一套能找到缺口、补上缺口,再把结果带回真实世界验证的方法。

嘉宾介绍

Anthony (ManCee) Zhao:Manycore Tech(群核科技)北美增长与合作负责人,负责在北美的战略合作与生态拓展,专注于空间智能(Spatial Intelligence)、世界模型(World Models)、机器人 AI 与合成数据等方向。目前主要与全球领先的 AI 公司、机器人企业及研究机构合作,推动高质量 3D 空间数据在 Physical AI 和 Embodied AI 中的应用。中美双语背景,毕业于 UC Berkeley。

主播介绍

Leo:硅谷大厂高级机器学习工程师,GenAI、LLM 发烧友

时间轴

  • 00:18 嘉宾介绍:Anthony 负责群核科技北美业务,并与机器人及前沿 AI 实验室开展合作

  • 04:54 机器人能力栈:本体、模型与训练模型的数据,缺一块都很难走向日常使用

  • 06:22 没有“ImageNet 时刻”:通用策略很难由少数任务一次定义,基座模型仍需结合行业数据持续迭代

  • 08:26 物理数据为什么难:机器人不只要看见世界,还要理解互动、状态变化和动作后果

  • 10:44 预训练数据混合:第三人称视频、第一视角视频、仿真轨迹与遥操作数据分别扮演什么角色

  • 13:20 视频的推理边界:看见两次碰撞,不代表模型能理解重量增加后物体可能直接碎裂

  • 17:59 遥操作的含金量:采集成本高、数据量小,却仍是落地任务微调中最直接的动作与视觉配对数据

  • 19:13 3D 合成数据的价值:明确记录尺寸、距离和结构,同时面对“样板房太干净”、真实生活杂物不足的问题

  • 22:57 生成数据的鸡生蛋问题:未来可能由模型生成大部分训练数据,但模型得先靠足够好的数据获得这种能力

  • 26:19 真实视频与 3D 互补:碰撞这类稀缺场景可以靠仿真补上,仿真的物理精度不够时再靠真实视频往回校准——两边互相打补丁,不是谁替代谁

  • 29:22 部署与数据飞轮:机器人不好用就难以进入产线,无法部署又拿不到继续训练的数据

  • 32:09 数据不是一次性交付:客户通常要用 Demo 和训练结果反复验证,合作会随技术路径持续调整

  • 35:30 Eval 怎么做:围绕具体任务搭建仿真场景,在真实机器人测试前先排除明显失败的策略

  • 39:50 数据创业公司的判断标准:技术之外,先回答自己的价值主张、竞品差异和数据优势是什么

  • 43:16 接下来的数据路线:嘉宾判断未来 3-6 个月,会有更多团队重新识别第一视角数据的缺口;再往后,世界模型这块会尝试把真实视频、3D 数据和游戏数据结合起来,去补齐通用物理理解的能力

以上就是本期的全部内容了,欢迎您的收听,我们下期再见~

PS:AI Odyssey 听友群正式开通了,添加 vx:aiodysseyai,带你一起看 AI。

展开Show Notes
刘大喵
刘大喵
1 天前
听不清楚
声音质量太差,听不太清楚