147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥张小珺Jùn|商业访谈录

147. 和蚂蚁灵波沈宇军聊:机器人原生基础模型、大脑和本体的关系、预训练与数据scale up、老师汤晓鸥

113分钟 ·
播放数33478
·
评论数37

进入2026年,中国科技业萌生了一个新现象:出现一批从机器人大脑出发的公司,现阶段重心不在本体上。这个现象是反直觉的——过去,大家认为,硅谷机器人团队更专注大脑研究,中国机器人团队更专注硬件和本体。

在我们上集节目中,我访谈了Physical Intelligence(Pi)研究科学家柯丽一鸣。Pi是一家在硅谷做机器人大脑的备受瞩目的实验室。业内人士把它们比作机器人的OpenAI。

今天我邀请的是一位在本土探索原生具身基模的公司,是由蚂蚁集团孵化的子公司蚂蚁灵波,目前刚发布第二代具身基础模型。

我与首席科学家沈宇军聊了聊,如何从预训练开始训一个机器人模型?瓶颈是什么?机器人的GPT-1 moment在哪里?——大家也能从中感受一些中美思路的融合与差异。

接下来,就是我对沈宇军的访谈。

OUTLINE:

00:02:03 蚂蚁灵波的缘起

人工智能学生的一段迷茫与辗转

从字节跳动到蚂蚁研究院

蚂蚁成立子公司蚂蚁灵波做具身智能始末

00:16:03 做机器人的原生大脑

为什么决定从大脑开始?

通用意味着跨本体、跨场景、跨任务

24年底成立以后,25年、26年bet了什么?

25年:从真实传感器出发解决问题

26年:既然没办法push数字世界修改模型,基于物理世界的需求重做一遍

预训练准备数据核心是:1、你要下发什么样的任务,2、拿到数据以后怎么处理更干净

这次发布的6个模型和他们的关系(Depth、Vision、VLA、Video、World、VA 2.0)

但更本质的智能我们还没解决:把和人的交互考虑进去

做具身大脑之后,处理位置随机问题的能力强了很多

机器人泛化性的迹象到底出现了吗?

01:07:29 数据没有scale up是最大卡点

具身智能还没有到GPT-1时刻,因为没有看到比较好的做数据scale up的方式

当具身数据和互联网数据能达到相同量级,可能才到GPT-1时刻,我预计明年中

发完第一代模型我们就意识到,强行在数字模型上魔改不work

硅谷两家机器人大脑公司 :Physical Intelligence强调zero shot,Generalist强调后训练

随着灵巧手的成熟,真机遥操作和UMI(Universal Manipulation Interface,通用操作接口)

两条数据采集路线可能变化

细数2024-2026年具身智能全行业的发展与速度

行业发展不及预期的仍是数据,需要百万小时起步的数据量

01:23:10 机器人大脑与本体的关系

为什么不做本体?本体很难通用,如果场景选不准,本体设计有问题

现在大脑的开发落后于本体,未来大脑和本体一定交替上升

这一代的硬件不一定能够迭代去适应下一代的模型,尤其是传感器

接下来的几代机器人基座模型会如何迭代?

01:31:48 创业是赌出来的、与蚂蚁的关系、汤晓鸥

下过的“赌注”?

蚂蚁如何管理蚂蚁灵波?

最好的预期和最坏的预期?

最终的产业格局?也许贴近大语言模型的格局

你对人形机器人有执念吗? 没有!

当下的核心任务只有一个:智能不够!

我的老师汤晓鸥

LINKS:

我们的播客在小宇宙Apple Podcast、Spotify等全音频平台播出;

我们的视频播客在Bilibili小红书、视频号、抖音等全视频平台播出;

如果你想服用文字版,请搜索我们工作室的公众号:语言即世界language is world。

DISCLAIMER: 本内容不作为投资建议。

CONTACT: xiaojunzhang@lisw.ai

Jump into the new world-and explore with us!😉

展开Show Notes
听了Pi和蚂蚁这两期,深深感觉到了Kay Ke说的“国内公司更抓商业落地而Pi更专注把智能做好”。从一个研究员的角度,蚂蚁确实有点既要又要了,“落地的需求和问题驱动智能研发节奏”这件事究竟是智慧还是想当然,且看吧。
郁露:这两期连着听,特别有意思。好想让这两个嘉宾对话。
辜磊
辜磊
2026.7.22
季报没有了吗?
掬水漾
掬水漾
2026.7.23
感觉他们啥都想做,小脑大脑控制…
stayheart
stayheart
2026.7.22
来了,等了好久!
HD447641z
HD447641z
2026.8.03
1:33:48 嘉宾应该再思考一下什么叫判断什么叫赌🤣
沪上大叔
沪上大叔
2026.7.27
26 年还在做 gan,这啥技术判断?release 出来给公众有啥用,你自己都不做了
感觉这个嘉宾说话结结巴巴,没什么底气
cnnlstm:这个人讲话是边讲边思考,属于实时渲染,不是调取已有的存储
HD944131r:没有结巴啊 听感很好 是踏踏实实做过事情的人
4条回复
鲜世丹
鲜世丹
2026.7.22
季报没有了吗?
Kerry_sEHi
Kerry_sEHi
2026.7.23
哪里有文字版
讲的挺好
KD_0SP2
KD_0SP2
2026.8.20
啊!等来了 笑傲江湖的同好!金庸武侠世界的最爱就是令狐冲
AriaLia
AriaLia
2026.8.14
主播真是梦到哪句问哪句
Amoxylin_
Amoxylin_
2026.8.10
59:56 这些是在语言模型早就解决了的问题,到了“具身”有什么特别的难点吗,技术不能直接复用吗?
强烈建议小珺和许华哲来一期
HD447641z
HD447641z
2026.8.03
智能的核心卡点是数据这个结论也过于简化了
HD452341y
HD452341y
2026.7.25
这一期不错,干货满满👍
Soyo-Yan
Soyo-Yan
2026.7.24
很实在的分享。感谢
很扎实的一期,对数据scale up确实是目前机器人的卡点
常常QA
常常QA
2026.7.22
最近机器人太热了
美丽大方富有健康聪慧可爱:热……吗?二级市场凉透了
HD589607t
HD589607t
2026.7.22
人家在开创一个新范式