对话智在无界卢宗青:大家都在谈世界模型,但正确方法还没有出现

对话智在无界卢宗青:大家都在谈世界模型,但正确方法还没有出现

57分钟 ·
播放数17
·
评论数0

【本期介绍】

机器人行业最容易被看见的是身体:人形外观、机械臂、灵巧手,以及越来越像人的行走和劳动。但智在无界是一家从来没有造过机器人的机器人公司。它选择只做那个看不见、也更难被验证的部分:机器人的大脑。

这一期「虎嗅 AI 100」,我们邀请到智在无界创始人卢宗青,聊通用具身基础模型究竟应该怎么训练。

智在无界用人类第一视角视频训练模型。从最初的3000小时到如今的50万小时,它的模型已经可以控制30多种不同的机器人,并在端侧实现30赫兹推理。2023年年底,当行业还在仿真数据和真机数据中寻找答案时,卢宗青就判断,人类视频拥有更广的数据分布,也更有可能被规模化。

后来,人类视频逐渐成为行业共识。但数据路线开始收敛,并不意味着具身智能已经找到了正确方法。卢宗青认为,今天市面上还没有一个模型真正配得上“世界模型”这个名字。行业知道需要更多数据,却依然不知道应该用怎样的学习范式,把这些数据转化成通用的机器人大脑。

这也是智在无界最有意思的矛盾:它在一个没有标准答案的领域,做一家必须持续给出答案的模型公司。投资人反复追问它为什么不做硬件、为什么要用人的数据;卢宗青的选择则是把有限的团队资源放在最根本的问题上。硬件是一种商业选择,模型能力才是决定这家公司能走多远的前提。

智在无界从VLA走向Latent World Action Model,希望绕开逐像素预测带来的巨大算力开销,把训练成本降低到视频生成路线的几十分之一,甚至1%。但卢宗青也没有把当前路线描述成终点。他说:“我能保证公司最终收敛到一个正确的方法,但是我不能保证当前的方法就是最终的方法。”

在一个习惯向投资人讲确定性的行业里,这种坦率反而构成了这期对话的核心。在这期节目里,我们会聊世界模型为什么被叫滥了,人类视频为什么可能是训练通用具身模型最重要的数据来源,纯模型公司如何找到自己的生态位,以及当大厂真正入场时,创业公司还能拥有多长的时间壁垒。

【本期嘉宾】

卢宗青|智在无界创始人、北京大学计算机学院长聘副教授

【本期主播】

陈伊凡|虎嗅科技主笔、“AI原生100”栏目主持人

【你将听到】

00:06 一家不造机器人的机器人公司,到底在做什么?

02:18 世界模型被说滥了吗?什么才是真正的具身基础模型?

06:37 从游戏智能体到物理世界:为什么决定转向机器人?

11:44“大规模的人类视频,可能是唯一可以训出来通用具身基础模型的数据。”

15:29 50 万小时视频的真正壁垒:不是采集,而是标注粒度

38:08 中美具身模型“本质上没有差距”

50:44 大厂真正入场之前,创业公司的时间壁垒在哪里?

53:13“我能保证的是我们公司最终能收敛到一个正确的方法,但是我不能保证我当前的这个方法就是最终的方法。”

【关于我们】

欢迎订阅虎嗅「AI原生100」栏目。我们将会围绕 AI 原生创新,分享垂类里的 AI 创新产品、创始人或操盘者的 AI 原生思考和行动、AI 落地千行百业当中的 know-how,以及正在通过 AI 落地并产生实际收益和价值的创新案例。