本期有点Yi思的嘉宾:
王晓刚 - 商汤科技联创 、大晓机器人董事长
韩成龙 - 蚂蚁战投具身智能投资负责人

2025年12月,大晓机器人发布了一段视频:十只搭载了同一个“大脑”的机器狗,只靠一句语音指令,就各自出发去巡查违停、排查违规无人机、自主避障。
让这件事发生的,是大晓发布的“开悟”世界模型3.0。
世界模型这个话题在行业被反复提起。它的兴起,直指过去一年具身智能主流技术VLA的根本瓶颈:VLA靠海量动作配对数据训练机器人,但很难真正理解物理规律,换个环境、换个对象,训练成功率就会下降。更致命的是,全行业靠遥控机器人积累的数据不过十万小时,而自动驾驶一天就能跑出四百万小时。这个量级差距不解决,具身智能就不可能复现大语言模型的“涌现”时刻。
大晓机器人董事长王晓刚的判断是,一个真正能用的世界模型,必须同时具备三种能力:理解世界、生成场景、预测未来状态。大晓把这三件事做进了同一个原生架构,推理速度比英伟达Cosmos快72倍,能直接部署到机器人的端侧。
王晓刚的履历,几乎是中国AI视觉发展史的一条主线:中科大少年班00班第一名,汤晓鸥教授在港中文多媒体实验室的早期弟子,2014年带队研发出超越人眼的DeepID算法,拿下中国第一个ImageNet世界冠军。同年,他以联合创始人身份加入商汤科技,完整经历了AI 1.0从“泡沫”到回归商业本质的十一年。
2025年7月,他成立大晓机器人。不到一年时间,“开悟”世界模型四榜登顶,公司完成数亿美元融资。他认为,这不是一次从零开始的创业,而是二十年技术积累在一个窗口期的集中兑现。
从产业规律看,具身智能不同于大语言模型的“模型即产品”,它必须把硬件、模型、数据、场景四个要素串成闭环,缺一不可。
王晓刚认为,当千万小时级别的环境式数据被积累起来,世界模型具备了生成、理解、预测物理世界的能力,机器人就会“智能涌现”,迎来自己的ChatGPT时刻。

图为:大晓机器狗

图为:世界模型端侧实拍

图为:开悟世界模型四榜登顶
本期【有点Yi思】对话王晓刚、韩成龙,一起聊了聊:
VLA为什么迎来了技术瓶颈?
世界模型凭什么能成为新的技术范式?
数据采集为什么必须从“以机器为中心”转向“以人为中心”?
具身智能的ChatGPT时刻到底还有多远?
⏰OUTLINE:
【一个科学家的二十年技术积累】
02:15 | 中科大少年班00班,与汤晓鸥教授相遇
05:10 | 港中文MMLab:AI界的“黄埔军校”
10:33 | DeepID超越人眼:两个团队互相“逼”出来的里程碑
13:07 | 为什么选计算机视觉?不是因为它快,而是因为它难
21:15 | 功成名就后再出发创立大晓机器人
【VLA的瓶颈,世界模型的崛起】
30:37 | 什么是世界模型?三重能力:生成、物理智能、认知
37:49 | 原生世界模型 vs 外挂模型
39:34 | 数采设备:手套、全景相机、分布式算力
43:34 | 把世界模型塞进机器人脑子:端侧部署如何实现?
45:28 | 世界模型技术路线何时收敛?预计2-3年见分晓
【商业化:先用四足狗跑起来】
55:15 | 为什么先做机器狗?场景成熟、路径短、可规模化
56:04 | 四要素闭环:硬件、模型、数据、场景缺一不可
01:04:22 | 2026年分水岭:没有商业化闭环的公司将面临什么?
01:05:38 |具身智能的“ChatGPT时刻”还有2-3年?
【大晓的决定:二十年积累,一个窗口期】
01:09:28 | AI Native组织的本质:自下而上的涌现
01:10:49 | AI 1.0创业者 vs 具身智能创业者:对手完全不同
【彩蛋】
01:14:00 | 快问快答:用一个词形容创业经历?——“持续创业”
🎬视频播客:微信视频号@蚂蚁战投、B站@有点Yi思、小红书@晶晶ZIXIN
📑文字稿:微信公众号@蚂蚁战投

