于是转身向具身走去|对话王家伟:24 岁的具身智能首席科学家

70分钟 ·
播放数81
·
评论数0

➤ 本周「十字路口」的嘉宾王家伟是 24 岁的深朴智能(Simple AI)首席科学家。中科大少年班、MSRA、DeepSeek、字节 Seed——**这条路直通大模型的最前沿,但毕业时,他却转身向具身走去。**为什么呢?

他想离开的不是大模型,而是只能跟随既定计划的状态。他说:「风浪越大,鱼越贵」 ——具身的路线、评估和产品都还没有共识,风险更高,却也给了年轻研究者定义问题的空间。

本期播客中,我们从 GPT-6 Astra 出发,讨论了「OpenAI 会不会降维打击具身模型」的问题。王家伟认为,通用大模型会承担越来越多理解与规划,但当杯子开始滑落,机器人仍需要能快速反应的动作模型。

深朴智能因此从 HiFi-UMI 数据、具身基础模型、Agentic OS 一直做到本体:开源 2,000 小时数据,内部积累数万小时;模型已观察到一定的 Zero-shot 泛化;Agentic OS 则把上层意图与底层动作连接起来。

最后,我们讨论了在美国的具身同行们最新发布的各种工作:GEN-1.5 对预训练与自然涌现的验证、π0.7 对 steerability 的强化、以及 Skild AI 为 Demo 专门训练的 In-Context Learning 是否被高估。

🎬 我们的视频播客将同步上线于 @Koji杨远骋 的视频号、抖音小红书哔哩哔哩Youtube 等平台。

📒 文字版将发布于 @十字路口Crossing 公众号。

🟢 于是转身向具身走去

00:00 快问快答:年龄、毕业院校、MBTI、星座、一句话介绍

04:02 GPT-6 Astra 操控机械臂

06:27 OpenAI 等基模公司会击穿具身模型吗?

09:28 中科大少年班怎么选人?

13:14 聪明,是会提好问题

14:54 “风浪越大鱼越贵”

19:44 DeepSeek:不靠工作强度换成果

21:32 从 DeepSeek 多模态到 Seed Agent

🟢 深朴的选择

25:24 深朴为什么必须做全栈?

26:40 HiFi-UMI:开源 2,000 小时

32:01 GPT-6 比人更会标数据

34:15 Zero-Shot:不靠后训练的新任务

🟢 什么才是具身智能的「智能」?

36:10 不追逐“世界模型”概念

36:55 Context:从一秒因果到长期记忆

41:52 Scaling 趋势,不等于 Scaling Law

44:34 Agentic OS:具身不只是一个模型

48:09 没有公认 Benchmark,如何证明模型?

🟢 前沿点评

54:14 Astra:通用智能外溢到物理世界

55:53 GEN-1.5 与 π0.7

57:34 被高估的 In-Context Learning

01:00:04 具身领域:噱头可能大于真实

01:07:47 离开大模型舒适区

01:09:57 三年后,机器人能帮人洗碗吗?

欢迎订阅「十字路口」:

🚦 我们关注新一代 AI 技术浪潮带来的行业新变化和创业新机会。

🚦 十字路口是乔布斯对苹果公司的一个比喻,形容它站在科技与人文的十字路口,伟大的产品往往诞生在这里。AI 正在给各行各业带来改变,我们寻找、访谈和凝聚新一代 AI 创业者和 AI 时代的积极行动者,和他们一起,探索和拥抱新变化,新的可能性。

👦🏻  主播 Koji:我创办了十字路口,发起了 AI Hacker House 这个新一代 AI 创业者的社群空间,在真格基金担任 Venture Partner 投资合伙人。我相信科技尤其是 AI 是我们这一代人最大的价值创造机遇。Koji 的即刻Koji 的网站