如果说过去几年,AI 的主战场还在屏幕里,那么具身智能正在把问题带回真实世界:机器人要看见、触摸、移动、判断,还要在不完美的物理环境里持续工作。
这一期,围绕物理智能最核心的三组分歧展开讨论:数据之争、智能之争、场景之争。
仿真数据和真实数据到底谁更重要?通用大模型会不会“降维打击”具身智能公司?机器人行业真正跨过泡沫的标志,是技术 Demo,还是客户愿意持续付钱?
本期嘉宾:
韩铮
苏度科技联合创始人兼首席执行官
沈宇军
蚂蚁灵波科技首席科学家
王潜
自变量机器人创始人兼首席执行官
许华哲
破壳机器人创始人、清华大学交叉信息研究院助理教授
主持人:
「十字路口Crossing」播客主播 杨远骋Koji
本期判断
具身智能不会简单复刻大模型的发展路径。
它可能同样需要预训练、数据、评测和规模化,但进入物理世界之后,智能面对的是传感器噪声、接触变化、硬件可靠性、商业成本和持续反馈。机器人真正难的地方,不只是“理解指令”,而是在真实世界里稳定完成任务。
你会听到
仿真数据为什么绕不过去?
真实世界数据到底不可替代在哪里?
通用大模型会不会降维打击具身智能?
机器人做麻婆豆腐、抓筷子、叠衣服,分别说明了什么?
为什么机器人最难的是复杂物理接触?
具身智能商业化不能只看 Demo,而要看什么指标?
五年后回头看,今天的具身智能哪些被高估,哪些被低估?
时间线
为什么这一期要聊“数据之争、智能之争、场景之争”
仿真数据路线:为什么只靠真实数据收集效率不够
真实数据路线:机器人必须面对传感器误差和物理世界的不完美
智能之争:通用大模型会不会降维打击具身智能?
Astra 能抓筷子,但为什么还做不好麻婆豆腐?
具身智能会不会反过来影响云端大模型的发展路径
机器人未来可能是“上层理解 + 底层技能”的分层系统
场景之争:具身智能跨过泡沫,最关键的商业化指标是什么
站在五年后看,今天的具身智能被高估和低估了什么
数据量、通用能力与具身智能模型的未来进展
核心观点
仿真不是万能的,但真实世界数据也不是唯一答案。不同阶段需要不同数据,真正关键的是能不能规模化地产生、验证和使用高质量数据。
物理世界的不完美很难被完全仿真。传感器噪声、触觉信号、接触变化和环境随机性,都是机器人最终落地必须面对的问题。
通用大模型不会天然解决具身智能。语言、代码、数学、视频和机器人控制之间,并不存在简单的能力迁移。
具身智能的商业化不能只看炫酷 Demo。更重要的是高成功率、泛化能力、部署成本、设备可靠性,以及客户是否愿意持续付钱。
机器人行业真正的机会,可能不只是替代人做某个动作,而是让 AI 进入生产、制造和物理世界的闭环。
名词解释
具身智能
让 AI 不只停留在文本、图像和屏幕中,而是通过机器人等实体系统感知、行动,并与真实物理世界交互。
Sim-to-Real
指在仿真环境中训练出的能力,迁移到真实世界后能否继续有效。
Real-to-Sim
指能否把真实世界中的复杂因素,比如传感器噪声、触觉反馈、物体差异等,规模化地还原到仿真环境中。
Contact-rich Task
复杂物理接触任务,比如叠衣服、做饭、插筷子、操作柔性物体等。这类任务往往比“识别物体并移动过去”更难。
Astra
OpenAI 的 GPT-6("GPT-6 Astra"),能直接驱动机械臂的大模型(具身智能能力)。目前能做到控制抓筷子、插杯子、递物等简单抓取、放置动作
延伸信息
欢迎在小红书搜索:会友播客
添加小助手微信:huiyouhz
和我们一起继续聊科技、商业与未来世界。

