

破壳机器人许华哲、薛峥嵘:机器人做的麻婆豆腐,科技含量格外高吗?不论是 WAIC,或者 WRC,机器人都在做着类似的事情:叠衣服、会分拣快递、会折纸盒。业内人知道这些动作背后是海量数据和顶尖算法,普通人却容易生出另一种感受:最好的机器人也只能做到这些吗? 许华哲是清华交叉信息研究院的助理教授,也创办了破壳机器人;薛峥嵘是他的学生,现在是破壳的 CTO。他们的目标是让机器人走进家庭。对于这一天何时到来,两人都相当乐观,薛峥嵘给出的时间是一年。 这一年里需要解决的问题着实不少:泛化到底指什么,它有哪些维度;失败的数据为什么比成功的数据更值钱;家庭场景里的奖励函数该怎么设;触觉研究做得很漂亮,为什么可能没有用;世界模型和 VLA 的区别在哪;本体的形态还有多少选项。 但或许我们会有另一种期待,或许我们也会迎来一个 GPT 3.0 一样的转折点,它并没有直接解决问题,而是让一些问题变得不再有必要去特意求解。 Outline * 00:01:52 两条不同的入行路径:从清华电子系到多伦多大学交换,从中学生英才计划到本科阶段的 CVPR oral * 00:05:55 一只狐狸和一只刺猬:许华哲为什么找薛峥嵘,以及他画的那张饼 * 00:09:15 常见任务里的 80%,零样本泛化会在一年内到来 * 00:10:48 麻婆豆腐:三个多月做出的端到端 demo,以及它难在哪 * 00:13:05 泛化的维度:物体摆放、物体类别、场景,再往上是组合泛化 * 00:18:45 被低估的失败数据:网球出界一点点,是非常高质量的失败 * 00:24:57 为什么不直接用视频生成模型:系扎带的任务会崩坏成一根丝带 * 00:30:11 捣乱测试,以及选择家庭场景的理由——足够乱,所以信息量足够大 * 00:35:33 家庭场景里的奖励函数:尽量只给稀疏的 0 和 1 * 00:40:18 触觉的矛盾:手工艺品与可口可乐,以及几千块与一百多块的传感器 * 00:46:19 本体的限制:叠被子的负载、跨本体迁移、双足与轮式之争 * 00:52:35 世界模型和 VLA 的区别:先想象出画面,再反推动作 * 01:01:11 端到端为什么被相信:架构并不复杂,是数据把它跑通的 * 01:10:50 数据的质量比数据量更重要:在同一个房间里踩十万小时也没有用 * 01:20:06 给 2017 年的自己,和给十年后的自己 本期提到的人与概念 * 零样本泛化:遇到没见过的物体、摆法或场景,不经过额外训练就能完成任务。这一期的核心争论落在它什么时候到来。 * 长程任务:需要连续完成多个步骤才算成功的任务。每一步的成功率会连乘,链条越长越难。做一盘菜是典型。 * Diffusion Policy:2023 年提出的动作生成方法,把「下一步怎么动」当成图像生成那样的去噪过程来做。两位嘉宾把它看作端到端路线走通的起点之一。 * action chunk:模型一次吐出一小段连续动作,而不是一帧一帧地吐。节目里说这是个很小的改动,效果上却是分水岭。 * push T:一个基准任务,用机械臂把 T 形块推到指定位置。只能推、不能抓,考的是接触与摩擦下的连续控制。 * VLA:视觉与语言输入、动作输出的一类模型的统称。日常语境里通常特指其中一种具体做法,节目里花了一段区分这两层含义。 * 世界模型:让模型先预测环境接下来会变成什么样,再从预测出的画面反推该怎么动。 * 稀疏奖励与稠密奖励:强化学习里只在最终成功时给一次分,或者在过程中不断给分。前者难学,后者容易把机器人限死在人设计好的路径上。 * 跨本体:在一种机器人硬件上学到的能力,迁移到另一种硬件上。 * 视触觉传感器:用摄像头拍弹性膜的形变来读取触觉的一类传感器。 * AlexNet(2012):让深度学习在图像识别上确立地位的模型。两位嘉宾对它的记忆不同,正好对应各自入行的年份。 * SAM(Segment Anything,2023):Meta 的通用分割模型。节目里用它说明一个领域的「刷榜时代」是怎么结束的。 * π0:Physical Intelligence 于 2024 年发布的机器人基础模型,被许多人视作端到端方法真正跑通的标志。 * GelSight:视触觉传感器里最早、也最常被引用的一支工作。 * 卢策吾:上海交通大学教授。薛峥嵘本科时上过他的课。 * 高阳:清华大学交叉信息研究院助理教授。节目里提到他主张把触觉纳入 VLA。 制作 * 制作人/主播:君泽 * 声音设计/剪辑:君泽、Layla * 知乎:闻烜、CC、冬菇
与 UIUC 原文祯对谈:机器人触觉,Gelsight,寒冬与可能性,数据与物理本质,悬而未决的问题原文祯是我的中学同学,当我与知乎合作,开始这一档播客的策划的时候,几乎第一时间想到,应该找她来聊一期。 首先当然是因为她是一位杰出的机器人学家。文祯现在是伊利诺伊大学香槟分校(UIUC)计算机系助理教授,RoboTouch 实验室创始人。 此前,她在清华大学机械工程系本科,MIT 博士,师从 Edward Adelson,是视触觉传感器 GelSight 的核心研发者之一——这项技术让机器人的指尖第一次拥有了接近人类皮肤的分辨率。 而且,她的研究周期,几乎跨越了触觉的整个寒冬。 2012 年入行时,触觉正处在它最冷清的年代;十三年后,触觉被不少人视为通用机器人的最后一块拼图。文祯的研究贯穿了这个领域从冷到热的整个周期:从传感器的设计与制造,到触觉与视觉的跨模态感知,到触觉仿真,再到跨传感器的通用触觉表征。 2025 年,文祯获 IEEE RAS Early Career Award,这是机器人领域给青年学者的最高荣誉之一。我很想知道,当实验室只剩下她一个学生的时候,她是怎么走下来的,而当这个领域变得热闹起来的时候,她似乎也并没有着急参与其中。 这期节目里,我们会聊文祯如何一头扎进触觉这个领域,聊触觉究竟是什么,它和视觉有着怎样的不同,触觉会以怎样的方式拓展 robotics 的边界,触觉传感器发展的瓶颈究竟在什么地方,而她为什么一直坚持在触觉这个领域。 Outline 00:55 开场 02:24 十八年前的高考志愿:去机械系造「聪明的身体」 04:25 「进了清华机械系,发现是做铸锻焊的」 08:33 最好的机器人学者,需要是某种通才 11:20 去 MIT:Adelson 从视觉转向触觉 12:20 触觉的 80 年代:先行者们为什么纷纷退圈 17:10 15000 美元一个的传感器,和「量没上去」的真相 20:00 一柜子念不出名字的化学试剂 22:37 GelSight:从一个大盒子,到机器人的指尖 26:00 人的触觉和机器人的触觉,是两种东西 29:53 一个被当成噪音的信号 37:27 「十年后,你现在学的知识一点用都没有」 39:32 实验室唯一的学生:触觉最冷的那几年 44:38 摸西红柿:把一个直觉变成定量研究 46:50 Connecting Look and Feel:照片完全不同,人一眼知道是同一块布 55:40 Sergey Levine 为什么「拉黑」了触觉 01:06:09 「道法万物」:她理解的本质 01:09:25 在仿真里重建一个传感器 01:15:36 真正的瓶颈是接触模型:摩擦力,一个物理界都没有共识的东西 01:22:29 Kitchen Artist 为什么不用 GelSight:「我研究的是触觉,不是 GelSight」 01:27:00 一件毛衣:可编程针织机做成的全身触觉皮肤 01:32:00 让所有传感器说同一种语言:触觉最 critical 的问题 01:39:30 学界的问题,产业界的问题,和三个 open question 01:44:42 触觉在机器人身上,到底怎么用 01:52:04 「为了证明触觉有用而找任务」——一个尖锐的批评,和她的回应 01:55:54 怎么判断真问题:「像喜欢梵高还是莫奈」 01:57:43 快问快答,以及她的拒绝回答 本期提到的人物与概念 张文增:清华大学机械系教授,原文祯本科时的科研启蒙导师,研究灵巧手,以支持本科生做科研著称。 Edward(Ted)Adelson:MIT 教授,原文祯的博士导师。以人类视觉与感知研究著称,职业生涯横跨神经科学、认知科学、计算机视觉,2010 年前后转向触觉,是 GelSight 技术的开创者。 GelSight:一种「用看实现摸」的视触觉传感器:柔软的胶面接触物体产生形变,内置相机拍下形变,再通过算法还原出接触面的精细几何和力——分辨率接近甚至超过人类指尖。 BioTac:2010 年代最流行的商业触觉传感器之一,指头形状,节目中提到它售价 15000 美元一个——触觉传感器「贵」的经典例子。 Jeremy Fishel:BioTac 的开发者,博士毕业后创业将其商业化。节目中那句「如果能像 iPhone 一样一年卖几百万个,我可以把成本降到 20 美元」出自他。 Photometric Stereo(光度立体):计算机视觉的经典技术:用不同方向光照下物体的明暗变化,反推出表面的三维几何。GelSight 用它从相机图像还原接触面形状——「用看实现摸」的原理核心。 视触觉传感器(Vision-based Tactile Sensor):用摄像头「看」柔软表面的形变来实现触觉的传感器路线,GelSight 是代表。相比传统的电信号式触觉传感器,分辨率高出几个数量级。 Slip Detection(滑移检测):检测「手里的东西正在滑」。人靠触觉本能地做到这件事(杯子一滑手就握紧),机器人做到它极难,是触觉最经典的应用之一。节目中她把一度以为是噪音的信号,识别为滑移的特征。 Contrastive Learning(对比学习):一种训练方式:让「同一个东西的不同观察」在表征空间里靠近,「不同东西」远离。Connecting Look and Feel 用它逼出跨模态一致的表征。 Andrew Owens:原文祯在 MIT 时的合作者,做视觉出身,把她「带入」了神经网络,Connecting Look and Feel 等工作的共同作者。现任教于康奈尔大学(节目中称「安柱」)。 Sergey Levine:UC Berkeley 教授,机器人学习领域最有影响力的学者之一,坚定的「数据派」。节目中那位相信「一千个数据不够就一万个」、最终「拉黑」了触觉的合作者。 TRI(Toyota Research Institute):丰田在北美的研究机构,机器人研究规模很大。原文祯博士毕业前后在此实习,第一次深入接触了仿真。 CMU 机器人研究所(Robotics Institute):卡内基梅隆大学的机器人研究机构,全球规模最大的机器人研究单位之一,原文祯在此任教四年后转至 UIUC。 Jeannette Bohg(Janet):斯坦福大学教授,原文祯博士后期间的合作导师。她提到,选择 Janet 的一个重要考量,是想学习一位年轻女性学者如何带团队。 Sim-to-Real:在仿真里训练机器人、再迁移到真实世界的路线。省数据省硬件,但仿真和现实之间的差距(gap)是永恒的难题。她做触觉仿真,正是为了缩小这个 gap 里「传感器」那一块。 接触模型(Contact Modeling):描述两个物体接触时会发生什么(会不会滑、怎么变形)的物理模型。节目中她认为这是当前触觉仿真真正的瓶颈——连摩擦力本身,物理学界都还没有共识。 Sensor-invariant Representation(跨传感器通用表征):她近年的主线工作:不同触觉传感器像在说不同「方言」,数据互不相通;这项工作学出一个抹去传感器差异的通用表征,让新传感器只需少量标定就能接入。她认为这是触觉领域当前最关键的问题。 制作 声音设计 / 制作:君泽 制作人 / 主播:君泽 知乎:闻烜、CC、冬菇