原文祯是我的中学同学,当我与知乎合作,开始这一档播客的策划的时候,几乎第一时间想到,应该找她来聊一期。
首先当然是因为她是一位杰出的机器人学家。文祯现在是伊利诺伊大学香槟分校(UIUC)计算机系助理教授,RoboTouch 实验室创始人。
此前,她在清华大学机械工程系本科,MIT 博士,师从 Edward Adelson,是视触觉传感器 GelSight 的核心研发者之一——这项技术让机器人的指尖第一次拥有了接近人类皮肤的分辨率。
而且,她的研究周期,几乎跨越了触觉的整个寒冬。
2012 年入行时,触觉正处在它最冷清的年代;十三年后,触觉被不少人视为通用机器人的最后一块拼图。文祯的研究贯穿了这个领域从冷到热的整个周期:从传感器的设计与制造,到触觉与视觉的跨模态感知,到触觉仿真,再到跨传感器的通用触觉表征。
2025 年,文祯获 IEEE RAS Early Career Award,这是机器人领域给青年学者的最高荣誉之一。我很想知道,当实验室只剩下她一个学生的时候,她是怎么走下来的,而当这个领域变得热闹起来的时候,她似乎也并没有着急参与其中。
这期节目里,我们会聊文祯如何一头扎进触觉这个领域,聊触觉究竟是什么,它和视觉有着怎样的不同,触觉会以怎样的方式拓展 robotics 的边界,触觉传感器发展的瓶颈究竟在什么地方,而她为什么一直坚持在触觉这个领域。
Outline
开场
十八年前的高考志愿:去机械系造「聪明的身体」
「进了清华机械系,发现是做铸锻焊的」
最好的机器人学者,需要是某种通才
去 MIT:Adelson 从视觉转向触觉
触觉的 80 年代:先行者们为什么纷纷退圈
15000 美元一个的传感器,和「量没上去」的真相
一柜子念不出名字的化学试剂
GelSight:从一个大盒子,到机器人的指尖
人的触觉和机器人的触觉,是两种东西
一个被当成噪音的信号
「十年后,你现在学的知识一点用都没有」
实验室唯一的学生:触觉最冷的那几年
摸西红柿:把一个直觉变成定量研究
Connecting Look and Feel:照片完全不同,人一眼知道是同一块布
Sergey Levine 为什么「拉黑」了触觉
「道法万物」:她理解的本质
在仿真里重建一个传感器
真正的瓶颈是接触模型:摩擦力,一个物理界都没有共识的东西
Kitchen Artist 为什么不用 GelSight:「我研究的是触觉,不是 GelSight」
一件毛衣:可编程针织机做成的全身触觉皮肤
让所有传感器说同一种语言:触觉最 critical 的问题
学界的问题,产业界的问题,和三个 open question
触觉在机器人身上,到底怎么用
「为了证明触觉有用而找任务」——一个尖锐的批评,和她的回应
怎么判断真问题:「像喜欢梵高还是莫奈」
快问快答,以及她的拒绝回答
本期提到的人物与概念
张文增:清华大学机械系教授,原文祯本科时的科研启蒙导师,研究灵巧手,以支持本科生做科研著称。
Edward(Ted)Adelson:MIT 教授,原文祯的博士导师。以人类视觉与感知研究著称,职业生涯横跨神经科学、认知科学、计算机视觉,2010 年前后转向触觉,是 GelSight 技术的开创者。
GelSight:一种「用看实现摸」的视触觉传感器:柔软的胶面接触物体产生形变,内置相机拍下形变,再通过算法还原出接触面的精细几何和力——分辨率接近甚至超过人类指尖。
BioTac:2010 年代最流行的商业触觉传感器之一,指头形状,节目中提到它售价 15000 美元一个——触觉传感器「贵」的经典例子。
Jeremy Fishel:BioTac 的开发者,博士毕业后创业将其商业化。节目中那句「如果能像 iPhone 一样一年卖几百万个,我可以把成本降到 20 美元」出自他。
Photometric Stereo(光度立体):计算机视觉的经典技术:用不同方向光照下物体的明暗变化,反推出表面的三维几何。GelSight 用它从相机图像还原接触面形状——「用看实现摸」的原理核心。
视触觉传感器(Vision-based Tactile Sensor):用摄像头「看」柔软表面的形变来实现触觉的传感器路线,GelSight 是代表。相比传统的电信号式触觉传感器,分辨率高出几个数量级。
Slip Detection(滑移检测):检测「手里的东西正在滑」。人靠触觉本能地做到这件事(杯子一滑手就握紧),机器人做到它极难,是触觉最经典的应用之一。节目中她把一度以为是噪音的信号,识别为滑移的特征。
Contrastive Learning(对比学习):一种训练方式:让「同一个东西的不同观察」在表征空间里靠近,「不同东西」远离。Connecting Look and Feel 用它逼出跨模态一致的表征。
Andrew Owens:原文祯在 MIT 时的合作者,做视觉出身,把她「带入」了神经网络,Connecting Look and Feel 等工作的共同作者。现任教于康奈尔大学(节目中称「安柱」)。
Sergey Levine:UC Berkeley 教授,机器人学习领域最有影响力的学者之一,坚定的「数据派」。节目中那位相信「一千个数据不够就一万个」、最终「拉黑」了触觉的合作者。
TRI(Toyota Research Institute):丰田在北美的研究机构,机器人研究规模很大。原文祯博士毕业前后在此实习,第一次深入接触了仿真。
CMU 机器人研究所(Robotics Institute):卡内基梅隆大学的机器人研究机构,全球规模最大的机器人研究单位之一,原文祯在此任教四年后转至 UIUC。
Jeannette Bohg(Janet):斯坦福大学教授,原文祯博士后期间的合作导师。她提到,选择 Janet 的一个重要考量,是想学习一位年轻女性学者如何带团队。
Sim-to-Real:在仿真里训练机器人、再迁移到真实世界的路线。省数据省硬件,但仿真和现实之间的差距(gap)是永恒的难题。她做触觉仿真,正是为了缩小这个 gap 里「传感器」那一块。
接触模型(Contact Modeling):描述两个物体接触时会发生什么(会不会滑、怎么变形)的物理模型。节目中她认为这是当前触觉仿真真正的瓶颈——连摩擦力本身,物理学界都还没有共识。
Sensor-invariant Representation(跨传感器通用表征):她近年的主线工作:不同触觉传感器像在说不同「方言」,数据互不相通;这项工作学出一个抹去传感器差异的通用表征,让新传感器只需少量标定就能接入。她认为这是触觉领域当前最关键的问题。
制作
声音设计 / 制作:君泽
制作人 / 主播:君泽
知乎:闻烜、CC、冬菇

