本期要点
· 这期来自 Y Combinator 的圆桌对谈,主持人之一是 Keras 作者、深度学习研究者弗朗索瓦·肖莱,嘉宾是 Waddle Labs(让大语言模型控制机器人)与 RoboCurve(物理 AI 评测)的创始人。讨论的核心是一条路线之争:给机器人单独训专用模型,还是用一个足够强的通用大模型直接接管控制?
· 「苦涩的教训」在这里的落点不是架构,而是数据:视觉-语言-动作模型的架构本来就建立在语言模型之上,真正的瓶颈是训练数据。机器人领域可以借用两种已被验证的模态——编程数据与计算机操作数据,把机器人从「分布外」变成「分布内」。
· 从 RT2 到「代码即策略」再到 Voyager,能力来源是上下文学习:模型在海量代码里已经学会了「先做什么、后做什么」,因此不需要任何机器人数据就能一次性写对策略。早期「代码即策略」的论文把一批函数(拿起、抬起、移动到某位姿)交给编码智能体调用,这就是起点。
· 肖莱把「把经验塞回模型」分成四档:上下文学习 → 检索增强/主动记忆 → 低秩微调(LoRA)→ 完整微调与强化学习。选哪一档取决于你有多少数据:数据极少时上下文学习惊人地好,但很快饱和(二三十到四十个样本)、提升非单调、超过训练期一半的上下文长度反而变差;数据无穷(如特斯拉做自动驾驶)就不该用上下文学习。
· 现场演示里,前沿多模态大模型 Astra 靠摄像头输入、以多轮工具调用控制机械臂把方块放进碗里。工程上的答案是「快慢分工」:确定的部分固化成代码,不确定的部分(物体检测、失败判定与重规划)在回路里放视觉语言模型。当前头号瓶颈是延迟,但同级别模型的响应速度约每月提升一倍,年底前可能实现实时控制。
· 他们给出的时间表相当激进:前沿实验室与机器人公司之间已有共识,两年内甚至更早会拿到「通用机器人」——一句自然语言指令就能做到一个称职青年用手能做到的事,能力可泛化到未见过的任务与环境。而「整个社会可能对此毫无察觉」——这正是这期最值得听的一句提醒。
