本期要点
· 具身智能的瓶颈已经从模型挪到了数据:文本有万亿量级、图片有数十亿张,机器人视频只有约一百万段,差了六个数量级
· "雇人摆拍"这条路走不通——一个人被要求录动作时,做出来的就不是自然的动作,镜头本身就会改变人的行为
· Meta 的数据点:喂一百万小时公开真实世界视频,只需 62 小时真机数据,机器人就能动起来
· 行业今天的浪费触目惊心:英伟达训练机器人模型丢掉下载视频的 96%,稳定视频扩散丢掉 74%
· 替代方案是"先搜索、后采集":把筛选从下载之后提前到检索之前,按动作而非关键词检索十一亿条视频,直接返回带时间戳的可用片段
