022.机器人学不会,是因为找不到对的视频

022.机器人学不会,是因为找不到对的视频

22分钟 ·
播放数56
·
评论数0

本期要点

· 具身智能的瓶颈已经从模型挪到了数据:文本有万亿量级、图片有数十亿张,机器人视频只有约一百万段,差了六个数量级

· "雇人摆拍"这条路走不通——一个人被要求录动作时,做出来的就不是自然的动作,镜头本身就会改变人的行为

· Meta 的数据点:喂一百万小时公开真实世界视频,只需 62 小时真机数据,机器人就能动起来

· 行业今天的浪费触目惊心:英伟达训练机器人模型丢掉下载视频的 96%,稳定视频扩散丢掉 74%

· 替代方案是"先搜索、后采集":把筛选从下载之后提前到检索之前,按动作而非关键词检索十一亿条视频,直接返回带时间戳的可用片段