近年来,视觉-语言-动作(VLA)模型在机器人测试中屡创佳绩,仿佛让人看到了通用物理智能的曙光。但这可能只是一场美丽的误会!这篇文章揭开了当前VLA模型所谓具身推理的伪装,指出这些亮眼的高分往往源于模型在静态环境中死记硬背出的捷径,而非真正具备了语义理解和逻辑推理能力。研究团队设计了动态诊断基准BeTTER,通过空间变换、因果干扰等一系列压力测试,让最先进的模型原形毕露。文章不仅深挖了导致模型降智的架构压缩与感知瓶颈,还通过真实的机械臂物理实验证实了这些致命缺陷。
文章:Unmasking the Illusion of Embodied Reasoning in Vision-Language-Action Models
