

VLA 研究:只用一台全局相机,也能看清局部重点-Synthoid.ai、米兰理工大学概要:只使用一台固定的全局相机,不修改 VLA 模型的主体结构,只利用机器人本身已经具备的运动学信息,从全局图像中自动裁剪出机械手附近的局部区域,让机器人获得接近腕部相机的手部精细视觉,同时降低数据采集和部署成本; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2603.20668 ;
StereoVLA:同时看懂“什么”和“哪里”—Galbot、北大、中科院自动化所、港大、厦大马来分校、南科大概要:VLA 的空间感知能力提升也算是业内一个研究热点了,因为大部分VLA采用的单目相机虽然能够识别物体及其语义,但缺少明确的几何信息。对于机器人来说,看出“这是一个杯子”还不够,还需要判断杯子距离机械手有多远、应该从哪个方向接近,以及夹爪是否已经准确对准目标;这项工作的核心目标,就是利用双目立体视觉,提升机器人对空间位置、物体深度和相机视角变化的感知能力; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2512.21970 ;
G3T:通过多视图隐先验增加 VLA 空间感知能力-机器智能与先进计算教育部重点实验室、高德、西交大、深圳理工概要:一般 VLA 采用单目 RGB 相机作为其进行动作决策的观察输入,天然存在深度信息不足的问题;而那些依赖 RGB-D 硬件或 3D 大模型提取深度信息的 VLA 方案,又面临着部署成本高,提取的几何特征噪声大、高维动作空间优化负担重等问题;该研究以此提出了感知与动作双维度协同优化的思路。感知侧借助多视图扩散隐先验补充几何信息,设计基于 Transformer 结构的门控网络结构过滤遮挡噪声;动作侧基于动作流形假设,将预测目标转为有效动作块,简化优化目标,同时兼顾精度与鲁棒性; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2605.11832 ;
TAP:通过构建任务无关预训练方案降低 VLA 标注成本-复旦大学、上海创智学院概要:大部分传统 VLA 依赖大量人工标注轨迹,成本较高;本文提出 TAP 两阶段训练框架,先用无标注机器人自主交互数据预训练运动先验,少量标注数据对齐语言,大幅降低标注需求且环境扰动鲁棒性更强; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2607.02466 ;
StaKe:有的放矢式地提效 VLA 微调-中国科学院大学、中国科学院自动化研究所、中科第五纪概要:现有 VLA 微调方式会对所有轨迹点进行“一视同仁”式地调整,易在夹爪切换等需要重点关注的阶段产生问题;本文提出的低成本、插件式 StaKe 框架,自动提取阶段、监督关键帧,不改推理流程,在模拟和实机上都能收到正收益; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.26801 ;
LA4VLA:让 VLA 模型学会不“看”也能“做”-上海交通大学、阿里巴巴集团、南洋理工大学、阿卜杜拉国王科技大学概要:现有 VLA 模型依赖视觉捷径、语言指令约束力弱;本文提出无视觉参与的语言动作预训练框架 LA4VLA,自制 33K 数据集,在仿真与真机任务上达到了预期的效果; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.27295 ;
RouterVLA:通过复用冒烟测试作为监督提升 VLA 模型任务成功率-香港中文大学、马里兰大学帕克分校、清华大学概要:现有机器人 VLA 策略仅选全局最优,浪费部署前冒烟测试数据;本文提出的 RouterVLA,用试跑数据做专家路由监督,用低代价提升任务成功率; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.27355 ;
APT:通过“先学运动、后学语言”抑制 VLA 语言退化-浙江大学、浙江人形机器人创新中心概要:现有方法通常将预训练好的视觉语言模型和随机初始化的动作模块直接联合训练;然而,机器人数据中的语言信息远少于视觉和动作信息,模型训练过程中容易形成视觉捷径;同时,随机初始化的动作专家还会产生噪声梯度,反过来破坏原本已经具备较强语言能力的视觉语言模型;模型虽然学会了动作,却可能逐渐丧失语言理解能力;针对这一问题,研究团队从贝叶斯视角重新解释了 VLA 的策略学习过程; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/abs/2606.12366 ;
OneVLA:具身操控+导航统一端到端建模:清华大学、鹏城实验室、小米汽车、中科院自动化所、北大、港科大(广州)概要:现有 VLA 模型通常只能专注于导航或操作中的单一任务,难以形成真正通用的机器人智能;此次介绍的 OneVLA 提出统一动作空间和渐进式联合训练框架,使单个模型同时具备移动导航与机械臂操控能力,并在模拟和真实环境中超过专用模型,为通用具身智能提供了一条新的实现路径; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.01241 ;
SceneDiver:通过由粗到细式聚焦突破 VLA 感知瓶颈:浙江大学、倍漾量化、浙江省医疗智能决策重点实验室概要:针对 VLM / VLA 在具身决策中受视觉幻觉影响的问题,本文通过构建场景图进行粗到细的聚焦计划生成,让模型自主过滤干扰、聚焦任务相关物体,并将聚焦能力蒸馏到 VLA 中实现实时推理,在操作和导航任务上取得显著提升; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.04046v1 ;
PiL-World:分块式闭环评测具身智能场景:同济大学、美的 AIRC概要:现有机器人世界模型仅支持开环预测,无法适配真实机器人任务中 VLA 的闭环评估需求;本文提出分块式世界模型 PiL-World,结合视觉控制与历史记忆,融合优劣轨迹学习,实现多视角观测生成与闭环推演;实测显示其模拟结果贴合真机运行,大幅缩小仿真与真实场景下 VLA 成功率的评估误差; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.05773 ;
StereoPolicy:双目立体感知驱动具身操作策略-斯坦福大学、西北大学、Lambda Inc.概要:单目视觉策略缺乏可靠深度感知,而显式 3D 重建(点云、深度图)对噪声敏感且计算开销大;本文提出的 StereoPolicy 利用双目立体图像对,以一种非显式 3D 重建的轻量级方式融合空间对应与视差信息,显著提升 VLA 模型的操作精度; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2605.09989 ;
AQC:让机器人的动作节奏快慢自如-北京大学、银河通用(Galbot)、多伦多大学概要:现有具身领域中基于动作分块(Action Chunking)的强化 Q 学习 方法对所有状态使用固定 chunk 大小,无法兼顾接触精细控制与自由空间高效规划;本文提出的自适应 chunk 大小选择方案解决跨尺度 Q 值比较的偏差坍塌问题,在多个测试集上效果能够显著提升; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/abs/2605.05544 ;
Long-VLA:通过对长时任务分而治之提升成功率-西湖大学联合国内多家高校和科研机构联合发布概要:基于时域阶段的分治(divide-and-conquer):根据长时任务不同时间段的特点划分阶段,并采取与之适配的处理方式(phase-aware)进行针对性处理; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/abs/2508.19958 ;
作者说:构建世界模型环境协助 VLA 模型进行后训练:中山大学联合其他科研机构联合发布 World-Env概要:本期很荣幸地邀请到了 World-Env/RehearseVLA 的一作,来自中山大学的 肖俊锦 同学,对于我们解析他们团队多次迭代更新的研究成果: 论文题目: World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training 常用简称: World-Env/RehearseVLA 首发时间: 2025年09月29日(2026年03月18日更新第五版) 主要作者: Junjin Xiao(一作,在阿里巴巴集团高德地图实习期间完成本研究)、Yandan Yang、Xinyuan Chang、Ronghan Chen、Feng Xiong、Mu Xu、Wei-Shi Zheng、Qing Zhang(通讯作者) 发表机构: 中山大学、阿里巴巴集团高德地图、机器智能与先进计算教育部重点实验室 进行点评,同时也会穿插一些他对于 VLA 、具身智能相关方面的理解; 本文属于模型架构类的 VLA 研究,将世界模型思想和仿真环境进行了结合,抓住了目前 VLA 在某些场景下真实数据获取难等痛点,提出自己方案架构的同时还附带了一个可以验证方案有效性的模拟环境,非常闭环; 声明:上述声音均采用 AI 合成,其中由作者口述部分为作者本人真实观点,内容已经过本人授权发表;且主要作者已经确认征得该论文所有作者同意以此种解读方式发表;文中对应观点仅代表主要作者本人;解析仅针对该文发布时,arxiv 上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2509.24948v5;