概要:只使用一台固定的全局相机,不修改 VLA 模型的主体结构,只利用机器人本身已经具备的运动学信息,从全局图像中自动裁剪出机械手附近的局部区域,让机器人获得接近腕部相机的手部精细视觉,同时降低数据采集和部署成本; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2603.20668 ;
概要:VLA 的空间感知能力提升也算是业内一个研究热点了,因为大部分VLA采用的单目相机虽然能够识别物体及其语义,但缺少明确的几何信息。对于机器人来说,看出“这是一个杯子”还不够,还需要判断杯子距离机械手有多远、应该从哪个方向接近,以及夹爪是否已经准确对准目标;这项工作的核心目标,就是利用双目立体视觉,提升机器人对空间位置、物体深度和相机视角变化的感知能力; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2512.21970 ;
概要:一般 VLA 采用单目 RGB 相机作为其进行动作决策的观察输入,天然存在深度信息不足的问题;而那些依赖 RGB-D 硬件或 3D 大模型提取深度信息的 VLA 方案,又面临着部署成本高,提取的几何特征噪声大、高维动作空间优化负担重等问题;该研究以此提出了感知与动作双维度协同优化的思路。感知侧借助多视图扩散隐先验补充几何信息,设计基于 Transformer 结构的门控网络结构过滤遮挡噪声;动作侧基于动作流形假设,将预测目标转为有效动作块,简化优化目标,同时兼顾精度与鲁棒性; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2605.11832 ;
概要:大部分传统 VLA 依赖大量人工标注轨迹,成本较高;本文提出 TAP 两阶段训练框架,先用无标注机器人自主交互数据预训练运动先验,少量标注数据对齐语言,大幅降低标注需求且环境扰动鲁棒性更强; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:arxiv.org/pdf/2607.02466 ;
概要:现有 VLA 微调方式会对所有轨迹点进行“一视同仁”式地调整,易在夹爪切换等需要重点关注的阶段产生问题;本文提出的低成本、插件式 StaKe 框架,自动提取阶段、监督关键帧,不改推理流程,在模拟和实机上都能收到正收益; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.26801 ;
概要:现有 VLA 模型依赖视觉捷径、语言指令约束力弱;本文提出无视觉参与的语言动作预训练框架 LA4VLA,自制 33K 数据集,在仿真与真机任务上达到了预期的效果; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.27295 ;
概要:现有机器人 VLA 策略仅选全局最优,浪费部署前冒烟测试数据;本文提出的 RouterVLA,用试跑数据做专家路由监督,用低代价提升任务成功率; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.27355 ;
概要:现有方法通常将预训练好的视觉语言模型和随机初始化的动作模块直接联合训练;然而,机器人数据中的语言信息远少于视觉和动作信息,模型训练过程中容易形成视觉捷径;同时,随机初始化的动作专家还会产生噪声梯度,反过来破坏原本已经具备较强语言能力的视觉语言模型;模型虽然学会了动作,却可能逐渐丧失语言理解能力;针对这一问题,研究团队从贝叶斯视角重新解释了 VLA 的策略学习过程; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/abs/2606.12366 ;
概要:现有 VLA 模型通常只能专注于导航或操作中的单一任务,难以形成真正通用的机器人智能;此次介绍的 OneVLA 提出统一动作空间和渐进式联合训练框架,使单个模型同时具备移动导航与机械臂操控能力,并在模拟和真实环境中超过专用模型,为通用具身智能提供了一条新的实现路径; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.01241 ;
概要:针对 VLM / VLA 在具身决策中受视觉幻觉影响的问题,本文通过构建场景图进行粗到细的聚焦计划生成,让模型自主过滤干扰、聚焦任务相关物体,并将聚焦能力蒸馏到 VLA 中实现实时推理,在操作和导航任务上取得显著提升; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.04046v1 ;
概要:现有机器人世界模型仅支持开环预测,无法适配真实机器人任务中 VLA 的闭环评估需求;本文提出分块式世界模型 PiL-World,结合视觉控制与历史记忆,融合优劣轨迹学习,实现多视角观测生成与闭环推演;实测显示其模拟结果贴合真机运行,大幅缩小仿真与真实场景下 VLA 成功率的评估误差; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2606.05773 ;
概要:单目视觉策略缺乏可靠深度感知,而显式 3D 重建(点云、深度图)对噪声敏感且计算开销大;本文提出的 StereoPolicy 利用双目立体图像对,以一种非显式 3D 重建的轻量级方式融合空间对应与视差信息,显著提升 VLA 模型的操作精度; 声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文; 链接:https://arxiv.org/pdf/2605.09989 ;
与播客爱好者一起交流
添加微信好友,获取更多播客资讯
播放列表还是空的
去找些喜欢的节目添加进来吧