主播
节目简介
来源:小宇宙
概要:一般 VLA 采用单目 RGB 相机作为其进行动作决策的观察输入,天然存在深度信息不足的问题;而那些依赖 RGB-D 硬件或 3D 大模型提取深度信息的 VLA 方案,又面临着部署成本高,提取的几何特征噪声大、高维动作空间优化负担重等问题;该研究以此提出了感知与动作双维度协同优化的思路。感知侧借助多视图扩散隐先验补充几何信息,设计基于 Transformer 结构的门控网络结构过滤遮挡噪声;动作侧基于动作流形假设,将预测目标转为有效动作块,简化优化目标,同时兼顾精度与鲁棒性;
声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文;
链接:arxiv.org/pdf/2605.11832 ;
声明:上述声音采用AI合成,解析内容为原创;解析仅针对该文发布时,arXiv上已公开被解析论文的最新版本的内容进行;其中所有涉及原论文的图、数据都引用自原论文,如涉及侵权,请及时联系删除;人工解读,难免有错误遗漏,如有发现及时联系修改;如需要深入研究建议阅读原文;
链接:arxiv.org/pdf/2605.11832 ;