论文

看看重要的地方:视觉-语言-动作模型的自适应视觉细化

Look Where It Matters: Adaptive Visual Refinement for Vision-Language-Action Models

模型架构Transformer

摘要

VLA 模型的视觉表示对于空间精确的机器人操作来说仍然不可靠。我们发现 VLA 中的视觉编码器还表现出先前在通用 Vision Transformer 中记录的注意伪影,并进一步表明,在具身策略中,这些伪影与 后训练 期间获得的空间感知能力密切相关。当编码器学习与任务相关的信息(例如对象位置、深度排序和局部几何形状)时,有限的全局词元容量会导致部分信息溢出到低信息补丁词元中。我们引入了 AtVLA,这是一个将可学习的寄存器标记插入视觉编码器的框架。仅使用具身数据和原始动作目标进行端到端训练,这些寄存器成为具身空间信息的专用载体,而其余的补丁词元恢复干净且空间忠实的注意力分布,这对于精确目标定位和细粒度接触至关重要。干净的注意力可以恢复可靠的定位,但无法恢复低分辨率观察中丢失的几何细节。因此,AtVLA 将注意力校正与不确定性门控局部细化结合起来。行动专家对多个行动块进行采样,并从它们的分歧中估计不确定性;仅对于不确定的预测,动作条件注意力传播会识别任务相关区域,该区域会被裁剪、以高分辨率重新编码,并附加到缓存的前缀以进行精细的动作生成。在 LIBERO、SimplerEnv 和具有挑战性的单视图现实世界基准中,AtVLA 将 LIBERO 的平均成功率从 94.2% 提高到 98.4%,将现实世界的成功率从 46.5% 提高到 69.0%。大约 30% 的重新规划步骤会触发裁剪,导致在代表性部署设置下基础模型的总计算量仅为 1.4-1.6 倍。