论文
关注行动,为了行动:政策学习中出现的视觉瓶颈
Attention from Action, for Action: Emergent Visual Bottlenecks for Policy Learning
摘要
将政策输入集中于感兴趣区域 (ROI) 的视觉瓶颈可以通过将看向何处与如何行动分开来提高数据效率的视觉运动学习。许多 ROI 界面依赖于外部空间标签,例如凝视、对象类或可供性注释。无标签替代方案通常通过检测夹具或运动事件并将固定作物集中在投影的末端执行器处,从轨迹中获取作物。这种由动作衍生的作物是有用的空间先验,不需要额外的标签,但它们编码有关事件时间、代理点和作物规模的固定选择。当控制所需的视觉证据远离末端执行器或随着任务进展而不断变化时,这些作物可能会错位。我们提出了 Seeker,一种以任务和状态为条件的读出器,可以从动作中学习注意力。从冻结的 DINOv3 特征开始,Seeker 使用收集的视觉证据迭代更新查询,仅通过动作监督生成进度感知的 ROI。学习到的 ROI 用作 RGB 裁剪、掩模引导的背景增强和点云过滤的空间接口。在模拟和现实世界中,Seeker 相对于无作物、增强和动作衍生作物基线提高了数据效率和稳健性。在真实的机器人上,Seeker 将平均域内成功率从最佳基线的 48.3% 提高到 76.7%,并且在照明/背景下的成功率从 20.0% 提高到 60.0%。