论文

按操作阶段识别视觉目标,改善模仿策略的抗干扰能力

What Matters, When? Diagnosing and Improving Conditional Visual Grounding in Visuomotor Imitation Policies

模型评测模型行为与机制分析

摘要

视觉运动模仿策略可以在分布视觉条件下实现高性能,但在引入视觉相似的物体或容器时会失败。我们将这种行为作为条件视觉基础的问题来研究:成功控制所需的视觉目标会随着操作阶段的变化而变化,在更复杂的任务中,会随着观察到的任务状态而变化。使用 Transformer (ACT) 的动作分块,我们系统地引入具有受控颜色和形状相似性的干扰对象和容器,并定位拾取和放置失败的位置。我们发现,干扰物敏感性特定于视觉相似性类型和操纵阶段。在这一诊断的指导下,我们评估了干扰物增强、阶段依赖性注意力正则化和基于外观的视觉提示作为补充干预措施,以改善目标选择,同时保留控制所需的空间信息。这些干预措施大大提高了模拟和物理 UR3e 的稳健性。我们进一步检查了状态条件仪器处理任务中预训练的视觉-语言-动作策略中的相同故障模式,其中观察到的医疗仪器状态决定了正确的目的地。总之,结果表明,即使潜在的操作技能保持完好,视觉干扰因素也可能导致错误的物体或目的地选择,并且明确改善目标选择可以显着恢复不同视觉运动政策学习机制的表现。