论文

ActGaze:通过反事实视觉干预学习基于动作的注视以实现高精度操作

ActGaze: Learning Action-Grounded Gaze through Counterfactual Visual Interventions for High-Precision Manipulation

模型训练监督微调与指令调优

摘要

当前的视觉-语言-动作(VLA)模型经常难以应对高精度的机器人操作。我们将这种限制主要归因于他们的视觉注意力分散在与任务无关的区域。为了解决这个问题,我们提出了 ActGaze,一种训练方法,指导 VLA 策略注视任务相关区域,就像人类在执行精确动作时注视关键视觉线索一样。与之前依赖外部标签进行注视监督的方法不同,ActGaze 通过使用反事实视觉干预来识别对动作预测至关重要的区域,直接从 VLA 自身的动作目标中获得空间监督。对四项高精度机器人操作任务进行的广泛真实机器人实验表明,ActGaze 可以在任务相关区域引起更集中的视觉注意力,并且始终优于基本 VLA 策略和其他视觉基础方法。