论文

Gaze2Act:用于交互式机器人操作的注视条件视觉语言动作策略

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

摘要

视觉-语言-动作(VLA)模型最近显示出通过遵循语言指令进行机器人学习的强大潜力。然而,在实践中,仅靠语言往往不足以准确传达人类意图。很难描述在相似的候选对象中与哪个确切的对象进行交互、对对象执行什么操作,或者目标在执行过程中可能如何变化。为了解决这一限制,我们提出了 Gaze2Act,这是一种新颖的 VLA 框架,它利用人类凝视作为复杂交互操作的动态且直观的意图信号。 Gaze2Act 首先通过跨视图语义匹配将第一人称注视映射到机器人的视角,从而弥合自我与外在视图之间的差距,从而生成对象掩模和注视点,以实现从粗到细的目标规范。然后,通过感知级提示和行动级调节将这些线索整合到策略中,使机器人能够关注相关区域并在动态意图下执行精确的交互。在对 Unitree G1 人形机器人上的 7 个任务类别和 16 个真实机器人任务进行的系统评估中,Gaze2Act 在意图准确性和任务成功率方面均实现了最先进的性能。它在对象消歧、细粒度交互和动态意图引导方面明显优于基线。这些结果表明,人类凝视为人环 VLA 控制提供了一种自然、低负担且高度表达的方式。