论文
具有扎根视觉语言规划的事件驱动主动辅助操作
Event-Driven Proactive Assistive Manipulation with Grounded Vision-Language Planning
摘要
协作操作的协助通常由用户指令发起,从而使高级推理由请求驱动。然而,在流畅的人类团队合作中,合作伙伴通常会根据观察到的行动结果来推断下一个有用的步骤,而不是等待指示。受此启发,我们引入了从请求驱动的协助到事件驱动的主动协助的转变,其中机器人动作是由人与物体交互引起的工作空间状态转换发起的,而不是用户提供的任务指令。为此,我们提出了一个事件驱动的框架,该框架跟踪与事件监视器的交互进度,并在事件完成后提取表征结果状态转换的稳定的前/后快照。给定稳定的快照,规划器分析隐含的状态转换以推断任务级目标并决定是否进行干预;如果是这样,它会生成一系列辅助操作。为了使输出可执行且可验证,我们将操作限制为一组操作原语并通过整数 ID 引用对象。我们在真实的桌面数字块协作任务上评估该框架,证明明确的前/后状态更改证据可以改善可解决场景的主动完成以及对不可解决场景的适当等待。