论文
事件驱动的主动机器人帮助
Event-Driven Proactive Robot Assistance through Vision-Language Reasoning
摘要
协作操作的协助通常由用户指令发起,从而使高级推理由请求驱动。然而,在流畅的人类团队合作中,合作伙伴通常会根据观察到的行动结果来推断下一个有用的步骤,而不是等待指示。受此启发,我们研究了一种事件驱动的主动协助公式,其中人与物体的交互结果启动辅助推理,而无需用户在推理时提供任务规范。为此,我们提出了一个事件驱动的框架,该框架使用事件监视器监视工作区状态变化,并在事件完成后提取表征结果状态转换的稳定的前/后快照。然后,冻结的预训练视觉语言模型 (VLM) 使用其语义先验来推断任务上下文,决定辅助是否合适,并在需要时根据观察到的转换生成一系列辅助操作。为了使输出可执行和可验证,我们将操作限制为一组操作原语并通过整数 ID 引用对象。我们在三个不同的现实世界桌面协作任务中评估相同的框架,而无需特定于任务的训练或微调。事件驱动框架的性能可与给定用户指令的变体相媲美。
