论文

事件驱动的主动机器人帮助

Event-Driven Proactive Robot Assistance through Vision-Language Reasoning

智能体系统Agent 架构与控制循环

摘要

协作操作的协助通常由用户指令发起,从而使高级推理由请求驱动。然而,在流畅的人类团队合作中,合作伙伴通常会根据观察到的行动结果来推断下一个有用的步骤,而不是等待指示。受此启发,我们研究了一种事件驱动的主动协助公式,其中人与物体的交互结果启动辅助推理,而无需用户在推理时提供任务规范。为此,我们提出了一个事件驱动的框架,该框架使用事件监视器监视工作区状态变化,并在事件完成后提取表征结果状态转换的稳定的前/后快照。然后,冻结的预训练视觉语言模型 (VLM) 使用其语义先验来推断任务上下文,决定辅助是否合适,并在需要时根据观察到的转换生成一系列辅助操作。为了使输出可执行和可验证,我们将操作限制为一组操作原语并通过整数 ID 引用对象。我们在三个不同的现实世界桌面协作任务中评估相同的框架,而无需特定于任务的训练或微调。事件驱动框架的性能可与给定用户指令的变体相媲美。

事件驱动的主动机器人帮助:论文原图
图 2:系统概览。人为引起的工作空间转换会触发事件处理,从而生成前/后证据和 ID 地图册。如果没有明确的用户请求,VLM 会提前停止对该事件有效负载进行推理,以最终确定符号计划,该计划在更新工作空间基线之前进行几何基础、执行和验证。