论文

STEP:利用多模态 LLM 实现人机协作的状态感知任务估计和规划

STEP: State-Aware Task Estimation and Planning with Multi-Modal LLMs for Human-Robot Collaboration

智能体系统Agent 规划

摘要

工业环境中有效的人机协作需要机器人理解人类意图并协助任务规划,减少工作量。最近的工作探索了在此类数据稀缺场景中使用多模态 大语言模型 (MM-LLM) 进行任务规划,利用上下文学习来解释用户操作并以自然语言生成长期行动计划。然而,MM-LLM 本质上缺乏对系统状态的理解,并且不跟踪状态转换,常常导致偏离预期目标的幻觉行为。此外,以自然语言生成行动计划往往会将生成的计划限制在较高的水平,从而在行动执行中引入歧义。为了解决这些限制,我们提出了状态感知任务估计器和规划器(STEP),它提示 MM-LLM 显式估计系统状态并预测执行操作导致的状态转换。通过预测未来状态和行动,STEP 确保任务聚合规划,同时还提供执行预测行动所需的额外辅助参数。我们使用机器人装配任务在模拟环境中评估 STEP。我们的方法在动作可执行性方面比最先进的方法高出 32.8%,在最终状态错误方面比最先进的方法高出 14.8%。