论文

OntoPlan:基于本体场景的可扩展 Agentic 机器人规划

OntoPlan: An Ontology-Grounded Scene Representation and Agentic Framework for Scalable Robot Task Planning

智能体系统Agent 规划

摘要

基于大语言模型 (LLM) 的机器人任务规划对于开放式指令跟踪很有前景,但在大型环境中的长视野任务上却表现不佳。当空间信息通过文本传达给 LLM 时,模型可能无法捕获空间上下文,并且 token 成本随着环境大小而增加。直接使用 LLM 生成动作序列也很难满足当前的世界状态和动作前提条件。我们通过基于本体的场景表示来解决这个问题,该场景表示在共享符号词汇中对齐对象、空间、关系和状态,以进行空间推理和任务规划,并使用 OntoPlan(一个 Agentic 框架)来解释指令,有选择地检索任务相关信息,形式化目标和约束,并生成可执行计划。在涵盖 5 个室内环境和 3 个场景尺度的 150 个一般任务中,OntoPlan 实现了 0.89 的平均 任务成功率,而最强基线为 0.27,同时每个任务平均使用 18.1k 总计 token,比最有效的基线少约 5.6$\times$。随着场景规模的增加,这些优势仍然存在,而之前的方法在 token 中的成功率下降得更快,并且成本仍然更高。 OntoPlan 还通过提出后续问题或报告不充分的信息,对不明确或不可行的指示作出适当反应,而不是承诺无效的计划。代码可在 https://github.com/namhyeongwoo/OntoPlan. 获取

OntoPlan:基于本体场景的可扩展 Agentic 机器人规划:论文原图
图 1:OntoPlan 概述。根据用户指令,Flow Orchestrator 在专门的智能体中路由场景基础、澄清、任务形式化和规划,而场景查询和 PDDL 计划工具则在基于共享本体的世界模型上运行。