论文

GAVEL:以图世界模型验证和修复长程机器人任务规划

GAVEL: Graph World Models for Verified and Efficient Long-Horizon LLM Task Planning

智能体系统Agent 规划

摘要

大型语言模型(LLM)为长范围机器人规划提供了灵活的接口,但生成的规划通常无法遵守实施例约束、从规划错误中恢复或在部分可观察性下有效推理。我们提出了 GAVEL,一个用于验证和修复围绕显式图世界模型构建的长期 LLM 规划的框架。该图表示相关的对象关系、动作前提条件和效果,以及对未观察到的对象位置的概率信念。该模型可以在执行之前预测 LLM 生成的操作的后果,检测违规行为并修复那些直接根据世界模型进行更正的操作。此方法还保留仅针对需要语义推理的错误的 LLM 重新规划。对于多任务指令,GAVEL 对可能的对象位置的分布进行推理,以重新排序剩余的子任务并最小化预期搜索成本。我们在 BEHAVIOR-1K 上通过 100 个单长期任务和 500 个多任务指令来评估 GAVEL。借助 Qwen3-8B,GAVEL 将单任务成功率从 41.2% 提高到 91.8%,将多任务成功率从 19.9% 提高到 92.6%。与静态变量相比,分布信念推理还将行进距离缩短了约 5.4%。这些改进表明,显式图世界模型利用可以显着提高跨紧凑和前沿托管大语言模型能力的长期具体规划的可靠性和效率。