论文

EvoPlan:具有时空保证的进化神经符号机器人规划

EvoPlan: Evolutionary Neuro-Symbolic Robot Planning with Spatio-Temporal Guarantees

智能体系统Agent 规划

摘要

基于 LLM 的机器人规划器很流畅,但不能保证其计划可执行或安全。经典的 PDDL 规划器可以保证这些属性,但只有在问题完全指定之后才能保证,并且它们很少利用 LLM 读取上下文和修复计划的能力。本文提出了一个由三部分组成的神经符号框架。所有 LLM 调用都使用本地托管的开放权重模型,因此管道可以部署在机器人上,而不依赖于云。首先,离线程序从演示数据中挖掘对移动性的单个全局信号时间逻辑(STL)约束。该程序根据演示编码的内容恢复编码规则(例如,红灯停车,从 nuPlan 驾驶日志中挖掘)或人群偏好(例如,社交导航舒适度,从 SCAND 远程操作中挖掘)。由于演示是一类信号,因此我们通过反事实扰动和 LLM 违规生成器生成缺失的负例,然后通过进化搜索来拟合约束。我们使用挖掘的约束来屏蔽 Bench2Drive 上的视觉语言驱动策略和 HA-VLN-CE 上的两个离散操作导航策略。其次,进化的 PDDL 规划器:LLM 提出并修复计划,编程验证器决定哪些计划可以生存,计划的已验证部分会随着迭代而增长。我们在开放世界的 ALFWorld Text 基准测试中测试了规划器,它击败了强大的基线,并在目标词汇与动作模型词汇不匹配时保持稳健。第三,受约束的执行循环:规划器的计划被编译为路点,根据挖掘的约束检查路点,并且规划器针对违规情况重新规划。我们通过使用 Gazebo 模拟器进行演示来说明完整的流程。