论文

LLM-Flax:使用 大语言模型 通过神经符号方法进行通用机器人任务规划

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

智能体系统Agent 规划

摘要

如今,在新领域部署神经符号任务规划器需要大量的手动工作:领域专家必须编写松弛和补充规则,并且必须解决数百个训练问题以监督图神经网络 (GNN) 对象评分器。我们提出了 LLM-Flax,这是一个三阶段框架,使用本地托管的 LLM(仅给出 PDDL 域文件)消除了所有三个手动工作来源。第一阶段通过结构化提示以及格式验证和自我纠正自动生成放松和补充规则。第 2 阶段引入了 LLM 引导的故障恢复,并具有可行性门控预算策略,该策略在每次 LLM 调用之前明确保留 API 延迟成本,从而防止下游松弛回退陷入匮乏。第 3 阶段用零样本 LLM 对象重要性评分完全取代了领域训练的 GNN,不需要训练数据。我们在 10x10、12x12 和 15x15 网格的 MazeNamo 基准上评估所有三个阶段(总共 8 个基准)。 LLM-Flax 的平均 SR 为 0.945,而手动基线为 0.828 (+0.117),在八个基准测试中的每一项上都匹配或优于手动规则。在 12x12 Expert 上,LLM-Flax 达到 SR 0.733,而手动规划器完全失败 (SR 0.000);在 15x15 Hard 上,它的 SR 为 1.000,而手动为 0.900。第 3 阶段展示了可行性(在没有训练数据的 12x12 Hard 上 SR 0.720),但面临着大规模的上下文窗口瓶颈,这表明了未来工作的主要开放挑战。