论文

谈LLM规划时我们在谈什么:两种独立规划能力的证据

What We Talk About When We Talk About LLM Planning: Evidence for Two Distinct Planning Abilities

模型评测模型能力评测

摘要

当LLM在规划任务上表现不均时,这些差距常被归因于任务难度。我们论证该解释不完整:任务级差异可能反映不同的潜在规划胜任力,而非单一能力谱上的差异。我们在ACPBench-Hard上研究该问题:在变化测试时推理预算下评估多个LLM家族,并应用多维项目反应理论模型揭示LLM规划之下的潜在胜任力结构。分析揭示塑造规划表现的两种主维度:操作性推理——评估局部动作适用性与即时状态转移的能力;结构性枚举——关于目标可达性与地标结构推理的能力。操作性推理随模型扩展与更长推理轨迹改善,而结构性枚举相对不敏感。发现推动LLM规划的胜任力级评估:把焦点从模型是否整体提升,转向哪些规划胜任力在何种条件下为何改善。

谈LLM规划时我们在谈什么:两种独立规划能力的证据:论文配图
图 1:评估设计。左:ACPBench(硬)的八个规划任务(行动、状态和计划级别)。右图:三个推理条件:直接回答、具有线性推理轨迹的 CoT 和暂存器工具,用于探测潜在规划能力如何响应不同的提示和测试时计算脚手架。