论文

LLM Agent会执行他们声明的计划吗?从计划模式声明到特定模式执行

Do LLM Agents Execute the Plans They Declare? From Planning-Mode Declaration to Pattern-Specific Execution

智能体系统Agent 动作执行与治理

摘要

大语言模型 (LLM) 使Agent能够通过生成计划然后在环境中执行来解决长期任务。然而,成功的规划需要两种不同的能力:为任务选择适当的计划并忠实地执行它。现有的规划器-执行器系统可能在任一阶段失败,而仅最终任务成功无法区分选择与执行失败。因此,我们研究计划声明-执行差距并引入规划即路由,其中​​大语言模型声明四种计划模式之一:预定义、顺序、分层或搜索,并且确定性路由器将任务分派给相应的特定于模式的执行器。在四个基准和三个大语言模型中,我们发现了三个一致的模式。首先,通用 Plan+ReAct 通常无法保留声明的计划结构,尤其是对于较长的计划:在三个基准中,只有 (22)--(45%) 的轨迹保留它,而特定于模式的执行器则强制执行预期的结构。其次,规划模式的有效性因环境和模型的不同而异:搜索在 ALFWorld 上表现最佳,分层搜索在 SWE-bench 上表现最佳,而最强的模式可能会因同一基准中的模型而异。第三,最大的收益来自于执行:与 Plan+ReAct 相比,特定于模式的执行器将 ALFWorld 上的任务成功率从 (0.48) 提高到 (0.92),将 SWE-bench Verified 上的任务成功率从 (0.36) 提高到 (0.44)。然而,当前的大语言模型并不能可靠地为每个任务选择最强的模式,尽管少数样本示例改进了某些基准模型组合的选择。总体而言,可靠的Agent规划需要有效的模式选择和忠实的执行:路由实质上缩小了执行差距,而特定于任务的模式选择仍然开放。