论文
学习并复用策略分解:面向LLM智能体的分层广义规划
Learning and Reusing Policy Decompositions for Hierarchical Generalized Planning with LLM Agents
摘要
我们提出一种动态策略学习方法,结合广义规划与分层任务分解,面向基于LLM的智能体。我们的方法HCL-GP(Hierarchical Component Learning for Generalized Policies)学习跨任务实例泛化的参数化策略,并自动从成功执行中抽取可复用组件,把它们组织进组件库以支持组合式策略生成。我们解决三个挑战:(1) 经自动分解学习组件;(2) 泛化组件以最大化复用;(3) 经语义搜索的高效检索。在AppWorld基准上评估,本方法在普通任务达98.2%准确率、在含未见应用的挑战任务达97.8%,较静态合成在挑战场景提升15.8个百分点。对开源模型,动态复用带来62.5%的成功率,而无复用时接近零。这证明经典规划概念可有效与LLM智能体集成,提升准确率与效率。