论文

面向工具增广LLM的能力对齐分层学习

Capability-Aligned Hierarchical Learning for Tool-Augmented LLMs

模型训练强化学习RLVR

摘要

工具学习使LLM能调用外部工具完成任务。先前研究已证明分层结构的有效性:高层策略处理全局规划并把任务分解为可管理的子任务——低层策略聚焦调用工具解决这些子任务。但这些工作通常分别优化高层与低层策略——导致规划者-执行者失配——限制LLM在工具使用任务上的性能。本文提出能力对齐分层学习(CAHL)——利用RLVR联合优化两个策略——使高层规划者与低层执行者更好对齐。在受限工具使用基准(API-Bank与BFCL)与开放式环境(Bamboogle)上的实验证明了CAHL的有效性。

面向工具增广LLM的能力对齐分层学习:论文配图
图 1:高层规划与低层执行之间的不一致。规划器可能会生成逻辑上合理但低级执行器难以使用可用工具模式实现的子任务,而执行器可能无法与规划器的潜在意图保持一致。