论文
MATCH:具有课程安排和分级控制奖励的模型感知工具学习
MATCH: Model-Aware Tool Learning with Curriculum Scheduling and Hierarchically Gated Rewards
摘要
工具学习使大型语言模型 (LLM) 能够使用外部工具来完成参数知识之外的任务。强化学习可以根据反馈优化工具调用行为,但当前的方法仍然面临两个问题:固定阈值课程可能与策略不断发展的能力边界不一致,而当预测工具错误时,附加奖励可能会泄漏论证级信用。为了解决这些问题,我们提出了 MATCH,这是一种用于模型感知工具学习的闭环框架,具有课程安排和分层门控奖励。模型感知课程学习 (MACL) 维护与策略共同演化的奖励衍生样本难度,每个时期都会选择当前能力边界附近的样本以及 top-k 的更难案例池。分层工具调用门控奖励 (HTGR) 将工具名称、参数键和参数值评分为门控链,仅在满足先决条件时才在每个级别授予信用。相同的 HTGR 奖励驱动 GRPO 更新和 MACL 难度刷新,从而关闭策略优化和样本调度之间的循环。在 API-Bank 和 BFCL V3 上,MATCH 的总体准确率达到 72.19% 和 62.87%,优于主要的监督基线和基于 RL 的基线。主干实验进一步显示了两个模型系列的四个主干的一致改进。