论文
关于代理工具调用和强化学习训练的有效性和效率
On Effectiveness and Efficiency of Agentic Tool-calling and RL Training
摘要
工具调用是现代 大语言模型 (LLM) 代理的核心组件,为它们配备了参数知识之外的技能。本文沿着两个互补的轴研究工具调用:有效性,即如何衡量这种能力,以及效率,即如何学习这种能力。在有效性方面,我们系统地分析了工具调用评估流程,并表明结果可能对看似次要的、通常未记录的实现选择高度敏感,包括随机种子、系统提示、多轮模板构建以及如何推进先前的交互/推理历史。这些选择可能会导致报告的性能存在巨大差异,尤其是在多轮设置中,如果没有严格的标准化,排行榜排名就不可靠。在效率方面,我们检查了工具调用的标准强化学习(RL),并确定了计算浪费的两个来源:(i)在轨迹采样期间,许多提示不会产生学习信号,(ii)在策略更新期间,优化会产生较高的计算成本。在这些发现的指导下,我们引入了两种加速基于强化学习的工具调用训练的技术,在不降低性能的情况下实现显着的挂钟加速。