论文
ToolSearcher:强化学习优化大规模工具搜索与组合
ToolSearcher: Optimizing Tool Selection at Scale via Reinforcement Learning
摘要
大型语言模型 (LLM) 擅长自然语言处理,但难以与外部环境交互。工具学习提供了一种将大语言模型扩展到可操作代理的有前途的方法,其中工具选择是成功使用工具的关键先决条件。现有的工作通常假设一小部分或预定义的工具,而大规模的工具选择尚未得到充分探索。现实世界的存储库包含大量多样的工具,这使得大语言模型很难在上下文长度限制下有效地搜索、区分和组合工具。我们将大规模工具选择视为Agentic 强化学习的新挑战,强调现有基于知识的问答的 RL 方法不足以在考虑兼容性的情况下选择工具。为了应对这一挑战,我们提出了 ToolSearcher,这是一种新颖的 RL 框架,用于在大规模工具选择中进行有效的多轮搜索和细粒度优化。具体来说,我们引入类别约束工具辨别来提高模型区分功能相似工具的能力,引入事件级搜索建模来显式优化多轮搜索过程中目标工具的发现,引入轨迹对齐信用分配来为搜索选择过程的不同阶段提供细粒度的奖励信号。对大规模工具选择基准的大量实验表明,在涉及迭代搜索和复杂工具组合的挑战性设置中,ToolSearcher 始终优于一组强大的基准。