论文
工具:将 LLM 代理扩展到数千种技能和工具
Toollery: Scaling LLM Agents to Thousands of Skills and Tools
摘要
由于 LLM 代理需要接触数百到数万种技能、工具和 API 函数,全库提示变得成本高昂、缓慢且不太可靠:每个添加的候选者都会增加提示标记和延迟,而较长的候选者列表会给 LLM 选择带来更多干扰。我们提出 \textbf{Toollery},一个无需训练的候选人压缩框架,用于可扩展的 LLM 技能/工具选择。在建立文档端查询扩展之后,Toollery 根据每个技能/工具规范生成用户意图查询,并构建一个检索索引,在最终 LLM 决策之前将真实用户请求映射到紧凑的候选集。通过将高级技能和原子工具视为可选功能,Toollery 可以应用于技能库和工具注册表。我们根据大约 79K 功能的 SkillRouter 基准、具有超过 440 个原子工具的 BFCL-V4 以及超过 220 个工具的 3,396 个专有智能驾驶舱请求来评估 Toollery。在这些设置中,Toollery 将在线选择限制在紧凑的 top-$k$ 候选集中,并比普通规范检索提高了召回率。在固定的前 10 名预算下,Toollery 改进了驾驶舱数据集上的端到端选择,并在 BFCL-V4 上保持了相当的 AST 准确性。这些结果支持 Toollery 作为大型且不断发展的代理能力库的实用候选压缩框架,同时表明质量和成本收益取决于工作负载覆盖范围和提供程序缓存。