LLM 代理应该看到多少种工具?机会修正的答案
How Many Tools Should an LLM Agent See? A Chance-Corrected Answer
摘要
在 LLM 代理可以使用工具之前,检索系统必须决定向代理显示哪些候选工具。入围名单应该有多长?显示太多工具,模型难以选择。显示太少,可能不会出现正确的工具。大多数系统对每个查询应用固定的候选名单大小,但不存在标准指标来评估该大小是否合适。我们将向 LLM 代理显示的工具数量视为评估对象,并应用 Bits-over-Random (BoR),这是一种机会校正指标,询问在给定深度上的成功是否优于随机选择在相同深度上实现的效果。我们通过三个工具选择基准、多个评分器和 20 到 3,251 个工具的注册表来评估 BoR。然后,我们将相同的原理转化为强化学习(RL)奖励,用于选择每个查询的工具入围深度。强化学习代理故意很简单,充当指标的探针而不是提议的系统。随着入围名单的增加,包含正确工具的随机机会也会增加,因此奖励自然会减少,从而减少了工程深度惩罚的需要。在 BFCL(370 个工具)上,学习策略几乎与显示 50 个工具的覆盖范围相匹配($90.3\%$ vs $90.8\%$),而平均仅显示 7 个工具。在 ToolBench(3,251 个工具)上,5 个工具的固定候选列表实现了更高的聚合覆盖率($64.7\%$ vs $61.9\%$),但在硬查询上找不到任何内容(正确的工具排名第 6-20 位)。 BoR 代理通过更深入的搜索在这些相同的查询中找到了 $16.7\%$。 Claude Sonnet 4.6 的下游验证表明,较短的自适应列表还提高了 LLM 选择正确工具的能力:当始终显示 5 个工具时,$93.1\%$ 与 $87.1\%$ 相比,在中等难度的查询上扩大到 $76.8\%$ 与 $60.9\%$(其中存在正确的工具但未排名第一)。