论文

工具检索器被低估:注释扩展揭示了真正的能力

Tool Retrievers Are Underestimated: Annotation Expansion Reveals True Capability

模型评测基准与评测资源

摘要

在具有大量且不断发展的工具存储库的开放世界场景中,工具增强型 大语言模型 依赖于 检索器 来显示给定查询的相关工具。由于此类存储库通常包含许多实现相同功能的工具,因此单个查询通常可以通过几个不同但功能等效的工具组合来解决,从而使查询到工具的自然映射本质上是一对多。然而,现有的工具检索基准使用单个相关工具组合来注释每个查询,将这种一对多映射折叠为严格的一对一注释,并导致有效的检索工具被误判为失败。为了解决这个问题,我们提出了 ToolEX(Tool Equivalent eXpansion),这是一个框架,可以自动发现和注释功能上与标记的工具组合等效的工具组合。应用于 7,360 个查询 Tool-DE 基准测试后,ToolEX 发现 67.9% 的子查询接受等效替代项,将单个 真值 扩展到每个查询平均 5.3 个有效组合。使用扩展的基准 ToolEQ,我们重新评估了八个基本 检索器 和两个微调变体; ToolEQ 上的指标比 Tool-DE 大幅上升,表明一对一注释系统地低估了 检索器,并且报告的 微调 增益的 30--47% 是评估工件而不是真正的改进。将相同的管道应用于 SkillRet 上的技能检索进一步证实了一对一问题超出了工具检索的范围。