论文
SkillRet:LLM智能体技能检索的大规模基准
SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents
摘要
随着 LLM 代理越来越多地部署大型可重用技能库,为用户请求选择正确的技能已成为一项关键的系统挑战。在小型库中,用户可以通过名称明确地调用技能,但随着技能生态系统在紧张的上下文和延迟预算下增长,这种假设就会被打破。尽管具有实际重要性,但技能检索仍未得到充分探索,基准有限,而且对现实技能库上的检索行为知之甚少。为了弥补这一差距,我们引入了 SkillRet,这是 LLM 代理技能检索的大规模基准。 SkillRet 包含 17,810 项公共代理技能,采用结构化语义标签和跨越 6 个主要类别和 18 个子类别的两级分类法进行组织。它提供了 63,259 个训练样本和 4,997 个具有不相交技能池的评估查询,支持基准测试和面向检索的训练。在各种不同的检索器中,我们发现技能检索仍然远未解决:现成的模型在现实的大规模技能库上挣扎,而先前的技能检索模型仍然留有很大的空间。 SkillRet 上针对特定任务的微调显着提高了性能,与之前最强的检索器相比,NDCG@10 提高了 +13.1 点,与现成的最强检索器相比提高了 +16.9 点。我们的分析进一步表明,这些收益的出现是因为微调模型更好地关注长而嘈杂的查询中与技能相关的小信号。这些结果使 SkillRet 成为未来大规模代理系统检索研究的强大基准和基础。
