论文

SkillRet:LLM智能体技能检索的大规模基准

SkillRet: A Large-Scale Benchmark for Skill Retrieval in LLM Agents

模型评测智能体系统Agent Skills基准与评测资源

摘要

随着 LLM 代理越来越多地部署大型可重用技能库,为用户请求选择正确的技能已成为一项关键的系统挑战。在小型库中,用户可以通过名称明确地调用技能,但随着技能生态系统在紧张的上下文和延迟预算下增长,这种假设就会被打破。尽管具有实际重要性,但技能检索仍未得到充分探索,基准有限,而且对现实技能库上的检索行为知之甚少。为了弥补这一差距,我们引入了 SkillRet,这是 LLM 代理技能检索的大规模基准。 SkillRet 包含 17,810 项公共代理技能,采用结构化语义标签和跨越 6 个主要类别和 18 个子类别的两级分类法进行组织。它提供了 63,259 个训练样本和 4,997 个具有不相交技能池的评估查询,支持基准测试和面向检索的训练。在各种不同的检索器中,我们发现技能检索仍然远未解决:现成的模型在现实的大规模技能库上挣扎,而先前的技能检索模型仍然留有很大的空间。 SkillRet 上针对特定任务的微调显着提高了性能,与之前最强的检索器相比,NDCG@10 提高了 +13.1 点,与现成的最强检索器相比提高了 +16.9 点。我们的分析进一步表明,这些收益的出现是因为微调模型更好地关注长而嘈杂的查询中与技能相关的小信号。这些结果使 SkillRet 成为未来大规模代理系统检索研究的强大基准和基础。

SkillRet:LLM智能体技能检索的大规模基准
图 1:SkillRet 数据生成管道概述。从 165 个种子查询和 17,810 个策划的代理技能开始,我们使用反频率加权对技能进行采样,并提示大语言模型合成自然需要所选功能的实际用户消息。训练查询是使用 Qwen3.5-122B-A10B 生成的,而评估查询是使用 Claude Opus 4.6 生成的。然后,生成的查询通过自动过滤、基于 LLM 的审核和人类专家验证,产生包含 63,259 个查询和 4,997 个评估查询的训练池。