论文

代理技能在野外的表现如何:在现实环境中对 LLM 技能使用进行基准测试

How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings

智能体系统Agent任务评测

摘要

代理技能是可重用的、特定领域的知识工件,已成为扩展基于 LLM 的代理的流行机制,但正式的技能使用性能基准测试仍然很少。现有的技能基准测试工作侧重于过于理想化的条件,其中 LLM 直接为每个任务提供手工制作的、狭隘定制的特定于任务的技能,而在许多现实设置中,LLM 代理可能必须自己搜索和选择相关技能,甚至最接近的匹配技能也可能无法很好地适合该任务。在本文中,我们在逐渐具有挑战性的现实环境中对技能效用进行了首次全面研究,其中智能体必须从大量 34k 现实世界技能中检索技能,并且可能无法访问任何手工策划的技能。我们的研究结果表明,技能的好处是脆弱的:随着设置变得更加现实,绩效收益不断下降,在最具挑战性的场景中,通过率接近无技能基线。为了缩小这一差距,我们研究了技能细化策略,包括特定于查询和与查询无关的方法,并且我们表明,当初始技能具有合理的相关性和质量时,特定于查询的细化可以基本上恢复损失的性能。我们进一步证明了 Terminal-Bench 2.0 上检索和细化的通用性,将 Claude Opus 4.6 的通过率从 57.7% 提高到 65.5%。我们的结果在多个模型中保持一致,突显了基于 LLM 的代理的技能前景和当前局限性。我们的代码可在 https://github.com/UCSB-NLP-Chang/Skill-Usage 获取。