论文

技能使用:LLM实际上可以在Agent Harness中使用技能吗?

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

智能体系统Agent任务评测

摘要

大语言模型 (LLM) 代理越来越依赖技能和结构化文档,这些文档指定何时采取行动、遵循哪些程序以及允许使用哪些工具。现有的评估主要判断技能的质量或其对任务成功的贡献,而没有检查智能体是否能够识别相关技能并自行应用。我们引入了技能使用,这是一种在渐进式披露下评估技能使用的基准,其中代理只能看到技能的名称和简短描述,并且必须在遵循之前检索完整的程序。技能使用将技能使用分为三个方面。触发衡量智能体是否调用了相关技能,合规性衡量智能体遵循规定程序的程度,边界衡量智能体是否避免禁止操作。技能使用 (SU) 分数将三者结合起来,只有在技能触发后才执行学分。技能使用将 79 项真实技能与跨 9 个领域的 177 项可执行任务配对,每个任务都基于真实文件,在隔离的 Docker 沙箱中运行,并按基于轨迹的评分标准进行评分。通过评估两个Agent Harness下的 8 个 LLM,我们发现可靠的技能使用仍然遥不可及,因为最强的配置达到的 SU 仅 0.613。触发和程序合规性作为独立的瓶颈而失败,并且分数和模型排名都随着工具的变化而变化,因此技能的使用表现为以工具为条件的能力,而不是模型的固定属性。