论文

技能覆盖:面向智能体技能的测试充分性度量

Skill Coverage: A Test Adequacy Metric for Agent Skills

模型评测智能体系统Agent Skills评测方法与指标

摘要

代理技能为大型语言模型(LLM)代理编码可重用的程序知识,现有基准表明此类技能可以提高任务级性能。然而,任务结果并不能揭示可重用技能的哪些部分被运用,也不能揭示代理在运用这些部分时是否遵循相关技能指令。这种差距使得我们不清楚一项技能是否经过充分测试,或者观察到的任务失败是否为提高代理技能有效性提供了可操作的证据。为了填补这一空白,我们引入了技能覆盖率,这是一种基于轨迹的可重用代理技能的测试充分性指标。我们的框架从每个技能中提取技能行为约束,将自然语言技能指令转换为半结构化约束,指定特定条件下的预期代理行为。然后,它确定每个约束是否被代理轨迹覆盖,并且对于覆盖的约束,根据代理行为分配通过或失败判决。我们将此框架应用到 SkillsBench 中。结果表明,基准排行榜上的智能体轨迹平均仅覆盖了提取的技能行为约束的 38.66% 到 45.51%。然后,我们仅通过强调代理未能遵循的原始指令,使用失败判决来强化相应的技能内容,并使用强化后的技能运行相同的任务。这种强调使五个代理模型行的失败任务平均恢复率为 16.0%。这些结果表明,技能覆盖率既是测试充分性指标,也是观察技能使用行为的细粒度信号。在失败的任务中,失败的约束标签为提高代理技能有效性提供了可操作的证据。本文附有一个项目网站。