论文

SkillJuror:度量智能体技能组织如何改变运行时行为

SkillJuror: Measuring How Agent Skill Organization Changes Runtime Behavior

智能体系统Agent任务评测Agent Skills

摘要

智能体技能在推理时通过程序知识增强大型语言模型 (LLM) 智能体,但当前的基准很少区分技能的内容和组织方式。我们通过渐进式披露来研究这种区别,其中一个简洁的根文件将代理指向按需支持的资源,并将其与标准化的平坦基线进行比较。我们提出了 SkillJuror,一个通过语义控制变体、匹配的多试验评估和轨迹证据来评估技能写作范式的框架,同时保持任务知识固定。在一项包含 82 项任务的 SkillsBench 研究中,渐进式披露在汇总结果之前改变了运行时行为:每个轨迹接触的不同技能资源从 1.18 上升到 3.85,有效吸收事件从 1.33 上升到 3.92。它还在标准化平坦基线上的 410 个匹配试验中产生了 17 个额外的验证者通过试验 (+4.1%)。好处取决于任务。当支持资源指导实施、检查或修复时,渐进式披露会有所帮助,但当成功取决于精确的输出约定、数字阈值或较长的工件生成管道时,渐进式披露会较弱。这些结果表明,技能组织不仅仅是呈现:它可以改变代理搜索和应用程序知识的方式,而结果增益取决于公开的资源是否可用于任务。代码可在 https://github.com/zhiyuchen-ai/skill-juror 获取。

SkillJuror:度量智能体技能组织如何改变运行时行为:论文配图
图 1:从纠缠的技能比较到受控的运行时证据。自然技能比较可以同时改变任务知识、工件组织和运行时行为,从而使结果差异难以归因。 SkillJuror 相反,构建知识匹配的变体,在匹配的运行时条件下改变组织,然后将验证者结果与成本、轨迹形状和资源占用的过程证据配对。