论文

SkillSeam:审核代理技能集合的六项原则

SkillSeam: Six Principles for Auditing Agent Skill Collections

模型评测评测方法与指标

摘要

主管技能的文件夹还不是一个可靠的系统。技能很少会单独失败;他们在系列的接缝处失败了。随着代理技能库的增长,程序会争夺注意力、别名双重加载、边界模糊以及技能规模不佳,从而导致路由错误变成任务失败。我们引入 SkillSeam,这是一种审核各个技能文件成为系统的关系的方法。它将每个集合级原理映射到故障机制、最强的可观察性和受控扰动测试。从一个密封的技能系统开始,SkillSeam 扰乱了六项设计原则:持久性梯度、系统一致性、机制门控、正交覆盖、流程和粒度规则。至关重要的是,每个原理都是通过其故障机制预测的渠道来评估的,而不是仅仅通过准确性来评估。扁平化持久性层次结构可将加载的技能词元增加 60%;悬空锚点使总词元增加了 64%,准确率降低了 -3.1pp;在技​​能计数和上下文大小保持固定的情况下,用同义别名替换不相关的控件会将非规范路线从 0/32 提高到 15/32,并翻转一半匹配的释义对;在候选所有权审计中,重叠车道将报告的所有权冲突从 0/16 提高到 14/16;平淡的触发器将路由冲突从 3/32 驱动到 30/32,并使加载的技能词元膨胀 3.7 倍;一种粒度的错误混合会产生最大的精度下降,-12.5pp。这些结果将六条创作建议转化为可测试的系统属性,而无需将每个探测都视为确认。我们发布了字节差异变体、任务切片、汇总和单屏设计清单,以便其他技能系统可以测量相同的故障通道。