论文
SkillConsist:通过双向图对齐检测代理技能的不一致
SkillConsist: Detecting Inconsistencies in Agent Skills via Bidirectional Graph Alignment
摘要
座席技能为 LLM 座席提供可重用的功能。智能体技能不一致可能会暴露未公开的危险行为或导致错误的技能选择。最近的代理技能研究越来越多地研究代理技能一致性检测。现有方法根据预定义类别或声明的范围评估行为或安全属性图。最近,PL-HCL 使用基于 LLM 的模型来学习元数据、指令和资源之间的一致性。然而,声明和实现行为可以在文本和代码中混合,并且简洁的声明可以对应于多个连接的实现步骤。我们推出 SkillConsist 来应对这两个挑战。 LLM将声明和实现内容分离为实现侧和声明侧的行为记录,静态分析补充实现记录。这些记录分别形成声明和实现行为图。从任一侧的行为记录开始,双向图对齐在另一图中搜索候选子图,并沿着行为关系扩展它,直到完全表达源端行为。图差分识别对齐子图之间的冲突并输出检测结果。我们根据 ClawHub 的 500 个下载次数最多的公共技能和 133 个技能注入包构建了 633 个技能基准。该基准包含 319 个不一致的技能和 314 个一致的技能以及 442 个局部不一致注释。在此基准测试中,SkillConsist 的包级检测精度为 86.85%,召回率为 89.03%,F1 为 87.93%,与最佳基准相比 F1 提高了 20.43 个百分点。对于本地化,它实现了 67.60% 的准确率、58.14% 的召回率和 62.52% 的 F1。