论文

正确的家庭,错误的技能:评估座席技能检索中的风险暴露

Right Family, Wrong Skill: Evaluating Risk Exposure in Agent Skill Retrieval

模型评测基准与评测资源

摘要

代理技能库正在成为可路由的软件资产:检索到的技能可以向代理提供指令、脚本、资源绑定和执行假设。这使得检索失败比广泛的无关性更加具体。系统可以找到正确的功能族,但会暴露错误的相同功能代表。我们将这种失败作为相同能力的风险暴露检索来研究。每个基准测试单元将有用的技能与特定于查询的有风险的同级技能配对,这些技能共享功能系列,但在执行控制合同上有所不同,例如所需的资源、前提条件、过程或工件。我们引入了 SameCapRisk-Bench,这是一个可审计的基准,包含 1,190 个技能风险单元和 1,686 个评估查询案例:公共图书馆压力下的 694 个标记兄弟单元和 496 个硬角色翻转单元,其中相同的两个技能在配对查询中交换有用/风险角色。该版本记录了录取证据、线索/泄漏检查、源哈希、家庭关系和固定候选人池。该基准报告了有用排名以及有害兄弟比率 (HSR@K),即标记有风险兄弟的前 K 暴露。在此基准测试中,公共 SkillRouter、SkillRet 和 R3-Skill 检索高 Recall@3 (0.848--0.888) 的有用技能,但也经常暴露标记有风险的同级技能 (HSR@3 0.346--0.372)。完全公开的评分和聚类管道将 HSR@3 降低至 0.128--0.182,Recall@3 为 0.713--0.776。在经过基准训练的参考评分器下,公共文本集群和受控解析器达到 HSR@3 0.012 和 0.007;后者的 Recall@3 达到 0.833。因此,技能检索应报告能力匹配和同族风险暴露,并以 HSR 作为固定技能库的目标暴露证书。