论文

Agent Skills至关重要:从执行轨迹推断专有技能

Agent Skills Matter: Inferring Proprietary Skills from Execution Trajectories

模型评测智能体系统Agent Skills安全与风险评测

摘要

智能体技能(Agent skills)打包可复用流程,能提升下游性能。其轻量、可移植的形式使市场变现与云端托管智能体接口背后的私有部署成为可能,也让提供商有动机将高价值技能保持专有。然而隐藏工件并不能掩盖其行为效应,这些效应在执行轨迹中仍然可观察,构成一条行为侧信道。我们将这种暴露定义为技能泄漏(Skill Leakage):从由良性查询引发的轨迹中重建专有技能,且无需参考答案或成功标签。我们提出SigLeak,一个利用智能体行为中反复出现的技能签名的黑盒框架。它构建多样化、富含决策点的诊断任务,对比配对的启用技能与禁用技能轨迹,并从隔离出的模式中迭代精炼重建的技能。在五个场景、三个模型家族与三个智能体框架上,SigLeak在几乎所有设置中都优于或持平三个基线。相比禁用技能的参照,它平均将成功率提高6.88个百分点,并取得整体最高的SkillSim——我们用于粗粒度与细粒度语义相似度的度量。这些结果表明,良性的执行轨迹可能暴露专有程序性知识。代码见 https://anonymous.4open.science/r/SigLeak-D1DB。

Agent Skills至关重要:从执行轨迹推断专有技能:论文配图
图 1:技能泄漏概述。专有技能可能会在执行轨迹中留下行为特征,对手可以利用这些特征来推断程序知识,而无需访问技能工件。