论文
STARS:面向智能体系统中请求条件化调用安全的技能触发审计
STARS: Skill-Triggered Audit for Request-Conditioned Invocation Safety in Agent Systems
摘要
自主语言模型智能体越来越依赖可安装的技能和工具来完成用户任务。静态技能审计可以在部署前暴露能力面,但无法判断某次具体调用在当前用户请求与运行时上下文下是否不安全。因此,我们将技能调用审计研究为一个连续风险估计问题:给定用户请求、候选技能和运行时上下文,预测一个分数,在实施硬性干预之前支持排序与分诊。我们提出STARS,它结合了静态能力先验、请求条件化的调用风险模型和经校准的风险融合策略。为评估该设定,我们构建了SIA-Bench,一个包含3,000条调用记录的基准,带有组安全的划分、谱系元数据、运行时上下文、规范化动作标签以及导出的连续风险目标。在间接提示注入攻击的留出划分上,校准融合达到0.439的高风险AUPRC,优于上下文评分器的0.405和最强静态基线的0.380,而上下文评分器的校准性仍更好,期望校准误差为0.289。在锁定的分布内测试划分上,增益更小,静态先验仍然有用。因此,由此得出的结论更为有限:请求条件化审计最有价值的定位是调用时的风险评分与分诊层,而非静态筛查的替代品。代码见 https://github.com/123zgj123/STARS。
