论文
护栏作为替罪羊:审计工具增强 LLM 代理中不忠实的安全拒绝
Guardrails as Scapegoats: Auditing Unfaithful Safety Refusals in Tool-Augmented LLM Agents
摘要
工具增强型 LLM 代理的评估框架主要关注能力指标或显式工具崩溃,导致无声的基础设施故障和带有空、空或格式错误的有效负载的 HTTP 200 响应基本上未经审核。我们引入了一个轻量级的黑盒审计框架,该框架在 12 个与生产相邻的工具存根中注入四个静默故障配置文件,并将代理响应分为三个互斥的行为类别:诚实投降 (HSR)、制造 (FAR) 和不忠实安全拒绝 (USR)。在中性系统提示下评估零温度下的两个前沿模型和两个开源模型,我们发现 FAR 占主导地位(有效响应的 56.6%):代理将空有效负载视为真实数据,默默地返回捏造的结果。 USR(其中代理发明了一项政策或隐私理由来解释失败)在基线上几乎不存在(0.25%,396 个有效轨迹中的一个实例)。我们的主要发现来自于消融,我们使用标准安全语言(“优先考虑用户隐私和数据安全”)来增强系统提示,这将 USR 放大了 15.6 倍(从 0.25% 到 3.95%;消融率的 95% CI:2.2%-6.4%;Fisher 精确检验,p < 0.001)。 USR 是一种潜在行为,当系统提示中的安全词汇促使模型在工具无声无息地失败时寻找政策理由时,USR 就会被激活。敏感工具(fetch_medical_record、retrieve_contract、fetch_user_profile)占 USR 实例的大部分。我们提出了一种用于生产级检测的有效负载响应错位启发式方法,并讨论了安全前向部署的治理影响。