论文

AgentBoundary:工具使用 LLM Agent安全性的反事实评估

AgentBoundary: Counterfactual Evaluation of Safety in Tool-Using LLM Agents

模型评测安全与风险评测

摘要

对话环境中大语言模型 (LLM) 的安全性很大程度上取决于是否回答或拒绝请求。然而,在 agentic 设置中,这些模型必须在执行过程中出现权限关键证据时决定是否采取行动。这就带来了一个明显的挑战:明显的风险、行动的允许性和任务能力很容易混淆,使得 agentic 的过度拒绝很难与普通的任务失败区分开来。为了解决这个问题,我们引入了 AgentBound,这是第一个用于工具使用Agent安全的四向反事实生成和评估框架。 AgentBound 通过独立改变明显风险和操作允许性来转换相同的可执行工作流程,从而能够对看似有风险但已授权的任务与看似常规但未经授权的任务进行受控比较。这些比较共同诊断过度拒绝和不安全的服从,同时控制任务能力。我们将 AgentBound 实例化为经过人工验证的 4,000 项任务评估套件,具有基于轨迹和基于后状态的判断。在 17 种模型和Harness配置中,高安全性经常与较差的授权任务完成度并存:GPT-5.5 阻止了 99.5% 的看似常规的未经授权的操作,但仅完成了 28.7% 看似有风险的授权任务。我们进一步训练了一个轻量级运行时校准模块,该模块在 10 个评估配置中将授权任务完成率平均提高了 18.2%,同时将不安全操作阻止平均提高了 5.4%。这些表明有效的 agentic 对齐需要行动决策来跟踪与权限相关的执行证据,而不仅仅是拒绝强度。