论文

当同意超出上下文时:长寿命Agent中的剩余权限重放

When Consent Outlives Context: Residual Authority Replay in Long-Lived Agents

模型评测智能体系统Agent Harness安全与风险评测

摘要

LLM Agent越来越依赖用户批准来授权运行时的安全敏感操作。此类批准是在特定任务和执行上下文中授予的。在长期Agent中,授权决策可能需要在任务或会话中持续存在。我们发现,这种连续性可以比最初证明批准合理的上下文更长久,从而创建无需重新同意即可重复使用的剩余权限。我们通过纵向攻击暴露这种故障模式,该攻击从目标安全敏感操作开始,识别执行该操作所需的权限,引发合法获得该权限的良性交互,然后在对抗性执行期间重放剩余权限。在受控和实时环境中,我们证明了残余权限重放在实践中出现,并大大提高了提示注入和上下文重新绑定攻击的成功率。我们使用生产衍生的授权语义评估了六个 LLM 系列的 508 个 AgentDojo 攻击案例。剩余授权状态下,攻击成功率(ASR)较新授权状态提升高达35.1个百分点。在对三个现实生产编码Agent的 55 个 Terminal-Bench 案例进行的实时上下文重新绑定攻击中,剩余权限重放使 ASR 平均提高了 24.9 个百分点。这些发现揭示了长期 LLM Agent中持久授权与用户同意的上下文性质之间的根本不匹配。