论文
Agent权转变揭示了多轮大语言模型Agent中新出现的安全风险
Representation Transitions Reveal Emerging Safety Risks in Multi-Turn LLM Agents
摘要
对 Agentic 系统的多轮攻击可以将单独允许的行为组合成有害结果,从而挑战孤立评估行为或状态的防御。我们表明,此类攻击在Agent的内部表示中留下了可检测的签名:有害行为随着上下文更新之间累积的表示转换而出现,其触发上下文可以从相同的信号中识别出来。我们进一步发现,幼稚聚合被良性表示漂移所混淆,因为对比安全方向不需要为良性转换分配零。我们通过对方向进行去噪、将良性流量锚定为零并消除其主要变化方向来解决这个问题,而无需运行时成本。这些发现激发了 DART 的发展,DART 是一个运行时框架,可以检测并归因表示变化并通过有针对性的提醒进行干预。在六个模型和两个多轮基准测试中,DART 将 MT-AgentRisk 上的攻击成功率从 84% 降低到 25%,以平均 12% 的误报率捕获每次攻击,在 ASEval 上将攻击成功率从 97% 降低到 52%,而良性不拒绝成本分别为 8% 和 0%。在 MT-AgentRisk 上,它在所有六个模型上都优于最先进的多回合防御 ToolShield:在相同协议下,ToolShield 仅达到 55%。去噪至关重要:在 ASEval 上,未去噪的监视器仅捕获 7%-40% 的攻击,而去噪的监视器捕获 60%-85%。相同的监控器无需修改即可覆盖单轮间接注入,并且每个监控步骤仅增加 0.14-0.56 秒的开销,而无需辅助模型,使其成为计算量大的投机防御的轻量级补充。