论文
作为漏洞的相关性:Web 检索如何降低 LLM 代理中的安全一致性
Relevance as a Vulnerability: How Web Retrieval Degrades Safety Alignment in LLM Agents
摘要
AI 代理通过网络检索等外部工具增强了 大语言模型,从而实现可靠且最新的响应。然而,将外部内容合并到生成管道中可能会削弱控制模型输出的安全调整机制。先前的工作表明,在代理中启用检索可以提高对有害请求的合规性。我们引入了 AgentREVEAL,这是一个诊断框架,用于分析 LLM 代理中检索引起的安全性下降。该框架检查两个轴:检索如何集成到代理管道中以及检索内容的属性。沿着集成轴,我们发现在一个步骤中绑定工具调用和响应生成会放大有害输出。沿着内容轴,我们发现了安全来源悖论:即使是反对性或安全导向的来源,例如包含警告或风险免责声明的页面,与无检索基线相比,也可能使有害合规性平均增加 25%。最后,我们表明相关性充当这两个漏洞的共享激活条件。类似的模式也出现在边境封闭模型上,在几种代表性的管道干预措施下,有害的合规性仍然很高,一些智能体也在自主检索下进入了这一制度。由于相关性也是检索有用的因素,因此这些结果揭示了支持检索的代理的安全性与实用性之间的权衡。我们引入了 HarmURLBench,这是一个包含 1,405 个真实世界 URL 与 320 种有害行为配对的基准测试,以支持未来的评估。