论文
我们对 LLM 搜索代理的信任程度如何?衡量网络内容操纵的认可漏洞
How Much Can We Trust LLM Search Agents? Measuring Endorsement Vulnerability to Web Content Manipulation
摘要
基于 大语言模型 (LLM) 的搜索代理代表用户将开放网络内容合成为可操作的建议,从而产生攻击者发布的页面被转换为认可声明的风险。我们引入了 SearchGEO,这是一种受控评估框架,用于测量基于 LLM 的网络搜索代理中的背书损坏,结合了网络证据操纵管道、五模式攻击分类法和多个输出级别指标。我们评估了 13 个 LLM 后端,每个后端有 308 个案例。结果显示,不同后端的漏洞模式有所不同:总体攻击成功率 (ASR) 范围从 Claude-Sonnet-4.6 上的 0.0% 到 Gemini-3-Flash 上的 31.4%,最强的攻击模式因模型系列而异,并且相同的部署支架可能会放大或降低不同后端上的 ASR。辅助代理技能探测(其中认可成为安装命令)暴露了原本强大的后端之间的尖锐分歧:Claude 过度拒绝,而 GPT 过度信任。这些发现主张将对抗性搜索内容下的推荐可靠性视为后端安全评估的首要维度。