论文

Counter-GEO-Bench:评估针对信息扭曲生成引擎优化的防御措施

Counter-GEO-Bench: Evaluating Defenses Against Information-Distorting Generative Engine Optimization

模型评测基准与评测资源

摘要

生成引擎优化 (GEO) 使内容制作者能够提高其网页在生成搜索引擎中的可见性,但当对手发布看似普通的 GEO 优化文档,而受害者 大语言模型 (LLM) 检索并合成扭曲的答案时,相同的技术可能会提供有针对性的错误信息。现有的基准还没有评估在受控条件下针对这种威胁的防御能力。因此,我们提出了 Counter-GEO-Bench,这是一种防御基准,它将 247 个经过人工验证的质量门控查询与信息保留和信息扭曲的 GEO 重写配对,并评估三个受害者 LLM 的攻击成功率 (ASR)、误报率和答案质量的防御。在 Counter-GEO-Bench 下,三种现成的防御措施(Granite Guardian、Llama Guard 3 和 NeMo Self-Check Fact-Checking)最多可相对减少 ASR 5.7%,而 Granite Guardian 的减少量在统计上并不显着。安全分类护栏针对违反政策的行为,而 GEO 错误信息则作为流畅的信息内容通过它们。为此,提出了一个轻量级基准基线C-GEO Guard,相对于接近零的效用损失,ASR 降低了 47.6%,这证明威胁是可处理的。