论文
SCI-Defense:防御生成引擎优化的操纵攻击
SCI-Defense: Defending Manipulation Attacks from Generative Engine Optimization
摘要
基于 LLM 的排名系统容易受到生成引擎优化 (GEO) 攻击,攻击者会将语义信号注入产品描述中以人为地提高排名。我们提出了 SCI-Defense,这是一个由三部分组成的防御框架,结合了困惑检测(PPL)、语义完整性评分(SIS)和候选者间检测(ICD)。 SIS 评估四个操纵维度:权威归因 (AA)、叙事目的性 (NP)、比较主张 (CA) 和时间主张 (TC)。对 6 个类别的 600 个亚马逊产品描述进行评估,SCI-Defense 达到了 Precision=1.000 和 FPR=0.000,针对字符串、推理和评论攻击的召回率分别为 1.000、0.952 和 0.830。在 600 MS MARCO 网络段落中,字符串攻击可通过完美的召回率被阻止,而审查攻击则产生接近于零的召回率,因为网络段落缺乏 SIS 在产品描述中针对的以说服为导向的信号。我们证明了现有的防御措施——仅 PPL 过滤器、SafetyClf 内容分类器和释义——实现了针对语义操纵攻击的零召回。我们进一步证明了诸如规范放大和用例饱和之类的新攻击可以将语义相关性操纵暴露为结构性防御盲点,从而为未来的研究指明方向。