论文
GroundedGEO:审核生成搜索排名中的证据差距
GroundedGEO: Auditing the Evidence Gap in Generative Search Rankings
摘要
生成搜索系统对产品和服务进行排名以做出后续决策,出版商可以廉价地使候选文本看起来相关。然而,证据状态不是文本属性,而是主张-证据关系:纯文本排序器和防御无法将诚实的详细内容与捏造的细节分开,从而造成可识别性差距。我们使用证据配对基准(50 个电子商务查询,1,950 个案例)和声明级重新排序器 GroundedGEO 来审核这一差距,该重新排序器会惩罚在所提供的数据包中缺乏支持的查询相关声明。匹配丰富的变体控制格式和音量;数据包孪生在固定文本中添加证明,而稀疏数据包则撤回它们。在冻结的列表排序器 Qwen2.5-7B 上,不受支持的丰富变体显示出比干净候选者显着的标准化排名增益(在声明配置文件中 +0.065 至 +0.092,Holm 校正),而受支持和中性对照则不然;该效果取决于模型(MiMo-v2.5 上的效果有限,GLM-5.3-Flash 上不存在)。在冻结的逐点评分器上,预言机证据标签在 lambda=40 时将无支持的丰富 top-3 比率从 0.65 降低到 0.43(从 0.61 降低到 0.39),零错误抑制;数据包孪生恢复原始速率而不更改文本。针对 370 个索赔的人类黄金,所有测试的自动法官都未能通过预先注册的可靠性门,尽管最好的本地法官保留了 79-100% 的神谕抑制,并且对受保护武器的测量错误抑制为零。另外,剥离证明覆盖率会使错误抑制增加 0.307。这些诊断效果确定了证据通道的两个限制:标签质量和数据包覆盖范围。它们不验证自动防御,并且对不利的人金臂的解释仍有待裁决。