GEO-Flag:检测和测量 GEO 优化的 Web 内容
GEO-Flag: Detecting and Measuring GEO-Optimized Web Content
摘要
生成引擎优化 (GEO) 修改网页内容以增加其被生成搜索引擎选择和引用的可能性。这可能会导致策略性优化的页面可见性与其权威性或相关性不成比例,甚至使薄弱或虚假的信息看起来得到了很好的支持。与传统搜索不同,生成搜索将信息合成为直接答案,而不是呈现竞争来源,这可能会进一步放大这些风险,因为评估来源出处和权威需要额外的用户交互。尽管存在这些担忧,用于检测 GEO 优化网页的系统方法仍未得到充分探索。我们引入了 \texttt{GEOFlagBench},这是一个涵盖 400 个查询、四个域和八个 GEO 优化器系列的 3,200 个 Web 内容实例的基准,并用它来系统地评估现有的 GEO 检测方法。尽管最强基线的总 F1 为 0.880,但方法级别和作者身份条件评估揭示了重大弱点以及对与作者身份相关的捷径的潜在依赖。因此,我们提出\emph{干预配对训练}(IPT),它监督探测器对 GEO 干预和非 GEO AI 抛光的响应;在 ModernBERT 上,IPT 将 F1 从 0.862 提高到 0.944,将最差组精度从 0.725 提高到 0.883。我们开发了一个 GEO 门控代理系统,用于审核源层以及检测到的 GEO 页面中引文 URL 的可验证性。最后,我们在已发布的 Google 搜索和基于 Gemini 的检索结果上部署完整的管道,以进行 1,000 个真实用户查询。在 10,095 个可用页面中,我们估计 GEO 的总体流行率为 8.90\%,在 2026 年修改的页面中达到 16.36\%。我们的结果为系统地检测、审核和测量现实世界搜索生态系统中的 GEO 奠定了基础。