使用引擎评分:检索曝光、跨引擎分歧以及与引擎无关的 GEO 分数的限制
Scoring With the Engine: Retrieval Exposure, Cross-Engine Divergence, and the Limits of Engine-Agnostic GEO Scores
摘要
最近的工作询问生成引擎可见性是否可以用确定性的、无引擎的页面分数来近似。我们将这些分数可以合并的两个阶段分开:暴露于实时引擎和以暴露为条件的引文选择。在对 ChatGPT、Microsoft Copilot、Google 和 Perplexity 的观察性审计中,15 个固定商业提示在 2026 年 6 月 6 日产生了 589 个引用观察结果,对应于 528 个唯一 URL 和 356 个域。相同提示的跨引擎 URL 重叠极小:平均成对 Jaccard 相似度为 0.0079,中位数为零,并且 84.9% 的引擎对共享没有引用的 URL。在所有四个引擎上观察到的十个提示中,平均精确 URL Jaccard 为 0.0072。大小匹配的超几何基线保留每个提示的四引擎 URL 范围,每个引擎的列表长度预测为 0.1272,因此观察到的重叠仅为该基线的 5.7%; 86.7% 的比较中 URL 重叠为零,而预期为 12.3%。在所有 60 次成对比较中,前 5 位的精确 URL 重叠为零。单个引擎仅捕获了四引擎 URL 联合的 11.4%-42.6%,并且观察到的 URL 的 96.4% 只出现在一个引擎中。 6 月 5 日至 6 日的另一项同一引擎比较发现,URL 集平均周转率为 67.0%。这些结果不会使无引擎页面评分无效;他们确定其估计值。不使用实时引擎计算的分数可以估计页面质量或查询页面适合度,而端到端可见性还取决于特定于引擎的曝光和选择。因此,我们主张将页面适合度、观察到的曝光度、条件选择和最终可见度报告为不同的数量。