论文
生产LLM的引用由什么驱动?对万余网页和200万次AI引用的观察性研究
What Drives Citations in Production Large Language Models? An Observational Multi-Method Study of Two Million AI Citations Across Ten Thousand Web Pages
摘要
生产型大语言模型在生成答案的同时检索和引用网页,但预测引用频率的页面级特征仍然没有得到很好的描述。我们提出了一项观察性研究,涉及六个月内来自四个商业引擎(ChatGPT、Claude、Google AI、Gemini)的约 200 万条 LLM 引用,并加入了来自 19 个 B2B SaaS 工作区的 10,000 个爬网页面。使用九种方法的共识框架测试了六十多个特征,该框架将混合效应回归与域固定效应、FDR 校正、稳定性选择套索、双机器学习、广义加性模型和时间保留复制相结合。有四项调查结果通过了所有检查。首先,提示内容对齐(页面标记和整个工作区提示语料库之间的 Jaccard 重叠,包括非引用提示)是主要的页面级预测因子(beta = +0.37,95% CI [+0.33,+0.41],q ~ 10^-73)。其次,标准 AEO 检查表(常见问题解答块、结构化数据、核心网络生命力)显示了汇总数据的积极影响,一旦应用域固定效应,这些积极影响就会逆转或崩溃到零:辛普森悖论对 AEO 文献的实际影响。第三,领域级人工智能权威的平均绝对SHAP值比最强的非对齐页面级特征高出六倍。我们发布分析管道作为方法论的贡献。