论文
中文生成搜索引擎引用和呈现什么?大规模实证研究
What Do Chinese-Language Generative Search Engines Cite and Surface? A Large-Scale Empirical Study
摘要
生成式人工智能问答系统越来越多地中介信息访问,将内容可见性从排名搜索结果转变为生成答案中的检索、引用和呈现。我们对四个主流平台的 Web 和 App 界面的中文生成搜索进行了大规模的实证研究。受控设计涵盖 8 个平台接口、614 个查询以及每个查询-平台-接口组合的 3 个复制。我们从 214,119 条原始记录中构建了一个包含 160,860 条记录的清理引用级数据集,并分析引用行为、来源归因、实体暴露和跨界面一致性。出现了五项发现。首先,引文池中的品牌有选择性地出现在答案中:总体品牌选择率为 8.3%,包含联系信息的检索来源中有 12.4% 向答案提供了联系信息。其次,内容契合度、跨源出现次数和语义角色在预测模型中相对重要,而 5118-百度综合质量评分并不是任何检查结果的主要预测因素。第三,在带有出版日期的被引用页面中,高时效性查询的拟合半衰期约为 39 天,低时效性查询的半衰期约为 68 天。第四,大约 13% 的品牌曝光无法与同期引用池匹配,大约 71% 的联系信息曝光无法与爬取的正文文本匹配。第五,同一平台的 App 和 Web 界面之间的源集存在系统性差异。这些结果描述了中文生成搜索系统如何选择、属性和表面信息,并表明界面类型是一个重要的分析维度。