论文
审计百度和谷歌人工智能搜索中的源暴露
Auditing Source Exposure in Baidu and Google AI Search
摘要
人工智能生成的概述正在成为搜索界面中越来越重要的一层,但它们在中文搜索中的行为仍未得到充分探索。我们使用从 MS MARCO 及其翻译的中文对应版本中采样的英语查询,对百度和谷歌上的人工智能概述行为进行跨语言审核。我们的分析检查了何时跨平台语言设置触发概述、哪些主机域在中文概述中接收可见曝光、曝光的集中程度以及源重叠在不同设置中的变化情况。我们还比较了匹配查询意图的生成答案的基于嵌入的语义相似性。结果揭示了不同平台语言设置在概述可用性和可见源暴露方面存在显着差异。在聚合级别上,这些设置在可见主机域清单中表现出较低的重叠,而匹配查询答案产生的中值余弦相似度范围为 0.701 到 0.813。这些发现表明,答案级别的语义相似性和聚合源暴露捕获了人工智能介导的搜索的不同维度。因此,对人工智能搜索的评估不仅应考虑生成答案的内容,还应考虑源可见性如何跨平台、语言和信息环境分布。