论文

LLM如何跨语言与市场引用品牌声誉信息

How Large Language Models Source Brand Reputation Across Languages and Markets

模型评测模型行为与机制分析

摘要

当 大语言模型 (LLM) 回答有关公司的问题时,它会将答案基于检索到的网络资源,而这些资源决定模型的内容。大多数人工智能品牌知名度分析都会着眼于答案文本。这项研究更早地着眼于引文。我们合并了三个 Rankfor.AI 数据集,涵盖 12 个国内市场和 13 种语言的 128 个品牌,并分析了 167,551 个基于 URL 的引用(总共 189,974 个归因行)。我们按领域和来源类型对每个引文进行分类,并按语言和市场衡量人工智能从何处获取其品牌信息。四种模式成立。首先,AI关于品牌的回答主要依据第三方来源:85.7% 的引用指向该品牌不拥有的网站,而该品牌拥有的网站为 14.3%。其次,来源库集中且长尾:80% 的引用来自约 18% 的领域,符合 Zipf 定律(alpha = 0.86,R^2 = 0.983)。第三,一个参考网站几乎在所有地方都占主导地位:维基百科是 12 种语言中 11 种语言中被引用次数最多的域,但立陶宛语除外,商业日报 vz.lt 领先于它(4.38%)。第四,来源组合在边缘上是针对特定市场的:对于 46 个波兰民族品牌来说,被引用最多的域名是 YouTube,四个人力资源和职业门户网站提供了 637 次引用,而波兰维基百科则提供了 297 次引用,大约是后者的两倍。