论文

语言盲点:查询语言和品牌识别层如何在 12 种欧洲语言中塑造人工智能构建的品牌声誉

The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地调节人们对组织的印象,但大多数监控都是用英语完成的,假设英语查询返回有代表性的图片。我们衡量这一点能持续多久。我们对来自 11 个北欧、波罗的海和中欧市场的 3 个联网检索增强的LLM(GPT-5.4、Gemini 3.1 Pro、Perplexity Sonar Pro)约 66 个品牌进行了查询,使用 4 个语系(日耳曼语、乌拉尔语、波罗的海语、斯拉夫语)的 12 种语言,生成了 35,640 条回复。多语言嵌入(BGE-M3)允许跨语言比较而无需翻译。出现了三个结果。首先,人工智能构建的声誉受语言限制:跨语言余弦相似度平均值为 0.825,同族反应比跨家庭反应更相似(0.844 vs 0.820;d = 0.31),情绪因语言而异(F = 268.5,eta^2 = 0.077),乌拉尔语和波罗的海语言最为积极,日耳曼语(包括英语)最为批评;聚类恢复了斯拉夫语系和波罗的海语系(共表 0.915)。其次,查询语言对推荐品牌的影响远远大于其描述方式:从英语查询转向品牌母语,本地冠军品牌的推荐份额提高了 0.80,但全球跨国公司的推荐份额仅提高了 0.15(t = -8.84,p < 0.001),而情绪方面没有类似的逆转。因此,纯英文审核低估了当地冠军的人工智能可见度。第三,响应稳定性随模型选择的变化比随语言的变化更大(eta^2_model = 0.32 vs eta^2_language = 0.01,在 20 个品牌子集上进行五次迭代复制)。这些结果表明,仅英语的人工智能声誉监控留下了可测量的语言盲点,集中在总部位于当地的品牌的知名度上。