论文

沃尔多在哪里?跨语言知识差异下的查询语言偏好

Where's Waldo? Query-language Preference under Cross-lingual Knowledge Disparities

模型评测模型行为与机制分析

摘要

通过综合多语言证据,大语言模型越来越多地充当跨语言知识密集型信息搜索任务的接口。先前的工作表明,他们经常表现出查询语言偏好——倾向于偏爱用查询语言编写的源——但主要在跨语言提供等效知识的环境中检验了这种行为。然而,当不同语言的来源对同一事实提供不完整或不一致的描述时,这种偏见就会产生后果,因为用户收到的信息取决于模型选择使用的来源。为了描述这种跨语言知识差异下的查询语言偏好,我们引入了 Waldo,一个根据维基百科构建的多语言问答(QA)基准。 Waldo 包含 12K QA 对,针对知识差距(一种语言中存在某个事实而另一种语言中不存在)和知识冲突(其中语言版本提供同一事实的冲突版本)。通过评估五种语言的八个模型,我们发现当一种语言版本仅缺乏相关事实时,模型通常使用来自另一种语言的证据,而不管查询语言是什么。然而,在冲突的帐户下,模型响应与查询语言中的文档强烈一致,导致语义上等效的查询根据用户的语言引出不同的帐户。最后,我们探索了两种不同的方法,可以在知识冲突下减轻这种偏好:一种机械干预,可以消除与查询语言偏好相关的注意力头;以及基于 LoRA 的训练,可以将偏好差距减少高达 61.5%。