论文
MSQA:原生多语言和多文化 SimpleQA 基准
MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark
摘要
多语言的流畅性通常会引发一个更强有力的假设:能够说出用户语言的模型也必须理解该语言编码的文化。我们称之为文化一致性的幻觉。为了直接测试这一假设,我们引入了 MSQA,这是一个包含 1,064 个本地来源问题的基准,涵盖 11 个语言组、五个文化维度和三个难度等级。与翻译基准不同,MSQA 针对本地知识,减少以英语为中心的跨语言迁移的捷径。通过评估 18 LLM,我们发现严重的文化退化和明显的局部效应:文化能力比一般推理能力更紧密地跟踪 预训练 暴露。我们进一步表明,常见的推理时间补救措施并不能消除这种幻想。模型对不熟悉的文化问题仍然过于自信,重复采样产生的正确性不稳定而不是可靠,并且检索增强对长尾事实的帮助不均衡。这些发现表明,文化一致性不能仅从多语言能力推断出来,需要比推理时的校准、采样或检索更深入的干预