论文
所有语言都很重要:理解和减轻多语言 RAG 中的语言偏见
All Languages Matter: Understanding and Mitigating Language Bias in Multilingual RAG
摘要
多语言检索增强生成 (mRAG) 利用跨语言证据将 大语言模型 (LLM) 融入全球知识中。然而,我们表明当前的 mRAG 系统在重新排名期间存在语言偏差,系统地偏向英语和查询的母语。通过引入估计的预言证据分析,我们量化了现有重新排序器与可实现的上限之间的巨大性能差距。进一步的分析揭示了一个关键的分布不匹配:虽然最佳预测需要分散在多种语言中的证据,但当前的系统系统地抑制了此类“关键答案”文档,从而限制了下游生成性能。为了弥补这一差距,我们提出 \textit{\textbf{L}anguage-\textbf{A}gnostic \textbf{U}tility-driven \textbf{R}eranker \textbf{A}lignment (LAURA)},它将多语言证据排名与下游生成效用保持一致。跨不同语言和生成模型的实验表明,LAURA 有效减轻语言偏差并持续提高 mRAG 性能。