论文

检索层的多语言诅咒:来自阿姆哈拉语的证据

The Multilingual Curse at the Retrieval Layer: Evidence from Amharic

模型评测模型能力评测

摘要

多语言检索日益支撑跨语言问答和检索增强生成。多语言基准上强大的零样本分数通常被视为当前编码器可以跨多种语言可靠传输的证据。我们认为,对于代表性不足、形态丰富的语言来说,这一假设不成立,并使用阿姆哈拉语作为诊断案例。在涵盖密集、后期交互、学习稀疏和跨编码器范式的共享段落检索协议下,我们比较了零样本多语言 检索器、阿姆哈拉语微调多语言 检索器 和单语言阿姆哈拉语 检索器。最强的零样本多语言 检索器 的表现比最强的单语阿姆哈拉语第一阶段 检索器 的相对 MRR@10 低 23%。 微调 最近在相同阿姆哈拉语监督下的两个多语言嵌入模型比零样本产生了 32-60% 的相对 MRR@10 增益,但最好的阿姆哈拉语微调多语言模型仍然低于最强的单语阿姆哈拉语 检索器。这些发现表明,零样本多语言检索不足以代表 LLM 时代的公平信息访问:对于代表性不足的语言,检索必须以语言进行评估和调整,而不是从聚合的多语言基准中推断。为了促进未来的研究,我们在 https://github.com/rasyosef/amharic-neural-ir 公开发布数据集、代码库和训练模型。