论文
通过跨语言对齐提高信息检索中的语义接近度
Improving Semantic Proximity in Information Retrieval through Cross-Lingual Alignment
摘要
随着多语言文档的可访问性和利用的不断增加,跨语言信息检索(CLIR)已成为一个重要的研究领域。传统上,CLIR 任务是在文档语言与查询语言不同的设置下进行的,并且通常,文档由单一连贯语言组成。在本文中,我们强调,在这种情况下,跨语言对齐能力可能无法得到充分评估。具体来说,我们观察到,在英语文档与另一种语言共存的文档池中,大多数多语言 检索器 倾向于优先考虑不相关的英语文档,而不是用与查询相同的语言编写的相关文档。为了严格分析和量化这种现象,我们引入了旨在评估多语言检索模型的跨语言对齐性能的各种场景和指标。此外,为了在这些具有挑战性的条件下提高跨语言表现,我们提出了一种旨在增强跨语言一致性的新颖训练策略。我们的方法仅使用由 2.8k 个样本组成的小数据集,显着提高了跨语言检索性能,同时缓解了英语倾向问题。广泛的分析表明,所提出的方法大大增强了大多数多语言嵌入模型的跨语言对齐能力。