论文
SHIFT:通过索引端特征转换实现语义协调,用于多语言信息检索
SHIFT: Semantic Harmonization via Index-side Feature Transformation for Multilingual Information Retrieval
摘要
随着海量多语言语料库的迅速扩展,多语言信息检索(MLIR)已成为全球信息访问的关键技术。 MLIR 使用户能够使用单语言查询从多语言文本集合中检索语义相关的文档。然而,最近的多语言密集检索模型通常表现出对与查询相同语言的文档的强烈偏好。这会导致严重的语言偏差,即使其他语言的文档包含更多语义相关信息,排名最高的结果仍由特定语言的文档主导。为了解决这个问题,我们提出了 SHIFT,一种适用于索引阶段的 无需训练 方法。具体来说,SHIFT利用并行翻译对来估计每种目标语言相对于源语言的相对语言向量。随后,SHIFT 通过在索引期间从文档嵌入中减去该相对语言向量来纠正特定于语言的偏移量。我们对四个 MLIR 基准和多种密集检索模型的综合评估证实,SHIFT 可以有效减轻语言偏差并提高 MLIR 性能。