论文

DenseOn 与 LateOn:用于多语言、长上下文和代码搜索的完全开放的密集和后期交互模型

DenseOn with the LateOn: Fully Open Dense and Late-Interaction Models for Multilingual, Long-Context, and Code Search

模型训练预训练

摘要

最先进的检索模型越来越依赖于封闭的训练数据,从而造成了可重复性的差距。我们提出了一种开放的端到端训练检索模型的方法,并研究英语监督如何通过翻译训练转移到多语言检索。我们首先从 34 个公共来源的 1.4B 对中重建和整理 665M 个英语对比 预训练 对,并构建 1.88M 个带有挖掘的硬负例的监督 微调 对。训练产生两个 149M 参数模型:DenseOn(一种单向量密集模型)和 LateOn(一种 ColBERT 风格的后期交互模型)。他们在 BEIR 上分别实现了 56.20 和 57.22 的平均 nDCG@10,为该尺寸级别设定了新的最先进结果。然后,我们将经过验证的英语数据翻译成八种语言,产生 2.8B 对跨语言样本,并训练 mDenseOn 和 mLateOn,这两个基于 mmBERT 的 307M 参数模型。尽管共享它们的主干、数据和目标,但它们的表示行为不同:密集模型在英语和翻译语言上很强,但会降低翻译训练支持之外的性能,而后期交互模型可以更好地泛化到看不见的语言和脚本。这表明 词元级 匹配将翻译训练从目标语言扩展策略转变为多语言泛化策略。我们公开发布模型、数据集和训练代码。