论文

MoganColBERT-TR:土耳其语的后期交互多向量检索模型

MoganColBERT-TR: A Late-Interaction Multi-Vector Retrieval Model for Turkish

摘要

我们之前报道过一种从头开始训练的土耳其语 ModernBERT 编码器 (MoganBERT-TR) 以及在其之上构建的单向量嵌入模型 (MoganBERT-embed)。这项工作引入了该谱系中的第三个模型:MoganColBERT-TR,一种多向量检索模型,它不是将查询或文档压缩为单个向量,而是通过 768->128 投影在 词元级 上表示它,并使用 MaxSim 后期交互对其进行评分。该模型不是从头开始训练的:嵌入模型的编码器被视为起点,并通过单周期 蒸馏 阶段适应 ColBERT 目标。训练数据由两个来源生成:从我们自己的字符域和句子边界预训练语料库中提取的标题到段落对,以及两个基于土耳其语问题的检索集,并从跨编码器教师 (bge-reranker-v2-m3) 对 1 个正值和 7 个挖掘的负值的软分数中提取。我们表明,在硬负挖掘中,仅基于排名的跳跃是不够的,必须与组掩模和余弦上限相结合。使用 TurkColBERT 的官方管道在五个土耳其 BEIR 数据集上进行评估,TurkColBERT 是为土耳其后期交互检索(PLAID 索引、精确 MaxSim)构建的基准;它们都没有出现在我们的训练池中,因此所有五个结果都是干净的零样本。 MoganColBERT-TR 拥有 148.9M 个参数,五个数据集的平均总分达到 37.36(35.53 nDCG@100、31.81 nDCG@10),在五个比较的模型中排名第二:它在五个数据集中的四个上优于两倍大的 ColmmBERT-base-TR,总体高出 +3.05,并且是基准最大的模型+12.30。与领先模型 (mLateOn) 的差距集中在 ArguAna-TR,这是迄今为止查询最长的数据集。