论文

ItColBERT:意大利专业后期互动寻回犬

ItColBERT: An Italian-Specialised Late-Interaction Retriever

模型训练监督微调与指令调优

摘要

意大利语的神经信息检索几乎完全由多语言模型提供。多种多向量(后期交互)检索器包括意大利语等数十种语言,并且存在几种强大的意大利语密集嵌入器,但截至 2026 年 8 月,尚未发布专门针对意大利语的后期交互检索器。我们展示了 ItColBERT,一种 1.35 亿参数的意大利 ColBERT,采用 PyLate 进行训练,遵循 ColBERT-Zero 配方:从已检索的检查点进行初始化,然后应用监督对比训练,然后进行单教师蒸馏,在一台 RTX 3090 上总共大约需要 14.5 个 GPU 小时。在四个意大利检索基准中,它的性能优于我们测试的每个通用后期交互基准,除了一个 (mLateOn)、参数比每个基线少 2-4.4 倍,但大小相当。我们的主要实证发现是方法论的,并且部分是负面的。在唯一的完全域外基准 (MLDR-it) 上,应用于未更改的检查点的推理时间分块配方会产生 +0.0602 nDCG@10 (p = 0.0225),比另外两轮训练产生的效果更大。自行挖掘的硬负例和本机 1024 个词元训练都根据预先注册的决策门进行了评估,但都失败了。我们报告了与经验测量的 0.0030 nDCG@10 的本底噪声的配对引导测试的每次比较,并且我们发布了权重、训练和评估代码以及包括被拒绝的轮次在内的完整实验记录。