论文

重新缩放 MLM-Head 以进行神经稀疏检索

Rescaling MLM-Head for Neural Sparse Retrieval

上下文与知识检索增强

摘要

SPLADE 等学习稀疏检索 (LSR) 模型传统上使用 BERT 风格的屏蔽语言模型作为骨干编码器。一个自然的期望是用更强大的预训练编码器替换 BERT 应该可以提高检索效率。然而,我们发现,在标准 SPLADE 训练方案下,具有大型 MLM-head L2 范数的骨干网可能会遭受性能下降,甚至在标准 SPLADE 训练方案下训练崩溃。我们将这种失败识别为 MLM 头部中的尺度不匹配:SPLADE 直接使用 MLM 头部输出来构造稀疏词汇表示,并且查询文档相关性是通过这些表示上的非标准化点积来计算的。因此,膨胀的 MLM-head 尺度会放大稀疏激活、扭曲匹配分数并破坏常见训练设置下对比训练的稳定性。为了解决这个问题,我们引入了一个简单的初始化时间校正,在 SPLADE 训练之前通过一个常数因子重新调整 MLM 头投影。这种零成本的调整提高了训练的稳定性,而无需修改模型架构或训练目标。在域内和域外检索基准测试中,这种简单的修正极大地改进了 ModernBERT 和 Ettin 等大范数主干网,将不稳定的训练运行转变为有竞争力的稀疏 检索器。在一些设置中,校正后的模型进一步匹配或超过了经典的 BERT-SPLADE 基线。这些发现表明,使预训练编码器适应 LSR 的瓶颈不仅仅是编码器容量,而是用于构造稀疏词汇表示的 MLM-head 尺度的校准。