论文
为什么高级编码器在稀疏检索上滞后?弥合词汇差距的答案和方法
Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps
摘要
虽然像 ModernBERT 这样的先进基础模型在密集检索方面显着优于旧架构,但它们在学习稀疏检索(LSR)方面却令人惊讶地落后于老化的 BERT 基础基线。我们将根本原因确定为 \textit{词汇差距}:现代分词器利用为无损重建而设计的原始、区分大小写的词汇,将单个语义单元映射到冗余的表面形式,浪费模型容量在形态噪声上并阻碍词汇匹配。我们通过理论框架形式化了这种直觉,证明适当的词汇粗粒度可以通过降低假设类的复杂性来收紧泛化界限,前提是保留语义完整性。为了解决这个问题,我们提出了 \textbf{词汇迁移(VT)},这是一种与模型无关的框架,可以以最小的计算成本将高级编码器迁移到稀疏友好的标准化词汇。 VT 利用新颖的语义初始化通过空间拓扑来保留几何结构,并利用激活电位校准(APC)机制将预先训练的流形与稀疏约束对齐,从而防止标准 微调 中观察到的死神经元和密集崩溃。从经验来看,VT 是普遍有效的:它使 ModernBERT 能够在 BEIR 基准上实现最先进的性能(\textbf{52.4} nDCG,\textbf{+4.7} 改进),恢复像 RoBERTa-large 这样的失败模型,并无缝推广到无推理架构和专业领域。这些结果证实,性能滞后不是架构缺陷,而是可解决的词汇不匹配。我们已经发布了我们的代码和模型。\footnote{https://anonymous.4open.science/r/vocab-transfer/。包括所有详细信息。}