论文
单向量嵌入的优点和局限性
On Strengths and Limitations of Single-Vector Embeddings
摘要
最近的工作(Weller 等人,2025)引入了一个名为 LIMIT 的自然数据集,并根据经验表明,各种流行的单向量嵌入模型的检索质量大幅下降,引发了人们对单向量嵌入检索可靠性的担忧。尽管(Weller et al., 2025)提出有限维度是造成这种情况的主要因素,但我们表明,仅维度无法解释观察到的故障。我们从 (Alon et al., 2016) 的结果中观察到,$2k+1$ 维向量嵌入足以进行 top-$k$ 检索。这一结果指出了绩效不佳的其他驱动因素。控制属性之间的标记化伪影和语言相似性只能产生有限的收益。相比之下,我们发现嵌入相似性与任务的基本相关性概念之间的领域转移和错位是主要因素;微调可以减轻这些影响并可以显着提高召回率。然而,即使进行了微调,单向量模型仍然明显弱于多向量表示,这表明存在根本局限性。此外,在类似 LIMIT 的数据集上微调单向量模型会导致灾难性的遗忘(MSMARCO 上的性能下降超过 40%),而多向量模型的遗忘则很小。为了更好地理解单向量和多向量模型性能之间的差距,我们研究了文档淹没悖论(Reimers \& Gurevych,2021;Jacob 等人,2025):随着语料库的增长,相关文档越来越“被淹没”,因为嵌入相似性的行为在某种程度上类似于相关性的嘈杂统计代理。通过对玩具数学模型的实验和数学计算,我们说明了为什么单向量模型比多向量模型更容易受到溺水效应的影响。