论文
驱动多语言嵌入模型中跨语言检索不对称的是中心性,而不是各向异性
Hubness, Not Anisotropy, Drives Cross-Lingual Retrieval Asymmetry in Multilingual Embedding Models
摘要
多语言嵌入模型是在跨语言检索对称的假设下部署的:如果语言 A 的查询检索到语言 B 的翻译,则反之亦然。但实际上并非如此。使用英语、孟加拉语、印地语和阿拉伯语的 6,518 个惯用语和谚语表达的并行语料库,并由五个生产级编码器(Gemini、Mistral、OpenAI-L、OpenAI-S、Qwen)嵌入,我们将这种失败形式化为相互最近邻互惠性的缺陷,并测试单一的机械主张:在多语言空间的几何病理学中,中枢性,而不是各向异性、质心漂移或的大小,是主要的因果驱动因素。在预先指定伪造条件的五个预先注册的实验中,集线器质量在互易性联合回归中占主导地位(49.5%的主导份额,下一个预测因子的 1.68 倍;部分 R^2 = 0.302 与各向异性的 0.003),而集线器感知分数校正(CSLS)则缩小了最差到最佳互易性差距的 63.5%,并产生平均模型内效应尺寸比外科中心矢量消融大 130 倍。后一个对比明确了机制:集线器性是相似性度量的病态,而不是单个集线器向量的病态。我们通过证明两者在统计上是可分离的来解决众所周知的各向异性-中心度悖论,并且我们建议用 CSLS 替换余弦相似度作为多语言嵌入管道的默认检索指标。