论文

多语言编码器会生成语言一致的语义 ID 吗?

Do Multilingual Encoders Produce Language-Consistent Semantic IDs?

模型评测模型行为与机制分析

摘要

语义 ID (SID) 将项目嵌入压缩为生成检索中使用的离散代码序列。我们询问多语言编码器是否足以让同一产品的不同语言呈现接收语言一致的 SID。使用以英语、西班牙语和日语呈现的 Amazon ESCI 列表,我们测试翻译是否与其英语源保持接近,残余量化是否对翻译引起的移动异常敏感,以及多语言或语言平衡量化器拟合是否改善了 SID 一致性。多语言 E5 的翻译效果明显不同:在以英语为主的情况下,日语翻译仅在 7.7% 的情况下保留其英语对应版本的第一个 SID 代码,而英语改写的比例为 89.0%。距离匹配的产品导向控制产生与翻译几乎相同的全 SID 不匹配,没有提供量化器选择性放大语言方向的证据。平衡拟合混合使码本使用更加统一,但进一步降低了跨语言前缀一致性:西班牙语首码一致性从 28.3% 下降到 6.6%,而仅英语拟合则保留了 67.6% 的西班牙语翻译。这些结果表明,仅靠多语言接触和平衡码本使用并不能保证 SID 的语言一致性。