论文
多语言可解释性方法的系统比较揭示了各向异性驱动的故障
A Systematic Comparison of Multilingual Interpretability Methods Reveals Anisotropy-Driven Failures
摘要
多语言语言模型开发了共享的跨语言表示,并且各种可解释性方法声称可以量化这种共享。这些方法很大程度上是孤立开发的,当它们存在分歧时,尚不清楚这种分歧是反映了模型的属性还是测量的伪影。我们比较了来自五个系列的 21 个基本模型(125M-14B 参数)的四个共享指标(CKA、ANC、每个词元的 GMM 优势和 ILO),并将每个指标与五个下游任务的跨语言传输相关联。我们发现这些模型中跨语言共享的量化指标有所不同,并表明这种分歧归因于各向异性,即表示在嵌入空间的狭窄锥体中聚集的趋势。只有 ILO 与跨语言迁移的相关性(Spearman 的 $ρ= 0.90$)能够在模型大小、族和每个任务变化的控制下幸存下来。因此,我们建议将 ILO 作为主要共享指标,与各向异性诊断一起报告。