论文
跨文化基准中概念的语言不可对齐性
Language Unalignability: Why Some Concepts Resist Cross-Cultural Benchmark Evaluation
摘要
当前对多语言大语言模型 (LLM) 的评估基于隐式翻译同构假设 (TIA):跨语言的语义结构是一致的且可相互映射,不会丢失信息。我们认为,这一假设不仅在实践中被违反,而且原则上对于类型学上可识别的一类概念(包括实用标记、敬语和历时分层术语)来说也是不恰当的。我们使用使用云框架将这种失败形式化,将概念表示为上下文嵌入的点集。我们将 $α$ 不可对齐性定义为任何同时保留词汇忠实性(质心对应)和结构忠实性(局部邻域拓扑)的映射的不可能性。我们提供三层证据。在行为上,我们表明 FLORES-200 翻译失败是通过语言家族和资源类预测的,而不是通过脚本预测的,并且 LOBSTER 推理分数因语言家族而异。从机制上讲,我们在关于雅米语的九个模型案例研究中报告了表征-干预差距(RIG):模型的激活编码了一种规律性,雅米语与其他低资源和南岛语群体一起分组,但对语言特定神经元的干预与随机掩模相比没有显示出任何优势:规律性是可见的,但无法通过这种干预来使用。最后,我们将这些发现转化为多维诊断概况:循环一致性、实用负载不一致、流形曲率不匹配和 RIG。我们认为,将文化能力分解为单一标量会刺激“概率扁平化”,并且认识到不可调整的阶级是人工智能尊重而不是消除文化差异的先决条件。这表明多语言对齐不是一个明确定义的目标,而是一组相互不兼容的预测。
