论文

现代标准阿拉伯语 (MSA) 是否在LLM中主导阿拉伯语方言?表示级分析

Does Modern Standard Arabic (MSA) Dominate Arabic Dialects in LLMs? A Representation-Level Analysis

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 在生成阿拉伯语时通常默认为现代标准阿拉伯语 (MSA),即使在提示阿拉伯语方言时也是如此。一个自然的解释是它们的内部表示由 MSA 主导。我们通过将 Shani 和 Basirat (2025) 的语言主导框架(https://doi.org/10.18653/v1/2025.blackboxnlp-1.7) 应用于 26 个阿拉伯语变体)来测试这一假设。在各层和模型系列中,我们没有发现任何证据表明 MSA 充当阿拉伯方言的主导内部表示。相反,方言表示形成一个密集且高度重叠的空间:与针对更多不同语言报告的模式相比,归一化互信息急剧下降。此外,最强的可分离性效应并不局限于中间层,而是可以这些发现挑战了对 MSA 偏见生成的常见解释:输出偏好并不一定揭示内部代表性优势,因此,对多语言和方言LLM的分析应该将生成偏见与内部几何结构区分开来。 交涉。