论文

方言可以像语言一样被控制吗?阿拉伯语中的稀疏神经元和分布式方向 LLM

Can Dialects Be Steered Like Languages? Sparse Neurons and Distributed Directions in Arabic LLMs

模型评测模型行为与机制分析

摘要

相对于现代标准阿拉伯语 (MSA),方言数据稀缺,导致阿拉伯语 LLM 生成过多的 MSA,并难以生成方言准确的数据。这就提出了一个基本的可解释性问题,即方言特征在模型内部的何处以及如何编码,以及这些表示是否可以在没有 微调 的情况下改进方言生成。我们研究两种推理时间方法作为可解释性探针和控制机制。首先,神经元级分析识别编码方言特定特征的稀疏群体,并测试放大或抑制它们是否会引导模型输出转向目标方言。其次,向量控制提取方言特定的激活方向,并在推理过程中注入它们,其动机是神经元级别的特征纠缠。我们发现这些神经元是真实的,但只能部分解释。它们占据 MLP 维度的 1\% 以下,但仅跨越剩余方言方向的 5\% 到 21\%。这种有限的覆盖范围是有因果关系的。当提示已经是方言但无法从 MSA 提示中诱导出来时,神经元转向会强化某些变体的方言,而向量转向在两种设置中都会成功。因此,阿拉伯方言主要通过分布式而非本地化表示来控制