论文

当安全说话时:LLM 中安全语言身份纠缠的机制分析

When Safety Speaks a Language: A Mechanistic Analysis of Safety-Language Identity Entanglement in LLMs

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 的安全对齐在不同语言中都会降低,但驱动这种不对称性的内部机制仍然知之甚少。因此,我们的工作使用稀疏自动编码器(SAE)特征、与跨三种指令调整的 LLM、八种语言和所有模型层的有害和无害模型行为相关的残余流中的稀疏可解释方向,对多语言安全性进行系统的机制分析。我们观察到,与安全相关的功能在其位置以及跨层分布方式方面取决于架构。此外,它们在几何上与语言身份纠缠在一起,并表现出跨语言共享模式,即语言在模型深度和架构上不同程度地共享安全功能。这种安全语言纠缠会产生直接后果,即消除安全功能不仅会影响有害响应率,还会影响目标语言,而干预程度则由安全功能和语言功能之间的关系预测。我们的研究结果将安全一致性的语言通用性限定为依赖于体系结构,并提供了多语言安全干预的机械说明。