论文

追踪多语言中从表示到输出的刻板印象 LLM

Tracing Stereotypes from Representation to Output in Multilingual LLMs

模型评测模型行为与机制分析

摘要

多语言 LLM 显示不同语言之间存在差异的刻板印象相关行为,但行为分数不显示相关信息的表示位置或它如何影响输出。为了研究这些内部机制,我们比较了 Llama-3.1-8B、Qwen3-8B 和 Gemma-2-9B 中的线性探测、归因修补、稀疏自动编码器 (SAE) 和特征消融。在所有三个模型中,探测性能的峰值大大早于归因,模型深度的分离度为 36-53%。保留的 Llama-Scope 特征通常与选择它们的社会类别相匹配,并形成重复的语义族,但它们的词汇对齐和消融效果在不同的 SAE 套件中有所不同。根据我们的标准,只有 6-18% 的评估残差流特征具有与语言无关的效果,并且没有一个与类别无关。与语言无关的特征在 Llama-Scope 中具有更大的平均消融效应,但这种模式不会在其他 SAE 套件中重复。因此,需要单独测量可解码性、输出影响和跨语言消融效应。