论文
语言模型中的文化绑定注意力头
Cultural Binding Heads in Language Models
摘要
LLM常常默认对不同文化群体一视同仁,即便上下文要求区别对待:这是一种差异意识的缺失。利用机制可解释性方法并对Wang等(2025)的N4文化挪用基准进行因子设计,我们在八个模型(四种架构,含base与instruct)中识别出每模型2-3个对文化绑定有因果贡献的中层注意力头。文化绑定是将文化条目与恰当身份关联起来的过程。敲除这些头上从身份到条目的边,会使绑定强度下降9-23%。所识别的头能从instruct模型迁移到base模型,表明文化绑定在预训练阶段即已形成。$\alpha$缩放显示出分级的剂量-响应关系,在生成时进行适度放大转向($\alpha= 2-3$)可将文化区分准确率提高1-3个百分点,而中性推理基本保持完好。一项知识探针任务表明,模型“知道”的内容是其付诸行动的3-5倍,说明瓶颈在于路由而非知识。