论文
控制语言轴:从线性可解码性到因果控制
Steering the Language Axis: From Linear Decodability to Causal Control
摘要
尽管 大语言模型 具有令人印象深刻的多语言功能,但决定语言选择的潜在动态仍然知之甚少。在这项工作中,我们询问语言身份是否只能从隐藏状态线性解码,或者是否可以通过紧凑的激活方向进行因果控制。我们对多个模型系列(包括 Qwen 3.5-2B 和 Llama-3.2-1B-Instruct)进行了详尽的因果干预分析,隔离了 PCA 衍生的“语言轴”,以在 FLORES-200 数据集上的 126 万代之间执行转向和消融实验。沿着这些几何方向引导可以可靠地强制跨脚本(英语到中文)和同脚本(英语到西班牙语)设置中的语言切换,而等幅度的随机扰动几乎不会产生任何效果。我们的分层分析表明,语言承诺是高度本地化的并且明显依赖于语言对。虽然英语到汉语的转换抵制早期干预并在后面的层中轻松引导,但英语到西班牙语的转换更早地发生变化,表现出明显的双峰敏感性。此外,有针对性的消融揭示了英语的基本回归:一旦语言信号被移除,无论输入提示如何,模型都会回落到英语。最终,这些发现表明,语言决策边界在推理过程中作为依赖于方向且特定于层的因果活动特征发挥作用。