论文
多语言引导设计:多语言稀疏自动编码器和有原则的层选择
Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection
摘要
稀疏自动编码器 (SAE) 在 大语言模型 (LLM) 中实现特征级机械解释和激活转向,但基于 SAE 的语言控制在多语言环境中仍然不可靠:大多数 SAE 只接受英语数据的训练,并且转向层是启发式选择的。我们通过 SAE 推进多语言语言引导的原则性、机械性解释来解决这些局限性。首先,我们表明,在多语言数据上训练 SAE 能够持续增强跨语言表示,并在跨层和模型族之间产生更可靠、更保质的语言控制。其次,我们引入了基于多语言对齐和语言可分离性相交的\emph{先验}控制层选择规则,该规则无需详尽的分层搜索即可预测有效的干预深度。我们使用 SpBLEU、ROUGE-L、COMET 和 LaSE 评估我们在 LLaMA-3.1-8B 和 Gemma-2-9B 上的机器翻译和跨语言摘要 (CrossSumm) 方法。我们的结果表明,多语言 SAE 与交叉选择层相结合,稳定了语言识别准确性和生成质量之间的权衡,为多语言 SAE 控制提供了原则性的、预测性的、表示级的解释。