论文
模型生物抽签:模型生物的可解释性很大程度上取决于训练方法
The Model Organism Lottery: Model Organism Interpretability Strongly Depends on Training Methodology
摘要
模型生物(MO)——经过训练可以表现出不良或不自然行为的语言模型——经常被用作评估白盒可解释性技术的测试平台。当前的 MO 通常是通过行为记录或合成文档的事后监督 微调 (SFT) 构建的。先前的研究表明,可解释性方法可以轻松识别这些 MO 中的隐藏行为。然而,最近的研究表明,这种事后训练方法可能会使可解释性变得不切实际的容易。我们通过构建一套 54 个基于 $\verb|OLMo2-1B|$- 和 $\verb|gemma-3-1b-it|$ 的 MO 套件来研究这一说法,这些 MO 使用七种不同的技术进行训练,包括标准事后 SFT、事后 DPO 以及将 MO 数据更现实地集成到 OLMo 后训练 DPO 阶段。我们使用这些 MO 变体来对激活预言机、激活控制、logits 透镜和稀疏自动编码器进行基准测试。我们的研究结果表明 (i) MO 可解释性在很大程度上取决于训练目标、目标行为、模型架构和训练数据生成管道; (ii) 即使在控制了目标行为表达强度的差异之后,仍然存在显着的差异; (iii) 与标准事后方法相比,我们更现实的 $\textit{integrated Training}$ 通常会产生更少可解释的 MO。我们的结果对当前 MO 作为可解释性代理的有效性产生了重大怀疑。