论文

用于语言模型机制审计的参考特征图谱

Reference Feature Atlases for Mechanistic Auditing of Language Models

模型评测模型行为与机制分析

摘要

审计一个新语言模型通常意味着从头重新学习并重新解释其内部特征。我们提出参考特征图谱:一个在参考面板上一次性训练、并可复用于新目标的稀疏特征库,只需拟合一个线性解码器即可附着到新模型。这带来两个互补视角。图谱通道在已被解释的面板特征上读取目标模型,提供跨模型的稳定坐标系;残差通道仅从图谱无法重建的部分学习特征,使"参考面板之外"成为显式的审计信号。我们在五个7-9B指令微调模型上训练留一法图谱,并审计留出的Mistral与Qwen目标。在注入两个目标的三个受控LoRA隐藏目标上,残差通道使植入机制在运行时完全可控而匹配的对照不受影响,并将植入目标恢复为两个目标模型中排名最高的潜变量;在Mistral上,为正面对比而重新训练的逐目标SAE与成对crosscoder基线均未能做到。在Qwen-2.5上,同一通道还揭示了相对面板的政治框架簇;对该簇进行转向会改变被审计的框架指标,而域外对照保持不变。

用于语言模型机制审计的参考特征图谱:论文配图
图 1:参考特征图集训练和目标附件。第一阶段使用多输入编码器和每个模型解码器在参考面板上训练共享稀疏坐标系。第 2 阶段冻结图集,根据参考面板计算 zAz_{A},并通过仅针对 h⋆h_{\star} 拟合目标解码器 D⋆D_{\star} 来附加目标。附件输出是目标解码器、其在图集坐标上的支持配置文件以及未由图集通道重建的残差。