论文

对监督微调的机制性考察

A Mechanistic Investigation of Supervised Fine Tuning

模型评测模型行为与机制分析

摘要

大语言模型在监督微调(SFT)前后隐藏激活之间的余弦相似度仍然非常高。这乍看之下表明SFT几乎没有扰动模型的激活几何结构。然而,将两组激活投影到在基座模型上预训练的稀疏自编码器(SAE)中可以发现,底层的稀疏潜变量显著发散。我们引入一种新颖的研究流水线,将这些预训练的SAE用作高分辨率诊断工具,从机制层面探究这种表征发散的驱动因素。通过我们的分析流水线,我们发现在监督微调中被系统性改变的精确语义特征呈现出任务特定与层级特定的分布。我们还识别出安全对齐特有的逐层更新模式。与本工作相关的所有代码、实验脚本与分析文件已在以下地址公开:https://github.com/ruhzi/sae-investigation。

对监督微调的机制性考察:论文配图
图 1:跨训练步骤的预训练表示和微调表示之间的余弦相似性轨迹。原始隐藏激活在整个 SFT 中保持高度一致,而 SAE 潜在表示则存在很大差异,特别是在更深的层中。