论文

正确测量对齐诱导的激活偏移:模板控制的双重差分协议

Measuring Alignment-Induced Activation Shifts Correctly: A Template-Controlled Difference-in-Differences Protocol

模型评测模型行为与机制分析

摘要

比较对齐前后模型的内部激活是询问安全训练发生了什么变化的自然方法:在安全相关输入上形成配对的对齐负基激活矩阵,并读出其有效排名或顶部方向。我们证明了形成这个矩阵的明显方法是混乱的。对齐模型是在基本模型从未见过的聊天模板下进行评估的,因此天真的差异将对齐偏移与聊天格式混为一谈。我们引入了修改矩阵的四变体分解(朴素、模板控制、内对齐和差中差,DiD)来分离两种效果。仅模板控制就消除了 Llama-3.1-8B、Gemma-2-9B 和 Qwen-2.5-7B 的测量有效排名的 2.0-3.9 倍膨胀; DiD 对比恢复了 Arditi 等人的拒绝方向。 (2024),将余弦对齐从 0.18-0.39 提升到 0.50-0.86。三个家族的投影消融证实了恢复的子空间是行为活跃的,并且奇异值顺序不是因果顺序。我们在受控测试台上验证该协议,并将其提炼成用于对齐激活差异研究的测量建议。