论文

用于检测和减轻跨语言模型家族的紧急错位的可行激活方向

Actionable Activation Directions for Detecting and Mitigating Emergent Misalignment Across Language Model Families

模型评测模型行为与机制分析

摘要

不安全代码上的 微调 语言模型会因内部结构了解甚少而导致出现紧急错位。我们研究这种错位是否对应于跨架构共享的因果可操作激活空间方向。在四个经过相同微调的指令调整模型系列(Qwen2.5-1.5B、Gemma-2-2B、Llama-3.2-1B、Ministral-3-3B)中,均值差方向在每个模型的最后一层实现了对齐和未对齐激活的 99.6% 分离。通过减去这个方向的因果转向将代码溢出减少了 21-51 个点,而安全代码控制则确认了内容的特异性。通过岭回归图的跨架构转移会产生较大的行为抑制(最多 46 个点),但由于随机方向和正交方向的表现相当,因此无法进行特异性控制。我们确定了一个两层的特殊性结构:模型内的方向是因果特定且可操作的;跨模型方向是因果真实的但非特定的。出现了不对称转移拓扑,Gemma 和 Qwen 充当几何施主,Llama 充当接收者。这些发现定义了线性跨架构校正的限制,并建议进行模型内探测以进行审计。