论文
通过激活引导实现不牺牲连贯性的开放式生成对齐
Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence
摘要
大语言模型的一致性比通常假设的更脆弱:对抗性提示、良性微调、紧急不一致和目标误概括可能会引发不一致。最近的证据表明,一些未对准行为被编码为激活空间中的线性结构,使其可以通过转向进行处理,而安全对准已被证明主要控制前几个输出token,使后续一代不受保护。这些发现促使激活引导作为一种轻量级运行时防御,可以在整个生成过程中不断纠正未对齐的激活。我们评估了三种方法:固定系数转向(SwFC),它应用统一的附加转向,以及两种新颖的投影感知方法,转向到目标投影(StTP)和转向到镜像投影(StMP),它们使用逻辑回归决策边界仅选择性地干预激活低于分布阈值的token。使用恶意系统提示作为错位的受控代理,我们在两种威胁模型(不诚实和轻视)和两种架构(Llama-3.3-70B-Instruct、Qwen3-32B)下进行评估。所有方法都基本上恢复了目标特征(诚实和同情心),同时保持了连贯性。 StTP 和 StMP 更好地保持通用功能(MMLU、MT-Bench、AlpacaEval)并在多轮对话中产生更少的重复。