论文

GAPS:条件激活控制的维度级门

GAPS: Dimension-Level Gates for Conditional Activation Steering

模型推理解码与生成控制

摘要

激活引导通过在生成过程中向隐藏状态添加引导向量来抑制语言模型中的不良行为。最近的条件方法(例如 CAST 和 DSAS)通过决定何时进行干预来改善行为能力权衡,但一旦激活,它们就会将全稠密向量应用于所有隐藏维度,无论神经元是否携带概念信息或已经位于所需状态。我们引入维度水平调节作为选择性的补充轴,它也决定了要干预哪些神经元。我们的方法 GAPS(通过后验和可分离性的门控激活控制)结合了两个 无需训练 门:一个静态可分离性门,限制对具有统计上可靠的概念信息(通过 AUROC)的神经元的控制;以及一个动态后门,仅当当前激活可以通过高斯模型下的不需要的概念更好地解释时才控制神经元。这些门为每个词元增加了 O(D) 开销,并且它们插入到现有的条件方法中。在使用 Gemma-3 (4B) 和 Qwen-3 (1.7B) 进行毒性缓解 (RealToxicityPrompts) 和概念去除 (OneSeC) 方面,GAPS 始终匹配或改进了其 词元级 对应物的 Pareto 前沿;在固定能力预算下,DSAS+GAPS 将 Gemma-3 的毒性率从 6.52% 降低至 0.48%,而单独使用 DSAS 时为 3.52%。消融将大部分增益归因于后门。