论文
提示激活二元性:通过注意力水平干预改善激活引导
Prompt-Activation Duality: Improving Activation Steering via Attention-Level Interventions
摘要
激活转向通过在推理时向内部表示添加方向来控制语言模型行为,但标准残差流转向在有状态对话中可能会失败。我们将 KV 缓存污染视为一种关键的故障模式:存储并重复使用受控词元状态,将局部扰动转化为累积的一致性退化。为了应对这一挑战,我们提出了门控裁剪注意力增量转向(GCAD),它从系统提示对自注意力的贡献中提取转向信号,并将其应用于 词元级 门控。在角色引导实验中,GCAD 保留了特征控制,同时大幅提高了长期一致性。在主要的多轮基准上,GCAD 将平均相干漂移从 -18.6 提高到 -1.9,并将第 10 轮特征表达从 78.0 提高到 93.1。这些结果表明,当干预遵循模型已经用于行为控制的提示介导途径时,激活引导变得更加可靠。