论文
噪声消除,偏差输入:通过闭环激活控制在扩散语言模型中进行有针对性的偏差注入
Noise Out, Bias In: Targeted Bias Injection in Diffusion Language Models via Closed-Loop Activation Steering
摘要
掩蔽扩散语言模型 (dLLM) 通过迭代对掩蔽位置进行去噪来生成文本,并在提交之前多次重新预测每个token。自回归解码器在提交答案的步骤中公开一次答案的分布; dLLM在承诺之前的每个去噪步骤中都会暴露它,并且我们表明对手可以利用它。由于答案仍然可以对许多去噪步骤进行修改,因此能够访问内部激活的对手可以观察模型产生所选答案的可能性并相应地调整干预措施。基于这一观察,我们研究了有针对性的偏见注入,这是一种将冻结的 dLLM引向对手选择的人口统计答案的攻击。该攻击使用简单的比例积分 (PI) 控制器,该控制器在去噪期间跟踪目标答案概率,并动态调整转向向量的强度。对于正确答案是弃权的模糊烧烤问题,我们的攻击将 LLaDA-8B-Instruct 对目标群体的偏好从 1.8 个百分点提高到 16.7 个百分点,是最强固定强度转向基线的三倍多,而在 SocialStigmaQA 上,它将污名化答案的选择从 17.6% 提高到 58.1%。适合其他人口统计目标时,相同的攻击会使答案最多改变 37 个百分点,并且每次攻击在一个 GPU 上大约需要 40 分钟。在主要目标上,反馈是使攻击发挥作用的原因:在token提交步骤上以相同平均强度持续转向会产生小得多的偏移,同时破坏近三倍的输出,并且为每个示例单独设置的恒定强度仍然远远不够。我们的研究结果将去噪轨迹确定为 dLLM中的新控制通道,并要求进行偏差审计,检查服务堆栈而不是单独检查冻结模型。