论文

离线 RLHF 的高效偏好投毒攻击

Efficient Preference Poisoning Attack on Offline RLHF

模型训练偏好优化

摘要

来自人类反馈的离线强化学习 (RLHF) 管道,例如直接偏好优化 (DPO),在预先收集的偏好数据集上进行训练,这使得它们容易受到偏好中毒攻击。我们研究针对对数线性 DPO 的标签翻转攻击。我们首先说明翻转一个偏好标签会导致 DPO 梯度发生与参数无关的变化。利用这个关键属性,我们可以将目标中毒问题转换为结构化二进制稀疏逼近问题。为了解决这个问题,我们开发了两种攻击方法:二进制感知格攻击(BAL-A)和二进制匹配追踪攻击(BMP-A)。 BAL-A 将二元翻转选择问题嵌入到二元感知格中,并应用 Lenstra-Lenstra-Lovász 约简和 Babai 最近平面算法;我们提供了充分的条件来强制执行二元系数并恢复最小翻转目标。 BMP-A 使二进制匹配追踪适应我们的非标准化梯度字典,并为 $K$ 翻转预算生成基于一致性的恢复保证和鲁棒性(不可能)证书。对合成字典和斯坦福人类偏好数据集的实验验证了该理论,并强调了字典几何如何控制攻击成功。