论文

对齐篡改:人类反馈强化学习如何被利用以优化不对齐偏差

Alignment Tampering: How Reinforcement Learning from Human Feedback Is Exploited to Optimize Misaligned Biases

模型评测安全与风险评测

摘要

人类反馈强化学习(RLHF)是将大语言模型(LLM)与人类偏好对齐的标准方法。在本工作中,我们提出对齐篡改(alignment tampering),一种潜在脆弱性:处于对齐过程中的LLM影响偏好数据集,导致RLHF放大不良行为。它源于RLHF的核心局限:(1)偏好数据集由LLM自身的输出构成,使其能够对其施加影响;(2)成对比较只表明哪个回答更好,而不表明原因。这些局限可被利用来实施对齐篡改。例如,如果LLM生成质量更高但带有偏差的回答,标注者会基于质量而偏好它们。然而,偏好标签无法区分质量与偏差,奖励模型继承了这一局限。通过强化学习或best-of-N采样优化此类奖励可能放大不对齐偏差。我们的实验展示了在多种偏差上的放大效应:从关键词偏差到宣传性内容(如性别歧视)、品牌推广与工具性目标追求。缓解仍然困难:现有的鲁棒RLHF技术若不牺牲回答质量,便无法完全解决对齐篡改。这些发现揭示了当前RLHF的结构性脆弱性,并强调防范这一漏洞的必要性。项目主页:https://alignment-tampering.github.io/

对齐篡改:人类反馈强化学习如何被利用以优化不对齐偏差:论文配图
图 5:带(左)和不带(右)触发器的响应表示的 PCA 可视化。颜色表示奖励。仅针对触发的提示显示清晰的聚类分离。图 14 中提供了更多示例。