论文

PlurPO:多元偏好优化缓解社交谄媚

Mitigating Social Sycophancy via Pluralistic Preference Optimization

模型训练偏好优化

摘要

个人建议(包括感情建议)已位居生成式AI最常见用途之列。但语言模型存在谄媚:它们肯定用户的频率远高于人类,这会让人过度自信、更不愿在冲突后修复关系。既往缓解谄媚的工作聚焦于可对照真核验答案的事实性场景;对社交谄媚(如无真值的个人建议)的缓解则依赖效果有限的简单提示与后训练。我们的洞见是:社交谄媚部分源于模型过度以用户为中心、未能考虑被用户行为影响的其他利益相关者的视角。为此我们提出多元偏好优化(PlurPO):给定描述人际冲突的输入,模型识别并模拟相关利益相关者,然后训练其偏好并生成所有利益相关者都可接受的响应。PlurPO只使用模型对自身输出的信号,无需真值标注。相比既有方法,PlurPO在四个数据集与四个模型族上大幅降低社交谄媚:在用户行为不应被背书的伤害意图陈述上,PlurPO把背书率在四模型上平均降低89%;在以匹配人类背书率为目标的一般建议问题上,把差距收窄过半(平均17.8%至8.0%)。PlurPO为8B模型构建的偏好数据集还能有效迁移以缓解更大(32B)模型的谄媚。