论文

通过对比偏好优化与中性数据进行阿谀奉承的协议传输

Sycophantic Agreement Transfers with Neutral Data via Contrastive Preference Optimization

模型评测模型行为与机制分析

摘要

阿谀奉承是指语言模型过度肯定用户的行为,通常以牺牲事实准确性为代价。尽管阿谀奉承是众所周知的模型对齐失败,但对其如何从 模型训练 中出现的了解有限。在这项工作中,我们证明了阿谀一致可能是广泛使用的对比偏好优化目标的意外结果。使用 OLMo 3 后训练 管道,我们表明,对于三个家庭的各种教师模型对,教师模型阿谀一致率的对数比与由此产生的学生模型阿谀一致率之间存在很强的相关性。我们进一步证明,这种意外转移不仅限于 DPO,还发生在其他 6 个偏好优化目标中。为了了解这种效果是否可以归因于特定的训练示例,我们分析了偏好数据,发现阿谀奉承信号分散在整个数据集中,而不是集中在稀疏的示例集中:每个示例都显得中立,即没有明确的阿谀奉承实例,并且基于探针的数据归因或 logits 线性选择的过滤无法在不删除大部分数据集的情况下减轻阿谀奉承。总体而言,我们的研究结果表明,用于生成偏好数据的教师模型可以以意想不到的方式与一致性训练目标相互作用,从而推广到不良且潜在有害的行为,例如阿谀奉承。