论文

奖励错位:LLM 中社会上不受欢迎的偏好

Misaligned by Reward: Socially Undesirable Preferences in LLMs

模型评测安全与风险评测

摘要

奖励模型是 大语言模型 对齐的关键组成部分,在训练期间充当人类偏好的代理。然而,现有的评估主要集中在广泛的指令遵循基准上,对这些模型是否捕获了社会期望的偏好提供了有限的洞察。因此,社会协调方面的重大失败可能会被隐藏起来。我们将奖励模型基准扩展到四个具有社会影响的领域:偏见、安全、道德和伦理推理。我们引入了一个框架,可将社会评价数据集转换为成对偏好数据,在可用的情况下利用黄金标签,否则利用方向偏差指标。这使我们能够测试奖励模型是否更喜欢社会上不受欢迎的反应,以及它们的偏好是否会在选定的输出上产生系统性的偏差分布。在五个公开可用的奖励模型和两个用作奖励代理的指令调整模型中,我们发现跨领域存在巨大差异,没有一个模型总体表现最佳。这些模型远远缺乏强大的社会智能:它们通常更喜欢社会上不受欢迎的选项,并且它们的偏好会产生系统性的偏差分布。此外,更强的偏见避免可以降低对上下文的敏感度,揭示避免有偏见的结果和保留上下文 忠实性 之间的关键平衡权衡。这些发现表明,标准奖励基准不足以评估社会一致性,并强调需要直接衡量奖励模型中编码的社会偏好进行评估。