论文

在可验证的遵循指令的修订中自我偏好很弱或不存在:正版下的四模型测试

Self-Preference Is Weak or Absent in Verifiable Instruction-Following Revision: A Four-Model Test Under Genuine Authorship

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 越来越多地审查和修改文本,包括他们自己的文本。记录在案的自我偏好偏差(模型在充当法官时偏向自己这一代人)提出了一个问题:模型是否也抵制对自己写作的有效更正。我们在“有效”不是由另一个模型而是由确定性验证器决定的设置中对此进行测试:IFEval 上的指令跟踪修订。模型生成草稿;官方 IFEval 检查器确认草稿违反了约束,并且候选编辑修复了该问题;然后,模型作为真正的上下文作者或作为中立地看待草稿的新模型接受或拒绝编辑。在四个中层模型系列和 85 个作者与新模型的比较中,我们没有发现可检测到的自我偏好:作者拒绝对其自己的草稿进行验证的良好修复,其比率与判断相同草稿的新模型基本相同(差距 -5.1 pp,95% CI [-12.9,+2.7])。较小型飞行员的自我怀疑暗示并未大规模复制。一项强有力的观察是定性的:当作者确实拒绝经过验证的良好解决方案时,他们所说的 97% 的原因是为了寻找缺陷而不是偏好,即关于拒绝的特征,而不是关于拒绝率升高。在此样本量下,无法排除小于 ~13 pp 的影响。