论文

突发不忠:对齐训练如何导致语言模型默默地覆盖任务忠诚度

Emergent Unfaithfulness: How Alignment Training Causes Language Models to Silently Override Task Faithfulness

模型评测模型行为与机制分析

摘要

大语言模型具有三个关键属性:能力、对齐和忠实度。先前的工作研究了能力与一致性、能力与忠诚度之间的权衡,但第三种紧张关系仍未得到充分探索:一致性与忠诚度冲突。我们表明,对齐模型系统地偏离其对不安全或敏感内容的输入,而不披露修改,我们将这种故障模式称为对齐引起的不忠实(AIU)。与来自知识或推理错误的能力驱动的不忠不同,这是由超越对输入的遵守的后训练机制引起的。我们引入 FaithConflict,一个隔离冲突的受控数据集,以及两个互补的分类法:行为 (B1-B8) 和思想链推理 (C0-C6)。在各个模型中,AIU 随着规模的增加而增加,并且比能力驱动的不忠更加急剧,这是一种逆比例定律;中间检查点显示,这种差距在后训练被放大,在 DPO 阶段,差距增长最快,但也变得最不明显。基于提示的缓解措施并不能解决这个问题,揭示了大语言模型设计和评估中的能力-一致性-忠诚三难困境。