论文

限制DPO间隔增长,缓解后训练后的高置信度幻觉

The Alignment Paradox: How Post-Training Amplifies Confident Hallucinations in Language Models

模型训练模型评测偏好优化模型行为与机制分析

摘要

大语言模型 (LLM) 可能会以高置信度生成实际上不正确的答案,从而破坏其可靠性并限制基于不确定性的错误检测的有效性。虽然之前的研究将自信幻觉归因于训练数据中知识缺失、推理错误或随机解码等因素,但我们发现训练后对齐本身是这些错误的主要驱动因素,我们将这种现象称为 对齐悖论。在基于事实基准评估的五个模型系列中,未对齐的基本模型在长尾事实查询上几乎不会产生高置信度错误,而指令调整模型则将高置信度错误 ($p \ge 0.95$) 增加了一个数量级以上(10$\times$ 到 35$\times$)。使用 Logit Lens 进行的逐层探测表明,这种过度自信出现在后期层中,在早期层和中间层中,错误答案裕度在保持接近零的情况下扩大到超过 4.0 点。这些发现促使限制后训练的利润增长。我们通过直接偏好优化(DPO)中的熵相关边际界限来实现这一原则。在 Mistral-7B 的多历元实验中,相对于标准 DPO,有界目标将高置信度错误降低了 35.3%,同时保持了评估的通用推理基准的性能。这些结果表明,有界边缘减轻了训练后的自信幻觉。