论文

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

模型训练强化学习

摘要

大型推理模型 (LRM) 通过在最终答案之前生成明确的思维轨迹来提高语言模型的能力。在面向事实的问答(QA)中,这种思维通常通过帮助模型恢复相关知识并完善其答案来提高整体性能。然而,我们发现这种好处在实例层面并不统一:显式思维也可能推翻正确的非思维答案并导致事实漂移。我们将这种故障模式称为\emph{思维引起的幻觉}。为了解释这种现象,我们将事实性 QA 中的显式思维表述为模型直接答案倾向的思维残差,它可以恢复缺失的知识或引入不受支持的关联。基于这个公式,我们提出了 MARGO,\underline{\textit{M}}固定模式 \underline{\textit{A}}dvantage \underline{\textit{R}}regularization for \underline{\textit{G}}rounded \underline{\textit{O}}ptimization,这是一种强化学习框架,在优势估计中使用非思考模式执行轨迹作为相同模型参考。通过构建具有思维和非思维轨迹的混合模式轨迹组,MARGO 评估外显思维是否会在直接回答之外增加事实价值,从而抑制容易产生幻觉的思维,同时保留有益的思维行为。跨多个面向事实的 QA 基准的实验表明,MARGO 比强基准提高了事实可靠性,而对数学基准的评估表明它保留了一般推理能力。