论文

LLM 中强化有效自我修正的阶梯推理

Reinforcing Step-level Reasoning for Effective Self-Correction in LLMs

模型训练偏好优化

摘要

实现有效的自我纠正,即模型验证并纠正自己的错误,仍然是 大语言模型 (LLM) 的基本挑战。在这项工作中,我们提出了 Self-Fix Step-DPO (SFS-DPO),这是一种基于强化学习的两阶段框架,用于步骤级自我验证和自我纠正。第一阶段通过步骤级偏好优化加强步骤级推理,而第二阶段明确训练模型进行自我验证和自我纠正。我们进一步介绍了一种教师辅助的变体,SFS-DPO-R,它结合了错误验证的解释性原理,以提供更强的纠正信号。跨多个 LLM 的全面域内和域外评估表明,SFS-DPO 和 SFS-DPO-R 始终优于先前的步骤级训练基线。我们的分析进一步揭示了自我纠正频率和有效性的改进,强调了加强步骤级推理对于稳健性能的重要性。