论文

连接 SFT 和 RL:稳健推理的动态策略优化

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

模型训练强化学习

摘要

大语言模型 (LLM) 的 后训练 范式,主要是监督式 微调 (SFT) 和强化学习 (RL),面临着一个根本性的困境:SFT 提供稳定性(低方差),但存在高拟合偏差,而 RL 可以进行探索(低偏差),但要应对高梯度方差。现有的统一优化策略通常采用朴素损失加权,忽略了这些不同梯度信号之间的统计冲突。在本文中,我们对这种偏差-方差权衡进行了严格的理论分析,并提出了 \textbf{DYPO}(动态策略优化),这是一个旨在从结构上缓解这种冲突的统一框架。 DYPO 集成了三个核心组件:(1)\textit{Group Alignment Loss (GAL)},利用内在的群体动态来显着减少 RL 梯度方差; (2)一个 \textit{Multi-Teacher 蒸馏} 机制,通过不同的推理路径纠正 SFT 拟合偏差; (3)一个 \textit{动态利用-探索门控} 机制,根据奖励反馈在稳定 SFT 和探索性 RL 之间进行自适应仲裁。理论分析证实 DYPO 线性减少拟合偏差并最小化总体方差。大量实验表明,DYPO 的性能显着优于传统的顺序管道,在复杂推理基准上平均提高了 4.8%,在分布外任务上平均提高了 13.3%。我们的代码可在 https://github.com/Tocci-Zhu/DYPO 上公开获取。