论文
T⁵:强化中期训练中词元级思维的双Critic训练
$T^5$: Twin-Critic Training for Token-Level Thoughts in Reinforcement Mid-Training
摘要
强化中期训练让语言模型从未标记的文本中学习内部思想,但有效的词元级信用分配仍然具有挑战性。现有的群体相关方法需要昂贵的重复生成。博学的批评家提供了单次rollout的反馈,但仅靠准确的回报预测并不能确保可靠的策略更新。我们的分析显示了训练-推理不匹配和 PPO 裁剪如何防止优势估计中的常见偏移被抵消,从而引入额外的更新漂移。我们提出 \tfour{},一种双批评方法,可以从单个生成的轨迹校准词元级别的优势。在热身和保留资格之后,批评者提供了两种优势估计,结合使用通过条件时刻鞍点目标学习到的动作相关权重。该目标使每个前缀的平均优势趋向于零,同时信号保留约束阻止校正擦除学习信号。跨文本位置共享信息可以避免对每个前缀进行重复采样。理论上,我们描述了信号保留约束下的最佳混合,并建立了残余均值引起的漂移的上限。实验表明,与最先进的无批评方法相比,\tfour{} 将平均基准性能提高了 7.8\%,并将平均训练步骤时间减少了 63.4\%。