论文

通过零失配参考诊断 LLM 强化学习中的训练推理失配

Diagnosing Training Inference Mismatch in LLM Reinforcement Learning via a Zero-Mismatch Reference

模型训练强化学习

摘要

现代 LLM RL 系统将采样轨迹生成与策略优化分开。这两个阶段预计会产生完全匹配的词元概率。然而,实现差异可能会使它们在相同模型权重下为同一序列分配不同的值,从而导致训练-推理不匹配(TIM)。 TIM 很难检查,因为它与 离策略 漂移和常见稳定机制纠缠在一起。在这项工作中,我们在零失配诊断设置 (VeXact) 中隔离 TIM,并表明小的 词元级 数值不一致可以独立导致训练崩溃。我们进一步表明,TIM 改变了有效的优化问题,并确定了一组可以缓解 TIM 的补救措施。我们的结果表明,TIM 不是良性数值噪声,而是一种系统级扰动,在分析 LLM RL 稳定性时应将其视为一阶因素。