模型应该以多快的速度进行监督?在 Tsallis 损失连续体上训练推理模型
How Fast Should a Model Commit to Supervision? Training Reasoning Models on the Tsallis Loss Continuum
摘要
SFT-then-RLVR 广泛用于 后训练 推理模型,但是为什么这种特定的顺序,以及为什么仅 RLVR 在冷启动时停止,缺乏统一的理论解释。我们使用 Tsallis $q$ 对数在统一损失系列 $J_Q$ 下提供该账户。 $J_Q$ 是一个单参数族,在 RLVR(在 $q{=}0$ 处,\textit{利用极点})和潜在轨迹上的对数边际似然(在 $q{=}1$ 处,\textit{密度估计极})之间进行插值,在该族下,标准管道对应于逐步的 $q{=}1 \to 0$ 计划。所有成员共享相同的每个示例梯度方向,仅在每个实例放大 $P_θ^{-q}$ 上有所不同,该放大独立于学习率重新加权每个实例。在梯度流分析下,我们表明利用极点需要 $Ω(\frac{1}{p_0})$ 时间来逃避冷启动,但对标签噪声具有鲁棒性,而密度估计极点在 $θ\big(\log(\frac{1}{p_0})\big)$ 中逃脱,但会记住标签噪声。这种分离解释了 SFT ($q{=}1$) 如何首先将模型移出冷启动状态,然后在 SFT-then-RLVR 范式下实现更稳健的 RLVR ($q{=}0$)。我们进一步推导了两个蒙特卡洛估计器,它们直接优化 $J_Q$ 连续体上的固定 $q$,没有注释的基本原理:梯度放大 RL (GARL) 和后验衰减 微调 (PAFT),具有共享偏差 $O\big(\frac{q}{M P_θ^q}\big)$,但方差和稳定性属性不同。在 FinQA、HotPotQA 和 MuSiQue 上,足够高的 $q$ 的 GARL 大大减轻了冷启动停滞,避免了 GRPO 完全失败的冷启动。在热启动中,$q$ 较低的 GARL 在训练稳定的情况下主导了 FinQA;在 HotPotQA 和 MuSiQue 上,GARL 不稳定,而 PAFT 的 $q{=}0.75$ 保持稳定,在 HotPotQA 上达到 $47.9$ \texttt{m@16} (比 GRPO 多 $+13.9$)。