论文
一步一步领先:通过跨步控制减轻多域强化学习中的高阶干扰
One Step, One Lead: Mitigating Higher-Order Interference in Multi-Domain Reinforcement Learning via Cross-Step Control
摘要
跨多个领域的强化学习 (RL) 可以拓宽 大语言模型 (LLM) 的推理能力,但联合训练通常会降低单个领域的性能,并可能破坏优化的稳定性。现有的工作通常使用一阶梯度对齐或基于曲率的代理从单步视图诊断此类干扰。我们表明,这种观点可能会错过顺序干扰的一种关键形式:即使连续实现的更新在输出空间中彼此部分反转,同点域梯度也可能保持几乎正交。我们进一步表明,连续的词元对数概率足迹直接从相邻检查点恢复这种交互作为输出空间中的局部二阶交互,而无需显式重建同步曲率。基于这一见解,我们提出了 OSOL,它在每次迭代时指定一个焦点域,使用前面的检查点足迹对 词元级 反弹风险进行排名,并在标准 GRPO 更新中应用漂移排名、自适应缩放校正。我们的分析表明,这种修正抑制了目标跨步输出回溯分量。对照研究进一步表明,与同点梯度诊断相比,跨步回溯与后续任务损害的相关性更强,而先前的足迹比基于 Hessian 的代理更准确地对未来的反弹风险进行排名。在 Qwen3-30B-A3B 上,OSOL 达到了 0.4822 的域宏观平均值,比最强的基线相比提高了 5.7%,且没有明显的高阶微分。