论文

多域强化学习中跨域干扰和恢复的局部扰动理论

A Local Perturbation Theory for Cross-Domain Interference and Recovery in Multi-Domain RL

模型训练强化学习

摘要

强化学习 (RL) 后训练 改进了 大语言模型 (LLM) 在数学推理、代码生成、问答和创意写作 (CW) 等各个领域的表现,但某一领域的训练通常会降低其他领域的表现。现有的基于灾难性遗忘或全局梯度冲突的解释是不完整的:即使全模型梯度接近正交,也可能发生实质性干扰。我们表明,单域强化学习会产生稀疏、小幅度的参数编辑,并且顶部变化的神经元之间的重叠较弱,而不同的域仍然共享大量的主动计算路径,更新方向决定它们是协同作用还是冲突。在这一观察的指导下,我们在多域强化学习的局部扰动模型下证明,后域训练主要通过二阶损伤项对早期域造成损害,在观察到的稀疏路径结构下,二阶损伤项集中在低维共享冲突子空间中。此外,短暂的域刷新会收缩该子空间上的有害成分,从而能够在有限的附带损害下进行选择性恢复。与理论一致,在 Code $\rightarrow$ Math $\rightarrow$ QA $\rightarrow$ CW 之后进行简短的 Re-Math 刷新将数学从 57.66 恢复到 66.04,同时在很大程度上保留了其他领域的表现,产生了 66.39 的最佳平均分数。除了刷新之外,Math-QA 对的稀疏代理冲突坐标集上的 无需训练 回滚也可以部分恢复 Math,从而为局部损坏提供直接代理级证据。这些结果提供了多域强化学习中干扰和恢复的局部机制解释。