论文

混合还是合并:面向大语言模型的多域强化学习

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

模型评测模型训练强化学习模型行为与机制分析RLVR

摘要

具有可验证奖励的强化学习(RLVR)在激发大语言模型(LLM)的显式推理能力方面发挥着关键作用。我们可以通过 RLVR 在某些特定领域(例如编码或数学)实现专家级的表现。当需要通用的多领域专家级模型时,我们需要仔细考虑RLVR跨不同领域的协作。当前最先进的模型主要采用两种不同的多域 RLVR 训练范例:混合多任务 RLVR 和单独的 RLVR,然后进行模型合并。然而,大多数著作并没有对这些范式进行详细的比较和分析。为此,我们选择多个常用的高级任务(例如数学、编码、科学和指令遵循)作为我们的目标领域,并使用开源数据集设计广泛的定性和定量实验。我们发现跨域的 RLVR 几乎没有相互干扰,推理密集型域表现出相互协同效应。此外,我们从权重空间几何、模型预测行为和信息约束的角度分析了互利的内部机制。该项目命名为M2RL,意思是混合多任务训练或单独训练,然后进行模型合并进行强化学习,主页位于https://github.com/mosAI25/M2RL

混合还是合并:面向大语言模型的多域强化学习
图4:KL 散度的交叉比较。y 轴表示专家模型所在的领域,x 轴表示为计算 KL 散度而采样轨迹的领域。每个单元格的数值表示 KL 散度。ΔPerf 表示多领域模型相对于领域专家在所采样领域上的性能变化。