论文
混合还是合并:面向大语言模型的多域强化学习
To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models
摘要
具有可验证奖励的强化学习(RLVR)在激发大语言模型(LLM)的显式推理能力方面发挥着关键作用。我们可以通过 RLVR 在某些特定领域(例如编码或数学)实现专家级的表现。当需要通用的多领域专家级模型时,我们需要仔细考虑RLVR跨不同领域的协作。当前最先进的模型主要采用两种不同的多域 RLVR 训练范例:混合多任务 RLVR 和单独的 RLVR,然后进行模型合并。然而,大多数著作并没有对这些范式进行详细的比较和分析。为此,我们选择多个常用的高级任务(例如数学、编码、科学和指令遵循)作为我们的目标领域,并使用开源数据集设计广泛的定性和定量实验。我们发现跨域的 RLVR 几乎没有相互干扰,推理密集型域表现出相互协同效应。此外,我们从权重空间几何、模型预测行为和信息约束的角度分析了互利的内部机制。该项目命名为M2RL,意思是混合多任务训练或单独训练,然后进行模型合并进行强化学习,主页位于https://github.com/mosAI25/M2RL
