论文
跨领域整合 RLVR 功能:深入探讨融合范式
Consolidating RLVR Capabilities Across Domains: A Deep Dive into Fusion Paradigms
摘要
具有可验证奖励的强化学习(RLVR)提高了 大语言模型 的特定功能,但覆盖多种功能通常需要训练单独的领域专家并随后对其进行整合。我们根据它们重用的工件组织了三种融合范例:合并组合专家任务向量,混合 RL 池其数据集,以及多教师 同策略 蒸馏 (MOPD) 使用两者。由于它们在很大程度上是孤立研究的,因此如何比较它们以及如何在它们之间进行选择仍然不清楚。我们使用跨模型规模的共享专家和数据以及多领域基准套件对这三者进行比较。尽管它们的平均性能最多相差 1.4 分,但在单个基准测试中差距达到 8.6 分,域级变化跟踪任务向量几何中可见的跨域关系。训练动态暴露出不同的约束:Mix RL 取决于域混合比例,MOPD 仍然受到其教师的限制,而 Merge 将所有专家更新压缩为一个。这三者都提高了单样本精度,但解决方案覆盖范围没有明显增加,保留能力也没有损失。这些结果产生了一个实用的指导方针:当专家已经存在且廉价的融合至关重要时使用 Merge;在没有专家的情况下训练统一模型时混合强化学习,并调整域比例以进行跨域传输;和 MOPD 时,保留特定领域的收益比超越教师或最小化端到端成本更重要。