论文

面向通用推理的可迁移性:多域RLVR的自动化课程

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR

模型训练强化学习RLVR

摘要

可验证奖励强化学习(RLVR)已从单域训练扩展到横跨数学、编程与科学的多域推理套件。但训练课程(每域被采样的频率)通常固定或手工调优——尽管推理技能跨域迁移不均。既有的基于可学性的课程适应当前策略正在改进之处——但对所选域上的梯度步是否惠及其余域视而不见。本文提出迁移感知课程(TAC)——赌徒式在线课程——优先选择其更新能广泛惠及训练套件其余部分的域。TAC复用RL训练已产生的信号:逐域优势捕捉局部可学性——而从正在计算的GRPO步取出的投影梯度经梯度几何对齐估计跨域可迁移性——成本可忽略(<1%墙钟开销)。跨六域推理套件——TAC在Qwen3-1.7B与Llama3.2-3B上都取得最佳宏平均准确率——超越按比例随机采样、手工设计日程与仅可学性赌徒——较最后者最高提升2.8分(相对10%)。消融显示移除可迁移性项后性能急剧退化——且TAC在不均衡训练混合上保持鲁棒——而仅可学性课程会过度投入主导域。我们的发现确立跨域可迁移性为多域RLVR课程设计的关键信号。

面向通用推理的可迁移性:多域RLVR的自动化课程:论文配图
(a) 跨域转移矩阵。(b) TAC 与基线和先前工作选择信号。图 1:(a) 每个单元格显示在单个源域(1,000 个查询,两个时期)上进行 RL 训练后目标域上的准确度增益 (pp)。非对角线传输因来源而异。下面几行显示 TAC 在所有六个域中均优于随机。 (b) TAC 将可学习性信号与梯度余弦可转移性信号相结合,捕获域上的更新是否与其他域的更新一致,并通过单个系数 β\beta 混合到每臂分数中。