论文
面向通用推理的可迁移性:多域RLVR的自动化课程
Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR
摘要
可验证奖励强化学习(RLVR)已从单域训练扩展到横跨数学、编程与科学的多域推理套件。但训练课程(每域被采样的频率)通常固定或手工调优——尽管推理技能跨域迁移不均。既有的基于可学性的课程适应当前策略正在改进之处——但对所选域上的梯度步是否惠及其余域视而不见。本文提出迁移感知课程(TAC)——赌徒式在线课程——优先选择其更新能广泛惠及训练套件其余部分的域。TAC复用RL训练已产生的信号:逐域优势捕捉局部可学性——而从正在计算的GRPO步取出的投影梯度经梯度几何对齐估计跨域可迁移性——成本可忽略(<1%墙钟开销)。跨六域推理套件——TAC在Qwen3-1.7B与Llama3.2-3B上都取得最佳宏平均准确率——超越按比例随机采样、手工设计日程与仅可学性赌徒——较最后者最高提升2.8分(相对10%)。消融显示移除可迁移性项后性能急剧退化——且TAC在不均衡训练混合上保持鲁棒——而仅可学性课程会过度投入主导域。我们的发现确立跨域可迁移性为多域RLVR课程设计的关键信号。
