论文
超越遗忘:在持续 RLVR 中诊断和利用共享推理
Beyond Forgetting: Diagnosing and Harnessing Shared Reasoning in Continual RLVR
摘要
具有可验证奖励的强化学习 (RLVR) 通常会在多个任务上训练推理模型,而在添加新任务时重新运行多任务 RLVR (MTRL) 会使能力扩展成本高昂。因此,我们研究了连续 RLVR,它会在每个任务到达时更新现有模型。核心问题是,以这种方式更新的模型是否可以像联合训练的模型一样执行。为了回答这个问题,我们引入了 Continual Reasoning Gym,这是一个连续的 RLVR 环境,它将文本和视觉推理任务组织成五个任务序列。在这种情况下,我们发现了两个关键的观察结果: 顺序 RLVR 表现出适度的遗忘,但其最终性能仍然低于 MTRL。为了理解后者,我们分解了最终的表现,并表明遗忘只是差距的一部分。为了解释前者,我们确定了共享推理:可转移推理结构允许对一项任务进行训练以平均支持其他任务。因此,我们引入了持续提示重放(CPR),它利用共享推理,通过重放先前的任务提示并使用当前策略重新生成其响应来改善对即将到来的任务和未来任务的学习。平均而言,只有 CPR 达到 MTRL 水平。