论文

推理可移植性:指导 RLVR 时代 MLLM 的持续学习

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era

模型训练持续学习

摘要

持续学习中的视觉语言模型(VLM-CL)旨在不断适应新的多模态任务,同时保留先验知识。将多模态 大语言模型 (MLLM) 与具有可验证奖励的强化学习 (RLVR) 相结合的新兴范例需要一种新模式来指导持续适应。现在推理能力的进步使得在推理级别施加约束成为可能。我们将可移植性形式化,这是一种样本级别的衡量方法,衡量先前策略的行为在新任务中的可重用程度,并凭经验表明,推理级别信号在分布外样本上仍然可靠,而答案级别信号则不然。我们将其实例化为推理可移植性(RP),并提出基于推理的动态平衡持续学习(RDB-CL),它根据 RP 调节 RLVR 中的每个样本 Kullback-Leibler 正则化:紧锚保留高 RP 样本上的可重用推理,而低 RP 样本上的宽松锚允许探索新的推理路径。实验表明,RDB-CL 始终优于基线,与普通 RLVR 基线相比,Last 准确率提高了 +12.0%。