论文

面向多模态推理的离线-在线课程强化学习

Offline-Online Curriculum RL for Multimodal Reasoning

模型训练强化学习

摘要

多模态大语言模型在推理任务上展现出能力,却常常在得到正确最终答案的同时产生有缺陷的中间步骤。这种行为损害了可解释性与可靠性,暗示其依赖虚假捷径而非忠实的推理。尽管已有工作探索步骤级监督,区分决定性步骤与冗余步骤仍然困难。我们提出O^2-CritiCuRL,一个新颖的课程强化学习框架,通过迭代的离线-在线范式引入关键步骤意识。在离线阶段,O^2-CritiCuRL对带步骤标注的轨迹进行多次rollout分析以估计步骤级重要性,使框架能够蒸馏关键推理步骤并过滤冗余步骤。在在线阶段,我们采用渐进式步骤级强化学习策略,用被截断的推理链引导模型推断缺失步骤并完善其推理,从而强化其对关键步骤的关注并克服静态监督的局限。在多模态推理基准上的大量实验表明,我们的方法在取得最先进性能的同时带来更优的训练与推理效率。代码见 https://github.com/kk0013/CritiCuRL。

面向多模态推理的离线-在线课程强化学习:论文配图
图 1:数学推理问题模型的比较。由于不正确的中间假设,具有答案级监督的 Vision-R1 未能得出正确的答案。 R1-VL监督每一个推理步骤,并可能得出正确的最终答案,但仍然遵循部分有缺陷的推理路径。相比之下,我们的 O2-CritiCuRL 识别并强调关键推理步骤,使模型能够学习准确、简洁且值得信赖的推理路径。