论文
面向多模态推理的离线-在线课程强化学习
Offline-Online Curriculum RL for Multimodal Reasoning
摘要
多模态大语言模型在推理任务上展现出能力,却常常在得到正确最终答案的同时产生有缺陷的中间步骤。这种行为损害了可解释性与可靠性,暗示其依赖虚假捷径而非忠实的推理。尽管已有工作探索步骤级监督,区分决定性步骤与冗余步骤仍然困难。我们提出O^2-CritiCuRL,一个新颖的课程强化学习框架,通过迭代的离线-在线范式引入关键步骤意识。在离线阶段,O^2-CritiCuRL对带步骤标注的轨迹进行多次rollout分析以估计步骤级重要性,使框架能够蒸馏关键推理步骤并过滤冗余步骤。在在线阶段,我们采用渐进式步骤级强化学习策略,用被截断的推理链引导模型推断缺失步骤并完善其推理,从而强化其对关键步骤的关注并克服静态监督的局限。在多模态推理基准上的大量实验表明,我们的方法在取得最先进性能的同时带来更优的训练与推理效率。代码见 https://github.com/kk0013/CritiCuRL。
