论文
强化学习,选择推理:视频推理的双重范式
Reinforce to Learn, Elect to Reason: A Dual Paradigm for Video Reasoning
摘要
视频推理随着大型多模态模型 (LMM) 的发展而进步,但它们的推理通常是单次传递,返回答案而不验证推理是否与证据一致。我们引入了强化学习、选择理性(RLER),这是一种双重范式,它将学习以产生证据与获得可靠答案脱钩。在 RLER-Training 中,我们通过群体相关强化学习 (RL) 和 3 种新颖的任务驱动奖励来优化策略:帧敏感奖励在显式关键帧上进行推理,Think-transparency 奖励形成可读和可解析的推理轨迹,Anti-repetition 奖励提高信息密度。这些信号教导模型发出结构化的、机器可检查的证据并增强推理能力。在 RLER-Inference 中,我们应用一个无需训练的协调器,生成一小组不同的候选者,解析他们的答案和引用的框架,通过证据一致性、置信度、透明度和非冗余对其进行评分,然后执行强大的证据加权选举。这闭合了产生和使用证据之间的循环,在不扩大模型的情况下提高了可靠性和可解释性。我们在 8 个代表性基准上针对各种开源和基于 RL 的 LMM 全面评估 RLER。 RLER 在所有基准测试中都达到了最先进的水平,并且比基本模型平均提高了 6.3%,同时每个问题平均使用 3.1 个候选者,这表明计算和质量之间取得了良好的平衡。结果支持一个简单的论点:在学习过程中明确证据并在推理过程中根据证据进行选择是实现值得信赖的视频推理的可靠途径。