论文
推理作为交叉点:视频 MLLM 中视觉焦点的共识框架对齐
Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs
摘要
强化学习提高了 大语言模型 的推理能力,但将仅结果奖励应用于视频多模态 大语言模型(视频-MLLM)对于视觉证据应该支持答案提供了有限的指导。受多感官整合的启发,一致的线索可以增强感知估计的显着性和可靠性,我们引入了共识框架 GRPO (CF-GRPO),这是一种用于证据感知视频推理的无时间注释的过程级奖励框架。 CF-GRPO 根据内在视频线索构建共识框架,包括时间覆盖、场景转换线索和查询条件视觉相关性。然后,它根据视觉和响应表示计算模型端框架使用得分,并通过共识框架奖励 (CFR) 优化它们的一致性。通过显着性感知的稀疏聚合和分布锐化,CFR 可以提供高对比度奖励信号,而无需人工时间注释。实验表明,VideoCFR 在复杂的视频推理基准测试中实现了具有竞争力的性能,并改进了代表性 Video-MLLM 和 RL 基线的多个指标,而共识先验提供了训练期间强调的证据框架的可解释视图。该实现可在 https://github.com/1Pansy/VideoCFR 获取。