论文

通过结构化奖励加强视频 MLLM 的一致性

Reinforcing Consistency in Video MLLMs with Structured Rewards

模型训练强化学习

摘要

多模态 大语言模型 (MLLM) 在视频理解方面取得了显着进展。然而,看似合理的输出通常会受到视觉和时间基础较差的影响:模型可能会捏造对象存在、分配不正确的属性或折叠重复事件,同时仍然产生全局合理的视频描述或答案。我们通过成分一致性审核来研究这种失败模式,该审核将视频描述分解为支持事实和时间的主张,调查正确的高级预测是否实际上得到有效的低级证据的支持。我们自上而下的审计表明,即使是正确的根关系声明也常常缺乏可靠的属性和存在支持。这表明标准的句子级监督是忠实视频理解的弱代表。此外,当转向强化学习(RL)以实现更好的对齐时,标准句子级奖励往往过于粗糙,无法准确定位特定的视觉与时间依据错误。为了解决这个问题,我们用由事实和时间单元构建的结构化奖励取代了通用的句子级奖励。我们的训练目标整合了三个互补的组成部分:(1)针对事实对象、属性和关系的实例感知场景图奖励; (2) 对事件排序和重复的时间奖励; (3) 基于视频的 VQA 奖励,用于分层自我验证。在时间、一般视频理解和面向幻觉的基准测试中,这一目标在开源主干上产生了一致的收益。这些结果表明,结构化奖励塑造是更忠实地理解视频的实用途径。