论文
SER:学习通过语义证据奖励来进行视频推理
SER: Learning to Ground Video Reasoning with Semantic Evidence Rewards
摘要
视频 MLLM 经常难以进行细粒度的时空推理,有时会根据不相关的帧或对象生成正确的答案。尽管在推理过程中输出时空证据是一个有前途的方向,但现有的强化学习框架通常依赖于仅几何(IoU)奖励,这可能对边界扰动敏感并忽略语义对齐。为了解决这个问题,我们提出了语义证据奖励(SER),它将时空证据定位重新表述为一项受约束的验证任务。 SER 不计算像素级重叠,而是使用裁判 VLM 作为本地检查器来跨两个维度评估模型生成的证据声明:相关性和定位质量,并结合时间惩罚。这种设计减少了对密集框注释的依赖,并能够直接对标准视频 QA 数据进行训练。在 V-STAR 基准上,SER 达到 49.6% mLGM,比强有力的证据基础 Open-o3-Video 提高了 3.0 个点,展示了其在提高答案准确性和证据基础方面的潜力。