论文
通过有效的分段视频监督增强长视频理解的本地化推理
Enhancing Localized Reasoning for Long Video Understanding via Efficient Segment-to-Video Supervision
摘要
尽管多模态 大语言模型 (MLLM) 在视频理解方面显示出令人印象深刻的潜力,但长视频理解 (LVU) 仍然具有挑战性,因为复杂而冗长的上下文中的干扰噪声可能会掩盖局部细节,从而误导 MLLM 产生错误的答案。最近的工作通过激励深度推理以包含相关证据来缓解这些问题。然而,这些方法有两个主要问题:首先,它们利用的强化 微调 框架(RFT)会产生大量的训练开销,包括高昂的注释成本和复杂的奖励设计。其次,某些方法中的自我反思和迭代感知机制会导致输出过长和推理延迟较高。为了缓解这些问题,我们提出了一种新颖的分段到视频监督方法(S2V)来有效增强 LVU 中的细粒度推理。具体来说,我们基于局部片段生成问题答案对(VQA),然后将这些基于片段的 VQA 传输回整个视频进行训练。由于关注短片段,基于片段的 VQA 自然可以注意到从整个视频角度来看容易被忽视的细节。对此类数据进行训练可以强制 MLLM 正确地将细粒度细节与 QA 相关联,同时避免整个视频中分散注意力的噪音。 S2V 训练仅涉及强化学习 (RL),并具有仅基于 10K VQA 样本的简单准确性奖励,并且生成的 S2V 模型使用具有有限输出标记的单个前向传递来预测答案。实验结果表明,S2V 可以在多个 LVU 基准上持续提高 LVU 性能,不仅在 LVU 准确性方面而且在训练和推理效率方面都优于通用 MLLM 和基于推理的方法。