论文

video-SALMONN-R$^3$:学习重新观看、重新询问和重新回答以实现高效的视频理解

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

模型训练强化学习

摘要

视频 大语言模型 (LLM) 通常受到计算和内存预算的限制,导致它们使用降低的帧速率和空间分辨率,这可能会导致它们错过问答 (QA) 的关键信息。实用且有效的解决方案是两阶段范例:首先执行粗略的视频理解以定位相关片段,然后以更高的时间或空间保真度重新观看这些片段。在本文中,我们提出了视频-SALMONN-R$^3$,这是第一个端到端视频-LLM,它可以通过强化学习重新观看,而无需依赖思想链(CoT)冷启动。这种设计消除了对昂贵的 CoT 数据注释的需要,并避免了基于 CoT 的监督 微调 (SFT),否则会降低预训练的视频理解能力。为了解决重新观看引起的推理优先行为与预训练视频 LLM 的答案优先倾向之间的不匹配问题,我们提出了一种重新回答策略,其中模型首先在第一次观看时产生直接答案,然后在重新观看后对其进行细化。最后,为了提高重新观看期间问题的遵循度,我们提出了一种重新询问机制,可以在重新访问本地片段时重新注入查询。实验结果表明,video-SALMONN-R$^3$ 始终优于基本模型和 QA-SFT 基线,同时超越了之前基于重新观看的方法,且计算成本显着降低。代码、模型和数据将在接受后公开发布。