论文
EvoVid:视频的以时间为中心的自我进化 大语言模型
EvoVid: Temporal-Centric Self-Evolution for Video Large Language Models
摘要
最近的视频大语言模型(Video-LLM)通过强化学习(RL)展示了强大的视频推理能力。然而,现有的强化学习管道严重依赖人工注释的任务和解决方案,这使得它们的扩展成本高昂,并且从根本上受到人类专业知识的限制。最近,通过自主提问者-解决者自我博弈,自我进化框架成为一种有前途的替代方案。不幸的是,这些方法主要是针对静态模式(例如文本和图像)而设计的,从根本上无法捕获视频推理的核心时间动态。在这项工作中,我们提出了 $\textbf{EvoVid}$,一个以时间为中心的自我进化框架,使 Video-LLM 能够直接从原始的、未注释的视频中进行改进。具体来说,我们引入了两种互补的以时间为中心的奖励:时间感知的发问者奖励,通过时间扰动敏感性鼓励时间相关的问题生成,以及基于时间的求解器奖励,通过固有的视频片段定位提供自动时间监督。跨越四个基本模型和六个基准的广泛实验表明,基本模型和现有的自我进化基线都得到了一致的改进,通过监督方法实现了有竞争力的性能。这些结果凸显了以时间为中心的自我进化作为视频理解和推理的有效且可扩展的范例。