论文

VideoTIR:通过高效工具集成推理准确理解长视频

VideoTIR: Accurate Understanding for Long Videos with Efficient Tool-Integrated Reasoning

模型训练强化学习

摘要

现有的多模态 大语言模型 (MLLM) 在长视频理解 (LVU) 中经常会出现幻觉,这主要是由于文本和视觉标记之间的不平衡。观察到 MLLM 可以很好地处理短视觉输入,最近的 LVU 工作通过自动将大量视觉数据解析为 MLLM 可以有效处理的可管理的片段来减轻幻觉。基于 SFT 的工具调用方法可以满足此目的,但它们通常需要大量细粒度、高质量的数据,并且受到工具调用轨迹的限制。我们提出了一种新颖的 VideoTIR,它利用强化学习(RL)来鼓励正确使用全面的多级工具包来实现高效的长视频理解。 VideoTIR 探索了零 RL 和 SFT 冷启动,使 MLLM 能够检索并专注于有意义的视频片段/图像/区域,从而准确有效地增强长视频理解。为了减少冗余的工具调用,我们提出了工具包行动分组策略优化(TAGPO),它通过逐步奖励分配和重用失败轨迹来提高调用过程的效率。此外,我们开发了一个基于沙箱的轨迹合成框架来生成高质量的轨迹数据。对三个长视频 QA 基准的广泛实验证明了我们方法的有效性和效率。