论文

长篇体育视频中的时间成分推理

Towards Temporal Compositional Reasoning in Long-Form Sports Videos

模型评测基准与评测资源

摘要

体育视频对于多模态理解来说是一个具有挑战性的领域,因为它们涉及复杂且动态的人类活动。尽管多模态 大语言模型 (MLLM) 取得了快速进展,但体育视频中的长视野推理仍然很困难,因为回答问题需要定位时间稀疏的证据并将其整合到推理中。我们将这种限制归因于两个密切相关的因素:对时间分散的证据监督不足,以及缺乏需要模型来识别、定位和证明时间证据的方法。为了解决这些差距,我们引入了 SportsTime,这是一个用于长篇体育视频理解的大规模基准,包括 14K+ 开放式 QA 对和 50K+ 逐步时间证据注释。在 SportsTime 的基础上,我们提出了时间链推理 (CoTR),它将推理视为基于时间的证据合成过程。具体来说,在训练期间,CoTR 引入了时间奖励 GRPO 来鼓励基于时间的推理。在推理过程中,它采用锚定-观察-推理证据寻求循环来迭代定位、验证和组合时间证据,然后再产生最终答案。实验证明了 SportsTime 作为基准的有用性和 CoTR 的有效性,与强大的 MLLM 基线相比,CoTR 持续改进了时间组合推理和逐步基础质量。