论文

SportsGrounder:用于密集体育视频推理的候选区域辅助交错视觉定位

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

上下文与知识上下文工程

摘要

体育视频分析对于体育分析和广播增强至关重要。然而,密集的体育视频推理需要对长时间背景下的大量小规模、高度交互性和视觉同质的实体(例如,穿着相同制服的球员、球)进行细粒度的理解。当前的大型多模态模型 (LMM) 本质上与如此密集的视觉复杂性作斗争。由于缺乏细粒度的视觉细节,这些模型通常过度依赖文本先验来猜测答案,特别是在区分视觉上相似的动作和玩家时。为了解决这个问题,我们提出了 SportsGrounder,这是一个利用开放词汇视觉专家来帮助交错视觉定位的框架,专门用于密集的体育视频推理。为了实现精确的空间定位,我们提取域引导对象建议并引入交错视觉定位融合(IGF)机制。 IGF 逐帧将显式边界框坐标和隐式视觉语义与全局网格特征集成在一起。这种设计保留了严格的时间对齐并防止序列长度爆炸。此外,我们设计了一个动作感知监督(AAS)模块,它直接规范模型的隐藏状态,迫使网络学习准确的运动表示,而不是依赖于语言偏差。通过混合偏好优化 (MPO) 进行优化,以更好地区分欺骗性干扰因素,我们对新策划的密集体育 VQA 数据集(源自 SoccerNet 和 FineSports)进行的广泛实验表明,SportsGrounder 显着改善了细粒度推理并实现了最先进的准确性。