论文
SoccerLens:同时评估准确率与视觉证据的足球视频理解基准
SoccerLens: Grounded Soccer Video Understanding Beyond Accuracy
摘要
视觉语言模型(VLM)最近在足球视频理解方面显示出强大的潜力。然而,考虑到足球视频由于视角变化大、镜头转换快和场景混乱而变得高度复杂,目前还不清楚 VLM 是依赖有意义的视觉证据还是利用虚假相关性和捷径学习。现有的评估协议主要关注分类准确性,不评估回答是否以视觉证据为依据。为了解决这个限制,我们引入了 SoccerLens,这是一个带视觉依据标注的足球视频理解基准。该基准测试包含涵盖13类常见足球事件的带注释视频片段,并具有组织成三个语义相关性级别的结构化视觉提示。我们进一步扩展了Chefer [arXiv:2103.15679]的归因方法来联合建模空间和时间注意力,并引入评估指标来衡量模型注意力是否与带注释的线索一致或向虚假区域漂移。我们对最先进的足球 VLM 的评估表明,尽管分类精度很高,但当前模型即使在最宽松的提示定义下也无法超过 50% 的视觉证据对应性能,并且始终未充分利用时间信息。这些结果揭示了预测性能和真实视觉证据利用之间的巨大差距,凸显了在足球等复杂时空领域进行视觉证据评估的必要性。