论文

超越单摄像头:体育视频理解中的代理多视图推理

Beyond the Single Camera: Agentic Multi-View Reasoning in Sports Video Understanding

模型评测基准与评测资源

摘要

最近的多模态 大语言模型 (MLLM) 在单视图视频理解基准上取得了出色的性能。然而,体育视频涉及密集遮挡、快速运动和复杂交互,很难从单一视点解决。在实践中,体育赛事是从多个摄像机角度记录的,为裁判员提供补充证据。然而,现有的基准还没有评估 MLLM 的多视图体育视频理解能力。为了解决这一差距,我们推出了 SportMV-Bench,这是一个根据官方比赛录音构建的综合基准测试,通过一个专用管道结合了基于 LLM 的生成、基于 MLLM 的验证和人工过滤,以确保质量和一致性。 SportMV-Bench 包含 1022 个多视图视频包和 3015 个问答对,涵盖 10 项运动,涵盖三个类别:感知感知识别 (PAR)、规则感知事件解释 (REI) 和裁决决策推理 (ADR)。我们的分析表明,当前的 MLLM 无法有效地利用多视图信息,其瓶颈在于细粒度的视觉感知和视图选择,而不是逻辑推理或领域知识。我们提出了 SportMV-Agent,这是一个代理框架,它协调主动视图选择、感知工具执行和循证推理的迭代循环,与最强的 MLLM 基线相比,实现了 15.61% 的显着相对改进。