论文
提示、探测、训练还是注释?业余环境下的单摄像头体育视频理解
Prompt, Probe, Train, or Annotate? Single-camera sports video understanding in amateur settings
摘要
视频理解通常以策划的、单演员或专业拍摄的剪辑为基准,并且那里的高分通常被视为模型足够强大以进行部署的证据。业余团队运动是一个有用的、基本上未经测试的地方来检验这一假设:仅在 2024-25 年,美国就有超过 800 万学生参加了学校运动,几乎没有一个运动是由多个固定摄像机拍摄的,几个候选演员挤在画面中,没有操作员或第二个角度可以依靠。使用排球作为测试案例,我们询问一旦镜头如此混乱,一般视频和世界模型基准上的强劲表现是否会转化为可靠的、每个玩家的归因,通过从寻找比赛边界到命名谁做了什么的一系列任务将镜头转化为统计数据。我们在每个阶段评估了四种方法(对前沿视觉语言模型的提示和代理推理、由小型训练有素的专家进行的经典计算机视觉、自我监督的视频世界模型和手动注释),在 66 场业余比赛中与 46,648 个人类标记的联系人进行了拍摄,这些比赛是在没有发布基准使用的条件下拍摄的。没有任何单一范式能够赢得每个阶段,并且静态、单帧计算机视觉在涉及运动或身份的任何阶段都没有竞争力。提示模型片段匹配得很好,但一个小得多的训练模型在发现接触方面比它要好,而且成本只是它的一小部分,而且这项运动自己的规则可以恢复像素无法恢复的拉力赛结果。身份是每个自动化方法都面临的难题:球衣号码是一个静态事实,时间推理如果不可见就无法恢复,与体育运动不同,时间模型可以利用重复的运动模式,这就是为什么整体推理可以在身份保持不变的情况下改善事件检测。最后我们将讨论每种方法的成本所在,以及从排球到业余运动的影响。