论文
SVHighlights:迈向超长运动视频精彩片段检测
SVHighlights: Towards Extremely Long Sport Video Highlight Detection
摘要
虽然长视频的亮点检测具有非常重要的实际意义,但大多数现有方法仍然仅限于短视频内容,这很大程度上是由于缺乏合适的基准。为了弥补这一差距,据我们所知,我们引入了 SVHighlights,这是跨多个运动类别的超长体育视频中亮点检测的第一个基准,每个视频的持续时间都超过一小时。 SVHighlights 使用数据集生成管道由成对的完整长度体育视频及其相应的官方精彩视频构建而成,无需传统的每个剪辑显着性注释即可生成可扩展的标签。该基准测试由 320 个视频组成,平均时长为 2.00 小时,总计 640.18 小时,大大超过了之前的数据集。现有的方法在长视频上也面临着根本性的挑战:在短视频上训练的模型无法推广到长达一小时的内容,并且它们的剪辑级别评分缺乏识别精彩片段所需的更广泛的背景。为了解决这个问题并提供强有力的基线,我们提出了 TF-SELECTOR,这是一种基于 无需训练 分段的方法,通过合并共享相同语义内容的相邻镜头,将每个视频划分为上下文感知分段,并使用 大语言模型 和多模态输入(包括视觉字幕、文字记录和音频音量)来预测分段级显着性分数。实验表明,与视频时序定位 (VTG) 调整的基线相比,TF-SELECTOR 在大多数指标上都实现了卓越的性能,HIT@1 提高了 +2.50,HIT@K 提高了 +4.04,IoU 提高了 +2.95。这些结果使 SVHighlights 成为长格式亮点检测的具有挑战性的测试平台,并证明简单的基于片段的策略可以有效地扩展到长达一小时的视频。