论文
不要暂停!每个预测在流媒体视频中都很重要
Don't Pause! Every prediction matters in a streaming video
摘要
流视频模型应该在事件发生时做出响应,而不是在事件过去之后做出响应。然而,现有的在线 VideoQA 基准在很大程度上仍然是回顾性的。他们在固定的时间戳暂停视频,提出有关当前或过去事件的问题,并仅在这些时刻对模型进行评分。该协议使流预测未经测试。为了弥补这一差距,我们引入了 SPOT-Bench,它具有多轮主动查询功能,可评估始终在线的实时助手所需的一般流感知和辅助功能。 SPOT-Bench 配备了 Timeiness-F1,这是一种综合指标,可通过整个视频的时间精度和平衡覆盖范围来衡量流预测。我们的基准测试表明:(i)离线模型可以可靠地检测事件,但垃圾邮件预测会自动进行; (ii) 后训练 表示静音,可减少垃圾邮件发送,但会导致无响应; (iii) 一半的流视频预计没有响应,我们将其称为死区时间 - 这里花费的计算不会影响响应延迟。这些发现激发了 AsynKV 的发展,AsynKV 是离线模型的 无需训练 流式改编,它保留了事件感知,同时改进了流式传输行为。 AsynKV 具有长期短期内存,可通过在死区期间扩展计算来有效利用。它作为 SPOT-Bench 的强大基准,优于现有的流模型,并在回顾性基准测试中达到了最先进的水平。