论文

OZ-TAL:在线零样本时间动作定位

OZ-TAL: Online Zero-Shot Temporal Action Localization

应用与实践视觉感知与空间理解

摘要

在线时间动作定位(On-TAL)旨在在未修剪的流媒体视频完成后立即检测动作的发生时间和类别。该领域的最新进展侧重于开发更复杂的框架,从基于在线动作检测(OAD)的聚合范式转向实例级理解。然而,现有的方法通常是在特定领域进行训练的,并且当应用于任意视频时,特别是在存在以前未见过的动作的情况下,通常表现出有限的泛化能力。在本文中,我们介绍了一项称为在线零样本时间动作定位(OZ-TAL)的新任务,其旨在以在线方式检测以前未见过的动作。此外,我们提出了一个 无需训练 框架,该框架利用现成的视觉语言模型(VLM),同时引入额外的机制来增强视觉表示并减轻其固有偏差。我们在 THUMOS14 和 ActivityNet-1.3 上为 OZ-TAL 建立了新的基准和代表性基线,并且广泛的实验表明,我们的方法在离线和在线零样本设置下都大大优于现有的最先进方法。