论文

通过文本指导进行零样本时间动作本地化

Zero-Shot Temporal Action Localization Through Textual Guidance

上下文与知识上下文工程

摘要

零镜头时间动作定位(ZS-TAL)包括对未修剪视频中的动作进行分类和定位,其中动作类在训练时是看不见的。现有工作使用视觉和语言模型(VLM),利用其强大的零样本传输能力。然而,这些模型在细粒度的动作分类方面面临着明显的挑战,使得很难直接使用它们来区分动作的存在和不存在。当前大多数 ZS-TAL 方法通过在大规模视频数据集上训练模型来解决这些挑战,这需要带注释的数据,并且通常会导致泛化性能有限。最近,放弃使用标记数据的方法已经作为替代方案出现。沿着这个方向,我们提出了一种新颖的方法,“视频动作精细定位的文本指导”(TEGU),它通过利用从 大语言模型 导出的丰富文本信息和从字幕中提取的结构化文本来弥补训练数据监督的缺乏。这种额外的语言环境可以通过提供有关视频中细粒度动作差异的更丰富线索来改善细粒度辨别。我们通过在 THUMOS14 和 ActivityNet-v1.3 数据集上进行实验来验证所提出方法的有效性。我们的结果表明,通过利用丰富的文本信息来改进动作定位,TEGU 的性能优于不涉及训练的最先进的 ZS-TAL 方法