论文
去噪和对齐:扩散驱动的前景知识提示开放词汇时间动作检测
Denoise and Align: Diffusion-Driven Foreground Knowledge Prompting for Open-Vocabulary Temporal Action Detection
摘要
开放词汇时间动作检测(OV-TAD)旨在对未修剪视频中未见过的类别的动作片段进行定位和分类,其中动作语义和视频表示之间的有效对齐对于准确检测至关重要。然而,现有的方法很难减轻简洁、抽象的动作标签与丰富、复杂的视频内容之间的语义不平衡,不可避免地引入语义噪声和误导性的跨模态对齐。为了应对这一挑战,我们提出了 DFAlign,这是第一个利用基于扩散的去噪来生成用于指导动作视频对齐的前景知识的框架。遵循“条件、去噪和对齐”的方式,我们首先引入语义统一条件(SUC)模块,它将动作共享和动作特定的语义统一作为扩散去噪的条件。然后,背景抑制去噪(BSD)模块通过去噪过程逐步去除视频中的背景冗余来生成前景知识。这种前景知识充当视频和文本表示之间的有效中间语义锚,缩小语义差距并增强动作相关片段的可辨别性。此外,我们引入了前景提示对齐(FPA)模块,将提取的前景知识作为提示标记注入到文本表示中,引导模型对与动作相关的片段的注意力,并实现精确的跨模态对齐。大量实验表明,我们的方法在两个 OV-TAD 基准测试中实现了最先进的性能。代码存储库提供如下:https://anonymous.4open.science/r/Code-2114/。