论文
通过复值融合进行开放词汇视听事件定位
Open-Vocabulary Audio-Visual Event Localization via Complex-Valued Fusion
摘要
开放词汇视听事件定位 (OV-AVEL) 用事件类标记每个视频片段,包括训练期间从未见过的类。主要管道使用冻结的多模态基础模型(例如 ImageBind)将视觉帧、音频梅尔频谱图和每个候选类名称嵌入到共享空间中,然后针对每个类计算每个片段的两个余弦相似度:视觉文本和音频文本。然后,现有方法在获取 argmax 之前,使用固定规则(几何平均值、加权平均值)将此对折叠为单个标量分数。相反,我们计算复值相似度并使用复值神经网络(CVNN)学习它们的融合。每种模态的标准表示成为我们管道的实部,并且配对的伴随流提供虚部。我们使用 iHSV 的虚部作为视觉模态,使用 CycleGAN 转换的相位谱图作为音频模态作为这些伴随流。这导致了两个复杂的相似性,然后被融合。虽然视觉和音频编码器仍然存在 冻结后,仅训练时间注意力块和融合 CVNN。四流复杂架构在 OV-AVEL 基准测试中树立了新的技术水平。在 OV-AVEBench 的开放(看不见的类别)划分中,我们达到了 66.5/59.1/54.1% Acc/Seg-F1/Event-F1(比之前报告的微调基线+1.6/+4.1/+6.6),可见类别也有一致的增益。我们还为此任务修改了 AVE 数据集,并观察到我们的架构达到了 60.7/51.9/50.4% Acc/Seg-F1/Event-F1,在其上也实现了最先进的 OV-AVEL 结果。我们还提出了一种双流替代方案,它也比基线有了很大的改进。