论文
范围:无需训练 通过稀疏跨模态先验交换进行视听事件感知
SCoPE: Training-Free Audio-Visual Event Perception via Sparse Cross-Modal Prior Exchange
摘要
视听事件感知 (AVEP) 确定视频中发生哪些事件、何时发生以及它们是否是可听的、可见的或两者兼而有之。 无需训练 方法通过将冻结的音频和视觉特征与文本编码的事件名称相匹配来查询新的事件词汇表。然而,相关标签共享证据。不正确的标签得分至少与正确标签一样高。我们称之为假共激活(FCA)。没有标量截止可以拒绝不正确的标签,同时保留每个正确的标签。特定于类别的阈值可能会阻止该标签成为最终预测,但 FCA 仍保留在基础分数向量中。我们引入了 SCoPE,一个 无需训练 框架,其中所有查询的标签竞争共享证据,并且每种模态指导另一种模态的事件选择。我们得出了本次竞争何时删除双标签拟合中的 FCA 的确切条件。通过 LLP 上相同的冻结 CLIP+CLAP 主干,与报告的 AV$^2$A 值相比,SCoPE 将 Type@seg 提高了 7.45 点,将 Event@seg 提高了 5.04 点。相同的固定配置不变地转移到 OV-AVEBench 和 VGGSound-AVEL100k。