论文

用于开放词汇视听语义分割的声学基础成本学习

Acoustically Grounded Cost Learning for Open-Vocabulary Audio-Visual Semantic Segmentation

应用与实践视觉感知与空间理解

摘要

开放词汇视听语义分割 (OV-AVSS) 旨在对一组开放类别中的发声对象进行像素级分割。以前的方法依赖于与类无关的前景定义,它将语义上不同的对象分组为异构正集,导致模型学习不稳定的声音模式并产生不可靠的建议。为了解决这个问题,我们重新制定了特定类别的目标,并提出了一种新颖的声学基础成本学习(AGCL)框架,将静态的、与音频无关的视觉文本先验转换为动态的、基于音频的成本表示。对于类别内的声音发现,我们设计了音频调制成本生成(AMCG)和音频引导时间聚合(AGTA)模块,以通过低侵入性音频注入机制实现帧级发声区域突出显示和视频级时间细化。对于类别间干扰项歧视,我们引入了协同干扰项挖掘(SDM)策略,该策略有选择地惩罚在声学和语义上混淆的负面类别,以学习更具区分性的决策边界。对 AVSBench-OV 数据集的大量实验表明,我们的方法明显优于以前最先进的方法,特别是在看不见的类别上。代码可在 https://github.com/spyflying/AGCL 获取。