论文
TB-AVA:文本作为视听参数高效微调的语义桥梁
TB-AVA: Text as a Semantic Bridge for Audio-Visual Parameter Efficient Finetuning
摘要
视听理解需要异构模态之间的有效对齐,但当时间对齐的音频和视觉信号缺乏清晰的语义对应时,跨模态对应仍然具有挑战性。我们建议使用文本作为视听表示学习的语义锚。为此,我们引入了一个基于冻结音频和视觉编码器构建的参数高效的适应框架,以文本桥接音频视频适配器(TB-AVA)为中心,它可以实现音频和视频流之间以文本为媒介的交互。作为 TB-AVA 的核心,门控语义调制 (GSM) 根据文本推断的语义相关性选择性地调制特征通道。我们在多个基准上评估了所提出的方法,包括 AVE、AVS 和 AVVP,其中所提出的框架实现了最先进的性能,证明文本是视听学习中参数高效 微调 (PEFT) 的有效语义锚。