论文

通过教师指导的双路径视听表示学习降低语义噪声

Semantic Noise Reduction via Teacher-Guided Dual-Path Audio-Visual Representation Learning

模型训练预训练

摘要

视听表征学习的最新进展表明了将对比对齐与掩模重建相结合的价值。然而,在单个前向传递中联合优化这些目标迫使对比分支依赖于为重建而设计的随机可见补丁,而不是跨模态对齐,从而引入语义噪声和优化干扰。我们提出了 TG-DP,一种教师指导的双路径框架,它将重建和对齐解耦为单独的优化路径。通过解开两个分支的掩蔽机制,TG-DP 使对比路径能够使用更适合跨模态对齐的可见性模式。教师模型进一步为组织该分支中的可见标记提供辅助指导,有助于减少干扰并稳定跨模态表示学习。 TG-DP 在零样本检索方面实现了最先进的性能。在 AudioSet 上,它将视频到音频检索的 R@1 从 35.2\% 提高到 37.4\%,将音频到视频检索的 R@1 从 27.9\% 提高到 37.1\%。学习到的表示在语义上也保持稳健,在 AS20K 和 VGGSound 上实现了最先进的线性探针性能。综上所述,我们的结果表明,解耦多模态目标并将教师引导结构引入对比途径为改进大规模视听预训练提供了有效的框架。代码可在 https://github.com/wanglg20/TG-DP 获取。