论文

分散加权掩码:改善音频掩码预训练

Rethinking Masking Strategies for Masked Prediction-based Audio Self-supervised Learning

模型训练预训练

摘要

自从引入屏蔽自动编码器以来,人们已经探索了屏蔽技术的各种改进。在本文中,我们在通用音频频谱图上使用基于掩蔽预测的自监督学习(SSL)重新思考音频表示学习的掩蔽策略。虽然最近的信息感知掩码技术引起了人们的关注,但我们观察到它们会产生大量的计算开销。受这一观察的启发,我们提出了分散加权掩蔽(DWM),这是一种轻量级掩蔽策略,利用音频内容频率结构中固有的频谱稀疏性。我们的实验表明,最近 SSL 框架中常用的逆块屏蔽可以提高音频事件理解性能,同时在泛化方面进行权衡。所提出的 DWM 减轻了这些限制和计算复杂性,从而实现一致的性能改进。这项工作为基于掩蔽预测的音频表示学习的掩蔽策略设计提供了实用指导。