论文

ECHOv2:用于机器异常声音检测的具有跨频带建模的频率结构预训练声学表示模型

ECHOv2: A Frequency-Structured Pre-trained Acoustic Representation Model with Cross-Band Modeling for Machine Anomalous Sound Detection

模型训练预训练

摘要

机器异常声音检测(ASD)是工业声学监测的一项重要技术,由于异常样本有限和机器声音特征复杂,稳健的声学表示学习仍然具有挑战性。现有的预训练声学表示模型无法完全捕获机器声音的特定频率特征。为了解决这个问题,我们提出了 ECHOv2,一种频率结构的预训练声学表示模型。该模型学习本地化的带内表示以捕获细粒度的频谱模式,同时还结合了具有显式带间监督的两级自 蒸馏 策略来对交叉频率依赖性进行建模。带间分支执行全局上下文对齐和屏蔽子带重建,并引入多个摘要词元用于具有可控频率粒度的结构化聚合,从而在训练期间实现跨子带的区域感知交互。这种设计使 ECHOv2 能够稳健地处理不同的机器类型和嘈杂的操作条件,同时保持稳定的表示质量。为了对预训练的音频主干进行公平和一致的评估,我们在 DCASE 2020--2025 上建立了统一的 ASD 基准,并具有两个补充协议:基于嵌入的冻结表示辨别性评估和基于适应的下游可转移性评估。消融研究证实了带内学习、带间监督和结构化聚合粒度对于鲁棒 ASD 表示学习的有效性。这些发现表明,结构化跨频带建模改进了机器监控的声学表示学习,并为工业异常声音检测提供了有效的预训练表示模型。该模型和基准是公开的,以促进可重复的研究。