论文
HEAR:分离局部声学与全局任务建模的音频表征
A Human-Inspired Decoupled Architecture for Efficient Audio Representation Learning
摘要
虽然自监督学习 (SSL) 彻底改变了音频表示,但标准 Transformer 的过度参数化和二次计算成本限制了它们在资源受限设备上的部署。为了解决这个瓶颈,我们提出了 HEAR(Human-inspired Efficient Audio Representation),一种新颖的解耦架构。受人类将局部声学特征与全局上下文隔离的认知能力的启发,HEAR 将处理管道分为两个专用模块:用于局部特征提取的声学模型和用于全局语义集成的任务模型。与通过 知识蒸馏 训练的声学分词器相结合,我们的方法可以实现强大的掩蔽音频建模 (MAM)。大量实验表明,HEAR 仅需要 15M 个参数和 9.47 GFLOP 进行推理,其计算成本仅为传统基础模型(通常需要 85M-94M 参数)的一小部分。尽管效率很高,HEAR 在不同的音频分类基准测试中仍实现了极具竞争力的性能。代码和预训练模型可在 https://github.com/HarunoriKawano/HEAR 获取