论文

WQ-Fusion:跨域音频表示的动态门控注意力

WQ-Fusion: Dynamic Gated Attention for Cross-Domain Audio Representation

应用与实践通用理解与问答

摘要

虽然预训练模型在专门任务中表现出色,但学习跨不同声学领域的通用表示仍然具有挑战性。为了解决这个问题,我们提出了 WQ-Fusion,一种用于跨域音频表示学习的鲁棒双编码器框架。 WQ-Fusion 克服了静态串联的局限性,通过自适应特征调制模块和新颖的元素级门控注意力机制集成了 Whisper 和 qwen。这种设计支持动态特征选择,允许模型有选择地强调相关的声学和语义维度。 Interspeech 2026 音频编码器能力挑战赛(Track A)基准测试的大量实验表明,通过有效路由异构信息,WQ-Fusion 取得了 0.836 的优异总分,显着优于最强的单编码器基线。