论文
双节拍:通过抖动解锁音频 大语言模型 中的零射击立体声音频感知
Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering
摘要
多模态 大语言模型 (LLM) 具有出色的语义音频理解能力,但由于依赖单通道音频表示,它们仍然“空间不可知”。目前,空间音频感知方法主要集中在复杂的房间模拟和定制训练的、几何感知的立体声编码器上,这限制了它们的可访问性和通用性。在本文中,我们介绍了 Dual-BEATs 架构,其中左右音频通道通过两个相同的语义编码器独立路由,作为专用空间模块的替代方案。为了规避内部标准化会消除立体声音频通道间差异的架构瓶颈,我们在编码之前注入静态、不相关的抖动本底噪声。这种抖动干预建立了一个宏观方差底线,可以在标准化层上“走私”空间几何形状。通过对三元方向分类任务(左、中、右)进行评估,我们证明了抖动模型实现了卓越的空间分辨率——即使在微妙的 0.5 平移幅度上也能达到高达 97.2% 的定位精度——并且展示了对完全不可见的空间配置的鲁棒、零样本泛化。我们的结果表明,通过适当的声学正则化,标准多模态模型本身就能够理解广义的立体声音频。