论文

SpectCount:通过合成信号进行频谱时间计数改进大型音频语言模型

SpectCount: Spectrotemporal Counting via Synthetic Signals Improves Large Audio Language Models

模型训练合成数据

摘要

大型音频语言模型 (LALM) 通过音频编码器和大规模音频数据扩展了 大语言模型。然而,高质量带注释的音频数据的稀缺仍然是扩展的基本瓶颈。通过探测信号可检测性分析,我们识别了基础 LALM 中细粒度的频谱时间感知弱点。为了应对这些挑战,我们提出了频谱时间计数(SpectCount),这是一种数据高效的 微调 方法,基于即时生成的完全合成音频信号,而不依赖于现实世界的音频、注释或预训练的生成模型。 SpectCount 不仅解决了观察到的弱点,还提高了声音、音乐和语音等多种听觉基准的性能,这在 微调 期间是看不到的。这些结果表明,针对弱点的合成信号为增强 LALM 的听觉理解能力提供了一条数据有效的途径。