论文

SALMONN-2:通过自我监督表征提高通用听力能力

SALMONN-2: Advancing General-Purpose Hearing Abilities with Self-Supervised Representations

模型训练监督微调与指令调优

摘要

最近的音频 大语言模型 (ALLM) 通常基于经过大量监督数据训练的音频编码器。由于自监督学习 (SSL) 音频编码器模型已知可以学习通用和可转移的表示,因此我们研究通用 SSL 音频表示是否可以作为 ALLM 的有效基础。我们推出了 SALMONN-2,这是一种基于统一 SSL 编码器构建的 ALLM。为了更好地利用 SSL 编码器学习的分层表示,我们提出了一种多层特征融合(MLF)适配器,该适配器在将来自所有编码器层的信息投影到语言模型中之前聚合它们。除了传统的音频理解任务之外,我们还进一步探索 ALLM 中的多模态上下文学习(MICL),并研究如何通过上下文偏置训练获得这种能力。实验结果表明,通用 SSL 编码器的性能可与专用监督音频编码器相当或更好,同时在语音、音频、音乐和副语言任务中提供更平衡的功能。 SALMONN-2 在 ALLM 理解基准上进一步实现了同类规模开放权重模型中最先进的性能,在 MMAU-Pro、MMAR 和 MMSU 上获得了最佳结果。我们还表明,MICL 并不是在 ALLM 中自然出现的,而是可以通过有针对性的情境偏差训练有效地获得。