论文

LTM-AE:用参考音频记忆增强音频语言模型的目标感知

Long-Term Memory-Guided Enhancement for Target Perception in Audio-Language Models

模型推理解码与生成控制

摘要

音频大语言模型 (ALLM) 可以推理录音的内容以执行复杂的任务。然而,当背景噪声和竞争源混合目标声音时,这些功能通常会在现实环境中崩溃。受人类听力长期记忆的启发,我们提出了长期记忆引导音频增强(LTM-AE),通过在未经训练的情况下细化 ALLM 的音频表示来改善选择性目标感知。 LTM-AE 从单独的干净参考录音中提取隐藏状态的表示,作为每个类别的长期记忆,指导增强用户指定的聆听目标。我们在选定类别的长期记忆中重建传入的音频标记,并在语言骨干解码之前用原始标记插入重建。这种插值控制了存储的听觉体验的影响,同时保持所有 ALLM 参数固定。跨 20 个声音类别和 3 个 ALLM 的诊断读数表明,LTM-AE 增强了对三个干扰源中指定目标的响应。在多个开源模型中,对受约束和自由形式的分类进行平均,比原始混合物的准确率提高了 29.53 到 46.15 个百分点。对于语音内容恢复,带有额外学习词元级门的 LTM-AE 将 Qwen2-Audio 的单词错误率从 23.07% 降低到 14.77%。这项工作朝着利用人类长期记忆原理增强 ALLM 以实现真实世界聆听迈出了第一步。我们的代码可在 https://github.com/aynlp/ltm-audio-code 获取