论文

聆听推理:聆听专家的声音、检索图表、与LLM推理

Listen-to-Reason: Listen with Experts, Retrieve over a Graph, Reason with LLMs

上下文与知识应用与实践知识图谱通用理解与问答

摘要

大型音频语言模型 (LALM) 通过多阶段训练将音频编码器融合到大型语言模型 (LLM) 中。这种耦合意味着一个新的领域或更强大的LLM需要重新训练,并且他们的答案无法追溯到模型听到的内容:思维链是一个事后账户。我们提出 Listen-to-Reason (L2R),这是一个可解释的设计管道,通过一个明确的、人类可读的树将音频传递到 LLM:冻结专家编码器上的小头将剪辑的每个块映射到树上具有语义意义的节点(用于语音、音乐和环境声音),并且冻结的纯文本 LLM 从这些节点和 ASR 转录中回答,而无需听到剪辑。因此,每个答案都可以追溯到它读取的节点和记录,并且这些节点是因果关系的:用干扰项替换决定节点会推翻 SAKURA 上 78% 的正确答案。使用 7B 读取器时,L2R 的性能优于我们在 SAKURA 上进行比较的所有 LALM,并且在 MMAU 和 MMAR 上落后它们 6-12 个点,尽管在数量级较少的音频数据上训练的参数减少了约 1,400 倍。 然而,由于任何LLM都可以充当读者,我们表明,更强的读者可以缩小这一差距,而无需重新训练任何音频组件。添加了一个带有一个小头的新域:每个物种有 5 个标记剪辑,它的性能比 QLoRA 在相同剪辑上对 LALM 进行的微调高出 13-26 个点。