论文
通过语义摘要预测增强音频推理
Enhancing Audio Reasoning via Semantic Summary Prediction
摘要
大型音频语言模型 (LALM) 在复杂问题回答方面表现良好,但经常表现出推理差距,与直接答案相比,显式思维链 (CoT) 降低了准确性。我们假设长推理序列将注意力从音频输入上转移开。为了解决这个问题,我们提出了 SPARE(音频推理语义预测),它使用带有 Sentence-BERT 嵌入的余弦相似性损失引入了与最终结论对齐的寄存器标记。在推理开始之前,这会根据目标语义目标来调节模型的潜在空间。使用 SALMONN 在 MMAU 和 MMAR 上进行的实验表明,零样本推理得到了改进,并且对音频的早期关注能力更强,而无需额外的推理成本。