论文

AdaLoop:音频语言模型的自适应深度潜在推理

AdaLoop: Adaptive-Depth Latent Reasoning for Audio Language Models

模型推理测试时计算扩展

摘要

大型音频语言模型可以回答有关语音、声音和音乐的问题,但在需要细粒度声学分析的任务上,其准确性急剧下降。判断两个说话者中哪一个的音调较高需要迭代信号级推理,而内容问题则不需要。当前模型在两者上花费相同的计算深度。我们引入了 AdaLoop,一个轻量级的循环模块,它可以学习给定的音频-问题对需要多少个潜在的细化步骤。共享Transformer块在问题的引导下迭代音频表示,而一旦表示准备好,学习的停止机制就会退出循环。 AdaLoop 添加了不到 3% 的基本模型参数,并且可以插入任何音频编码器-语言模型对,而无需修改任何组件。在 MMSU、MMAU-Pro 和 MMAR 三个架构不同的模型上进行评估,AdaLoop 将平均准确度提高了 2.9 到 3.8 个点,在感知密集的子任务上收益最大,其中模型学习应用更深层的推理。