论文

时间对比解码:大型音频语言模型的 无需训练 方法

Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models

模型推理解码与生成控制

摘要

大型音频语言模型(LALM)泛化于语音、声音和音乐,但统一解码器可能会表现出\emph{时间平滑偏差}:瞬态声学线索可能没有得到充分利用,而有利于语言先验更好支持的时间平滑上下文,从而导致不太具体的音频基础输出。我们提出了\emph{时间对比解码}(TCD),这是一种用于统一 LALM 的 无需训练 解码方法,可以减轻推理时的这种影响。 TCD 通过平滑输入波形并重新编码来构造时间模糊的慢路径视图,然后将下一个标记 logits 与原始视图和慢路径视图进行对比。对比信号被应用为仅限于小候选集的 词元级 logits 更新。自归一化稳定性分数设置模糊窗口和更新比例,基于不确定性和音频依赖的逐步门仅在需要时激活更新。 MMAU 和 AIR-Bench 上的实验显示了强大的统一 LALM 的持续改进。我们进一步进行消融和架构适用性研究,以分析关键组件的贡献以及 TCD 在大型音频语言模型设计中的表现。