论文

大型音频语言模型的连续音频思考

Continuous Audio Thinking for Large Audio Language Models

模型推理推理策略与问题分解

摘要

大型音频语言模型 (LALM) 在从语音转录到音乐分析等各种音频理解任务中表现出了令人印象深刻的能力。然而,由于 LALM 通常经过训练以产生文本对齐的响应,因此它们的隐藏状态逐渐形成为文本生成而不是保留声学信息。因此,音频所携带的各种声学内容(例如语音细节、韵律、声音事件、情感和音调)会一路丢失,并且难以在响应中利用。我们引入了连续音频思维(CoAT),这是一个为音频语言模型配备连续潜在工作空间的框架,用于在响应生成之前组织声学信息,以音频专家的 蒸馏 为基础。在思维空间内,模型在生成响应时可以利用专家 蒸馏 提供的丰富声学信息。此外,所提出的连续思维块可以在单个预填充中进行处理,因此 CoAT 不需要比基线额外的自回归解码成本。在 Qwen2-Audio、Qwen2.5-Omni-7B 和 Audio Flamingo~3 三个 LALM 中,涵盖音频推理、音频理解、音乐分类、语音情感和语音转录的广泛基准套件的性能提升证明了 CoAT 的有效性。进一步的分析证实,辅助监督从思维位置传播到模型的文本响应。