论文

Audio-DeepThinker:渐进式推理感知强化学习,用于音频语言模型中高质量思想链的出现

Audio-DeepThinker: Progressive Reasoning-Aware Reinforcement Learning for High-Quality Chain-of-Thought Emergence in Audio Language Models

模型训练强化学习

摘要

大型音频语言模型(LALM)在音频理解方面取得了重大进展,但它们主要作为感知和回答系统运行,没有明确的推理过程。现有的增强音频推理的方法要么依赖于受训练数据质量限制的监督思想链 (CoT) 微调,要么依赖于具有粗略奖励的强化学习 (RL),但不直接评估推理质量。因此,生成的推理链通常看起来结构良好,但缺乏特定的声学基础。我们提出了 Audio-DeepThinker,一个基于两个核心思想的框架。首先,我们引入了一种混合推理相似性奖励,通过将评估逻辑路径对齐、关键步骤覆盖和分析深度的 LLM 评估器与强制与参考推理链进行语义对齐的嵌入相似性组件相结合,直接监督生成的推理链的质量。其次,我们提出了一种渐进的两阶段课程,通过纯粹的 RL 探索,无需任何监督推理 微调,从不具备先验思维链能力的指令调整模型中产生高质量的 CoT 推理。第 1 阶段使用混合奖励对基础音频 QA 进行训练,以培养基本推理模式,而第 2 阶段则转向具有声学挑战性的边界情况,并仅使用 LLM 奖励来实现更大的推理多样性。 Audio-DeepThinker 在 MMAR (74.0%)、MMAU-test-mini (78.5%) 和 MMSU (77.26%) 上取得了最先进的成绩,在 Interspeech 2026 音频推理挑战赛(单模型赛道)中获得第一名。可解释性分析进一步表明,强化学习训练主要重塑了上层 MoE 门控机制,并且推理词元在上层 Transformer 中逐渐结晶,为音频推理如何通过探索出现提供了机制见解。