论文

在大型音频语言模型中学习何时边听边思考

Learning When to Think While Listening in Large Audio-Language Models

模型训练强化学习

摘要

大型音频语言模型 (LALM) 的最新进展使得实时流式语音交互变得越来越实用。在这种情况下,推理质量和响应能力紧密耦合:延迟推理直到语音端点可以提高答案质量,但将深思熟虑转移到用户可见的响应延迟中,而过早回答则有在决定性证据到达之前犯下的风险。我们为 LALM 引入了一种可学习的等待思考答案控制公式。受人类对话增量性质的激励,控制器根据部分音频证据决定何时等待、何时外化紧凑推理更新以及何时回答。使用 Qwen2.5-Omni-7B 作为基础模型,我们从口语推理数据构建对齐的等待-思考-答案轨迹,使用监督 微调 (SFT) 训练控制器,然后应用解耦剪辑和动态采样策略优化 (DAPO)。奖励结合了答案正确性、行动有效性、更新时间、延迟同步、推理质量和链一致性,优化了完整的等待-思考-答案轨迹,而不仅仅是最终答案。在六任务合成口语推理问答 (SRQA) 基准上,六奖励 DAPO 控制器将行加权准确度从 67.6% 提高到 70.3%,同时在相同的 Qwen 部署工具下将端点后最终思考长度减少 14%。在 186 项人工录制的 Real Audio Bench(超越文本转语音 (TTS) 渲染语音的传输检查)上,控制器系列仍然保持功能:SFT 实现了最强的准确性,而六奖励 DAPO 控制器是唯一一个最终思考长度低于基础的学习变体。这些结果表明,流模型应该学习何时在音频流期间明确中间推理。