论文
AURAL:语音语言模型的联合块自适应潜在推理
AURAL: Adaptive Latent Reasoning with Joint Chunk for Speech Language Models
摘要
模型智能和快速响应共同塑造了与语音语言模型交互的质量,但仍然难以同时实现。显式思维链 (CoT) 可以改善推理和音频理解,但生成中间推理标记会延迟响应。描述细粒度的声音提示会进一步延长 CoT 并增加延迟。潜在推理可以减少这种开销,但现有方法经常落后于 CoT,并且仍然受到单路径监督和不适应问题难度的推理预算的限制。我们引入了 AURAL,它对潜空间中多个合理推理延续的分布进行建模,并联合预测未来状态块,以减少顺序前向传递和推理延迟。为了为潜在推理提供初步监督,我们构建了 AuralReason-683K:683K 双语语音话语(约 1,000 小时),具有简洁的 CoT,用于情感识别、同理心对话和一般推理。然后,AURAL-RL 超越这些痕迹进行探索,奖励产生高质量答案的简洁推理,并根据每个问题调整推理工作。在两个主干网中,AURAL-RL 实现了与 CoT-RL 相当的性能,并且在大多数指标上比各自的监督检查点有更大的增益。分析进一步表明,更难的问题会引发更多潜在的推理步骤。在 Qwen2.5-Omni 上,它将第一个应答标记的时间缩短了 11.8 倍,从 1.22 秒减少到 0.10 秒,而直接应答为 0.05 秒。