论文

聆听、暂停和推理:面向音频理解的基于感知的混合推理

Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding

模型训练强化学习

摘要

最近的大型音频语言模型在音频理解方面表现出了令人印象深刻的能力。然而,它们经常遭受感知错误,而如果不首先将模型的感知建立在结构化听觉场景中,就无法实现可靠的音频推理。受听觉场景分析的启发,我们首先引入感知感知问答(PAQA)数据集。 PAQA 实施分层解耦策略,将语音与环境声音分离并区分多个说话人,为训练提供明确的感知推理。在此基础上,我们提出了 HyPeR,一个两阶段混合感知推理框架。在第一阶段,我们对 PAQA 上的模型进行微调,以感知复杂音频中的声学属性。在第二阶段,我们利用 GRPO 来完善模型的内部审议。我们还引入了 PAUSE 词元,以促进声学模糊阶段的潜在计算,并设计感知一致性奖励,以使推理原理与原始音频保持一致。跨基准测试的实验表明,HyPeR 相对于基本模型实现了绝对改进,其性能可与大型模型相媲美,强调了基于混合感知的推理对于鲁棒和多说话者音频理解的有效性。