论文
逃避语言优先:通过模态感知策略优化减轻音频推理中的后期模态崩溃
Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization
摘要
音频和全模态 大语言模型 展现出令人印象深刻的跨模态推理能力。然而,将标准强化学习 后训练 算法应用于这些模型会暴露出一个关键的结构漏洞:像 GRPO 这样的方法在所有词元上应用统一的策略梯度,忽略它们对非文本源模态的不平等依赖。这加剧了扩展思想链生成过程中的后期模态崩溃,其中模型逐渐放弃主要源信号,转而支持压缩文本先验,导致自信但毫无根据的幻觉。为了解决这个问题,我们引入了模态感知策略优化(MAPO),这是一种新颖的双分支强化学习框架。首先,MAPO 使用模态相关性掩码动态地将策略梯度集中在模态关键标记上,模态相关性掩码源自音频消融参考和多模态策略之间的跨模态差分熵。其次,它集成了一个辅助注意力损失分支,该分支将有针对性的、按时间缩放的惩罚应用于模型的内部注意力分布。这确保了模型主动维持跨模式深入推理轨迹。对复杂音频推理基准的评估表明,MAPO 显着提高了长视野推理保真度和多模态指令跟踪,实现了极具竞争力的性能,并在开放权重模型的几个关键基准上创造了新的最先进结果。通过严格依赖本地统计信号而不是特定领域的归纳偏差,MAPO 为减轻不同多模态系统的认知崩溃提供了有前景的基础。