论文
先听后推理:大型音频语言模型的基于感知的测试时强化学习
Listen Then Reason: Perception-Grounded Test-Time Reinforcement Learning for Large Audio-Language Models
摘要
大型音频语言模型 (LALM) 越来越多地用于更广泛的音频推理任务。这些模型通常将音频表示合并到大型语言模型 (LLM) 主干中,以实现多模态推理。最近的测试时强化学习(TTRL)方法通过利用预训练后未标记的测试数据进一步提高了 LLM 推理能力。然而,LALM 感知能力的重要性仍未得到充分探索,特别是在推理过程中整合和依赖了多少声学证据,以及这如何有助于最终的任务表现。这一差距限制了有效的后训练方法(例如用于音频推理的 TTRL)的开发。在这项工作中,我们首先分析了推理过程中音频信息是如何整合和利用的。我们量化了分层感知依赖,并表明更强的声学依赖与更高的准确性和归因于音频输入的更大性能增益相关。在此基础上,我们提出了基于感知的 TTRL (PG-TTRL),它将无标签测试时间优化与基于感知的推理结合起来,鼓励模型在音频输入上更强有力地构建其推理。跨 LALM 和基准测试的实验表明,PG-TTRL 相对于基本模型和标准 TTRL 持续提高了推理性能,显示了感知基础优化对于测试时音频推理的价值。