论文
通过帧级事件定位增强音频语言模型的精细时间感知
Augmenting Large Audio-Language Models with Frame-Level Grounding for Fine-Grained Temporal Perception
摘要
大型音频语言模型(LALM)极大地提高了一般音频理解能力,但它们在细粒度时间感知方面仍然有限,特别是在精确事件定位方面。现有方法主要是对 LALM 进行后训练,以将事件边界预测为时间戳标记。然而,这种生成公式缺乏时间戳预测和细粒度声学证据之间的明确对应关系,限制了时间定位的精度和可靠性。为了解决这个问题,我们用专用的帧级基础模型增强了 LALM,同时利用其语义建模功能来表示事件查询。具体来说,冻结的 LALM 以音频作为上下文对事件查询进行编码,而基础模型将这些查询表示与细粒度的音频特征相结合,以在帧级别定位目标事件。跨不同时间定位基准的广泛实验证明了对现有方法的强大且一致的改进。进一步的评估表明,定位模型可以提供时间证据来支持下游推理。