论文

迈向细粒度时间感知:带有音频侧时间提示的 后训练 大型音频语言模型

Towards Fine-grained Temporal Perception: Post-Training Large Audio-Language Models with Audio-Side Time Prompt

模型训练强化学习

摘要

大型音频语言模型 (LALM) 可实现一般音频理解,并在各种音频任务中展示出卓越的性能。然而,这些模型在时间感知方面仍然面临挑战(例如,推断事件发生和偏移),导致在细粒度场景中的实用性有限。为了解决这个问题,我们提出音频端时间提示并利用强化学习(RL)开发用于细粒度时间感知的 TimePro-RL 框架。具体来说,我们将时间戳编码为嵌入,并将它们作为时间坐标交织在音频特征序列中以提示模型。此外,我们在监督 微调 (SFT) 之后引入 RL 来直接优化时间对齐性能。实验表明,TimePro-RL 在一系列音频时间任务中实现了显着的性能提升,例如音频时序定位、声音事件检测和密集音频描述,验证了其强大的有效性。