论文
SpotSound:通过细粒度时序定位增强大型音频语言模型
SpotSound: Enhancing Large Audio-Language Models with Fine-Grained Temporal Grounding
摘要
大型音频语言模型(ALM)最近在整体音频理解方面表现出了卓越的能力,但它们对于时间基础(即准确定位长格式音频中事件何时发生的任务)仍然不可靠。这种限制源于两个因素:以剪辑级监督为主的训练数据缺乏精确的时间戳,以及基准无法模拟短事件被密集背景声音掩盖的现实场景。在本文中,我们介绍了 SpotSound,一种专为定位音频事件而设计的音频语言模型。 SpotSound 包含一个新颖的训练目标,专门设计用于抑制输入中缺少的事件的幻觉时间戳。此外,我们还推出了 SpotSound-Bench,这是一个具有挑战性的时间基础基准,其中目标事件占据每个剪辑的不到 10%,从而创建了严格的“大海捞针”评估。实验表明,SpotSound 在时间基础基准上取得了最先进的结果,同时在一般下游音频语言任务中保持了稳健的性能。代码、模型和基准测试发布于 https://loiesun.github.io/spotsound/