论文

Auto-AEG:开放词汇音频事件时间定位的可扩展数据构建

Auto-AEG: Scalable Data Construction for Open-Vocabulary Audio Event Grounding

模型训练合成数据

摘要

大型音频语言模型(LALM)可以流畅地推理声音,但很难在事件发生时精确定位,而经典的声音事件检测只能在封闭的标签集上达到帧级精度。这些范式的交叉点在于开放词汇音频事件时间定位的任务:预测由任意自然语言查询描述的目标声音事件的所有时间间隔。进展受到数据稀缺的瓶颈:没有大规模资源提供开放词汇的起始/偏移监督,并且手动时间注释的成本过高。为了解决这个问题,我们引入了 Auto-AEG,这是一种可扩展的管道,通过自动数据构建和模型 微调 来构建此类监督。它将以编程方式合成的剪辑(带有用于监督冷启动的放置精确的 真值 间隔)与现实世界音频上的多模型伪标签配对,为强化学习提供奖励信号。使用此管道进行训练在 AEGBench(我们发布的独立难度分层基准)上产生了巨大的时间定位增益(与零样本相比 +73.9% 和 +23.1% mIoU),并且这些增益可推广到保留的 SED 和其他音频定位基准。我们的结果表明,自动构建的数据与间隔感知奖励设计相结合,为扩展 LALM 的时间定位能力提供了有效的数据侧途径。 AEGBench:https://huggingface.co/datasets/zihan-audio/AEGBench