论文

带着时间聆听:长音频理解中的精确时序感知

Listening with Time: Precise Temporal Awareness for Long-Form Audio Understanding

模型评测基准与评测资源

摘要

虽然大型音频语言模型 (LALM) 在短音频上实现了强大的性能,但在长格式输入上却表现不佳。这种退化在时间感知任务中更为严重,随着音频​​持续时间的增长,时间对齐变得越来越不准确。我们将这些限制归因于缺乏为长形式时间感知量身定制的数据、基准和建模方法。为了弥补这一差距,我们首先构建了 LAT-Chronicle,这是一个 1.2k 小时的长格式音频数据集,其中包含跨真实场景的时间注释。我们进一步开发了 LAT-Bench,这是第一个经过人工验证的基准测试,支持长达 30 分钟的音频,同时涵盖三个核心任务:密集音频描述、音频时序定位和定向音频描述。利用这些资源,我们提出了 LAT-Audio,将时间意识制定为渐进的全局到局部推理范式。首先将全局时间线构建为对齐的时间语义上下文,然后引入音频思维链(TWA-CoT),通过使用工具合并本地音频信息来执行迭代推理。实验表明,LAT-Audio 在长格式音频时间感知任务上超越了现有模型,并提高了对输入持续时间的鲁棒性。我们在 https://github.com/alanshaoTT/LAT-Audio-Repo 发布了数据集、基准测试和模型,以促进未来的研究。