论文
TAG-Bench:大型音频语言模型中的时间音频基础基准测试
TAG-Bench: Benchmarking Temporal Audio Grounding in Large Audio Language Models
摘要
大型音频语言模型 (LALM) 可以描述所听到的内容,但当查询内容出现时,它们的本地化能力仍然缺乏系统的评估。我们提出了 TAG-Bench,这是一个时间音频基础的基准,其中模型返回与自然语言查询匹配的每个时间间隔。 TAG-Bench 包含 1,750 个经过人工验证的查询记录对,覆盖 149.5 小时,其中有八个依赖于源的子集,涵盖查询类别,音频持续时间从 7 秒到 20 分钟; 22.1% 的查询有多个 真值 间隔。在 21 个评估的系统中,表现最好的模型达到了 31.2 mIoU,并且是唯一一个在两个长子集上超过 20 mIoU 的系统,但即使是这个表现最好的模型,在 IoU >= 0.7 时也只能达到 21.5% 的召回率。此外,21 个系统中有 9 个低于 5 mIoU,并且每个模型都低估了一对多查询的出现次数,没有一个模型的计数准确度超过 13.2%。由于响应是自由格式的,因此我们报告解析失败率和 MAE 覆盖率:解析失败保留在 mIoU、Recall、gIoU 中,并将指标计数为空预测,但不进入 MAE。结果将基准中的精确定位、出现枚举和输出格式可靠性分开,其跨子集比较是描述性的,而不是查询抽象或持续时间的受控估计。我们将发布TAG-Bench数据和评估代码以支持未来的研究。