论文

MMAC:音频描述生成的大规模多维基准

MMAC: A Massive Multi-dimensional Benchmark for Audio Captioning

模型评测基准与评测资源

摘要

随着音频大语言模型(AudioLLM)的发展,音频描述生成需要从简短的描述转向开放式、细粒度的自由形式描述。现有的评估通常侧重于生成质量或任务性能,因此很难诊断信息覆盖范围和描述可靠性。我们提出了 MMAC,一个用于 \textbf{A}udio \textbf{C}aptioning 的 \textbf{M}assive \textbf{M}多维基准。 MMAC包含来自20多个数据源的5,638个音频片段,涵盖6个能力类别和15个评估维度。给定模型生成的音频描述,MMAC 检查它是否提及目标维度中的相关信息以及所提及的内容是否与参考标签一致。我们评估具有代表性的开源和专有 AudioLLM。结果显示评估维度、信息覆盖范围和描述可靠性之间存在明显差异。我们将发布MMAC基准测试和评估代码。