论文

AUDITA:用于审核音频 QA 中人类与 AI 技能的新数据集

AUDITA: A New Dataset to Audit Humans vs. AI Skill at Audio QA

模型评测基准与评测资源

摘要

现有的音频问答基准主要强调声音事件分类或基于音频描述的查询,通常使模型能够通过捷径策略、短期线索、词汇先验、特定于数据集的偏差,甚至通过元数据和音频描述绕过音频而不是真正的推理来成功。因此,我们提出了 AUDITA(来自不同互联网琐事作者的音频理解),这是一个大规模的、真实世界的基准,用于严格评估表面声学识别之外的音频推理。 AUDITA 包含基于现实世界音频的精心策划、人工编写的琐事问题,旨在通过挑战干扰因素和长期时间依赖性来强调稳健的听觉推理,使用无法仅从孤立的文本或声音提示来回答的探测查询。人类平均准确度为 32.13%,这既表明了任务的挑战性,又展示了对音频的有意义的理解。与此形成鲜明对比的是,最先进的音频问答模型表现不佳,平均准确率低于 8.86%。除了原始准确性之外,我们还应用项目反应理论(IRT)来估计潜在熟练程度、问题难度并揭示模型和数据的系统缺陷。