论文

SAVU-BENCH:空间视听理解的现实基准

SAVU-BENCH: A Real-World Benchmark for Spatial Audio-Visual Understanding

模型评测基准与评测资源评测方法与指标

摘要

空间视听理解要求模型不仅能够识别当前存在的内容,还能够识别事件发生的位置以及它们如何与各种模式相关。现有的基准通常依赖于模拟场景,评估孤立的空间技能,并对故障模式提供有限的诊断洞察。我们推出了 SAVU-Bench,这是一个现实世界的基准,可以系统地评估三个能力级别和七个评估任务的空间视听理解。我们进一步介绍了 SAVU-Diag,这是一个场景链接的诊断集,它将推理问题分解为其先决条件和对齐子任务。在 SAVU-Bench 上对 12 个代表性模型的评估表明,虽然视觉空间基础相对成熟,但涉及音频的空间感知仍然是主要瓶颈。 SAVU-Diag 进一步证明,大多数推理错误与这些先决条件任务的失败同时发生,尽管即使先决条件得到正确解决,推理差距仍然存在。受这些发现的启发,我们推出了 SAVU-EA,一种无需训练的证据增强基线 这使得空间线索更加明确。虽然 SAVU-EA 极大地改善了空间基础和关节匹配,但高级空间推理仍然具有挑战性。我们的研究结果强调了对强大的空间音频感知和跨模态空间关系的更深入整合的迫切需要。