论文

AVI-Bench:迈向 Omni-MLLM 的类人视听智能

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

模型评测基准与评测资源

摘要

Omni-Multimodal 大语言模型 (Omni-MLLM) 的最新进展实现了视觉、音频和语言的强大集成。然而,由于缺乏系统和全面的基准,他们的视听智能(AVI)仍然没有得到充分的评估。我们引入了 AVI-Bench,这是一个认知启发基准,通过需要联合视听解释的跨模式任务来评估 Omni-MLLM 的三个阶段:感知、理解和推理。这种设计可以对模型功能和故障模式进行细粒度诊断。为了进一步评估熟悉领域之外的鲁棒性,我们提出了 AVI-Bench-PriSe,这是一种扩展,它使用不熟悉的低语义刺激来探测模型的原始视听感觉,测试超出常见训练分布的泛化能力。对开源和闭源模型的大量实验揭示了当前 Omni-MLLM 的巨大局限性。基于这些发现,我们提出了四级 AVI 分类法。总的来说,AVI-Bench 提供了一个原则性的评估框架来指导更强大和通用的 AVI 的开发。项目网站:https://fudancvl.github.io/AVI-Bench/