SONIC-O1:评测多模态大语言模型音视频理解的真实世界基准
SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding
摘要
多模态大语言模型(MLLM)是近期人工智能研究的一个主要焦点。然而,大多数先前的工作都集中在静态图像理解上,而它们处理顺序音频视频数据的能力仍未得到充分探索。这一差距凸显了对高质量基准的需求,以系统地评估现实环境中的 MLLM 性能。我们推出 SONIC-O1,这是一个全面、经过人工验证的基准测试,涵盖 13 个现实世界对话领域,包含 4,958 个注释和人口统计元数据。 SONIC-O1 在关键任务上评估 MLLM,包括开放式总结、多项选择题 (MCQ) 回答以及具有支持理由(推理)的时间定位。封闭和开源模型的实验揭示了局限性。虽然两个模型系列之间的 MCQ 准确率性能差距相对较小,但我们观察到性能最佳的闭源模型和开源模型之间在时间定位方面存在 22.6% 的性能差异。不同人口群体的表现进一步下降,表明模型行为持续存在差异。总体而言,SONIC-O1 提供了一个开放的评估套件,可实现基于时间和社会稳健的多模态理解。我们发布 SONIC-O1 用于再现性和研究: 项目页面:https://vectorinstitute.github.io/sonic-o1/ 数据集:https://huggingface.co/datasets/vector-institute/sonic-o1 Github:https://github.com/vectorinstitute/sonic-o1 排行榜:https://huggingface.co/spaces/vector-institute/sonic-o1-leaderboard
