论文

SONIC-O1:评测多模态大语言模型音视频理解的真实世界基准

SONIC-O1: A Real-World Benchmark for Evaluating Multimodal Large Language Models on Audio-Video Understanding

模型评测基准与评测资源

摘要

多模态大语言模型(MLLM)是近期人工智能研究的一个主要焦点。然而,大多数先前的工作都集中在静态图像理解上,而它们处理顺序音频视频数据的能力仍未得到充分探索。这一差距凸显了对高质量基准的需求,以系统地评估现实环境中的 MLLM 性能。我们推出 SONIC-O1,这是一个全面、经过人工验证的基准测试,涵盖 13 个现实世界对话领域,包含 4,958 个注释和人口统计元数据。 SONIC-O1 在关键任务上评估 MLLM,包括开放式总结、多项选择题 (MCQ) 回答以及具有支持理由(推理)的时间定位。封闭和开源模型的实验揭示了局限性。虽然两个模型系列之间的 MCQ 准确率性能差距相对较小,但我们观察到性能最佳的闭源模型和开源模型之间在时间定位方面存在 22.6% 的性能差异。不同人口群体的表现进一步下降,表明模型行为持续存在差异。总体而言,SONIC-O1 提供了一个开放的评估套件,可实现基于时间和社会稳健的多模态理解。我们发布 SONIC-O1 用于再现性和研究: 项目页面:https://vectorinstitute.github.io/sonic-o1/ 数据集:https://huggingface.co/datasets/vector-institute/sonic-o1 Github:https://github.com/vectorinstitute/sonic-o1 排行榜:https://huggingface.co/spaces/vector-institute/sonic-o1-leaderboard

SONIC-O1:评测多模态大语言模型音视频理解的真实世界基准
图A1:SONIC-O1 数据整理与标注流水线。我们首先通过主题与人口统计增强的搜索查询检索候选的真实世界场景视频,并按许可约束(CC BY 4.0)过滤,然后下载视频/音频及可用的字幕。人工审核者对候选视频进行质量与覆盖面筛选,随后我们解析元数据并进行平衡采样(例如按主题与时长)。在构建基准时,视频被切分为 10 分钟的块用于摘要(T1),并切分为重叠的 3 分钟片段用于 MCQ 与时间定位(T2–T3)。若无字幕,我们通过 ASR 获取语音转写;否则使用已下载的字幕。草拟的人口统计元数据与任务标注可借助模型辅助工具(例如 Gemini/ASR)自举生成,随后由领域专家修正与验证,并移除模糊或证据不足的条目。箭头表示从原始检索到最终经人工验证实例的流程。