论文
DataVista:诊断数据视频理解方面的多模式LLM
DataVista: Diagnosing Multimodal LLMs on Data Video Understanding
摘要
数据视频是一种将数据可视化与视频叙事相结合的媒体形式,广泛应用于新闻报道和商业分析。与一般视频理解相比,数据视频理解更强调从动画图表中准确读取数据、整合跨图表和时间的证据,以及理解叙事组织和视觉设计如何传达信息。然而,现有的基准测试要么针对一般视频,要么针对静态图表,并且尚未对数据视频理解进行系统评估。我们推出了数据视频理解的第一个基准 DataVista,包含 961 个真实数据视频和 6,775 个评估问题,这些问题在三级渐进能力框架(数据感知、时间推理、叙事理解)下组织,具有跨五个主题领域的 10 种细粒度问题类型。对 19 个主流 MLLM 的系统评估表明,性能最好的模型 Gemini-3.1-Pro 总体准确率达到 70.0%,仍远低于人类专家的表现,模型在 Causal 上表现最差 推理和叙述结构。增加帧数和添加字幕主要有利于数据感知和时间推理,但对叙事理解的增益有限。对模型响应的进一步分析确定了图表阅读、证据判断和指令理解中的典型故障模式。该基准可在 https://github.com/HKUSTDial/DataVista. 获取