论文

DVBench:用于理解数据视频中的动态图表和叙述的 MLLM 基准测试

DVBench: Benchmarking MLLMs for Understanding Dynamic Charts and Narratives in Data Videos

模型评测基准与评测资源

摘要

虽然 MLLM 在图表理解和视频理解方面取得了重大进展,但当前的评估在很大程度上隔离了这些功能,在理解随时间变化的结构化视觉信息方面留下了重大差距。为了解决这一差距,我们引入了 DVBench,这是一种用于评估数据视频上的 MLLM 的基准,这是一种将动态图表与结构化叙述相结合的讲故事媒体。我们将数据视频理解分解为五个维度。 DVBench 包含 300 个真实世界的数据视频和 1,000 个经过人工验证的 QA 对,通过严格的半自动化管道进行管理。对九个MLLM的广泛评估表明,Gemini-3.1-Pro实现了最佳的整体性能,而Kimi-k2.5是最强的开源模型。我们进一步确定了两个值得注意的现象:开源模型的性能并不严格随参数大小变化,叙述能力并不能保证视觉能力。细粒度分析和消融研究进一步揭示了特定维度的弱点以及框架配置和字幕输入的影响,为未来的 MLLM 开发提供信息。 DVBench 已在 https://bomiaowang.github.io/DVBench/ 上公开提供。