论文

ChartDensity-Bench:视觉密度下数值数据重建的 MLLM 基准测试

ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual Density

模型评测基准与评测资源

摘要

多模态大语言模型 (MLLM) 提供了一种从科学图表中恢复数值数据的有前途的方法,但它们从视觉密集的图形中重建图表数据的能力仍然知之甚少。现有的图表理解基准主要评估问题回答或图表级推理,并为评估科学数据的结构化数值重建提供有限的支持。我们引入了 ChartDensity-Bench,这是一个评估 MLLM 在受控视觉密度下从复合图表重建结构化数值数据的基准。 ChartDensity-Bench 根据与源级地面实况数据配对的图表构建,系统地改变同时呈现的图表的数量 ($k\in{1,3,6,9}$),从而能够对密度引起的退化进行受控评估。我们进一步提出了一个多维评估框架,涵盖结构可靠性、重构完整性、可解析性和数值保真度。最近对五个 MLLM 的实验表明,数值重建通常会随着视觉密度的增加而退化,而退化的程度在不同模型中差异很大。图表级配对比较进一步表明,当嵌入更密集的视觉上下文中时,相同的源图表可能会产生更高的重建误差。这些发现强调了视觉密度是 MLLM 图表数据重建中一个重要且先前未被充分探索的因素,并为评估这种情况下的模型鲁棒性提供了系统基准。