论文
解开 LVLM 可视化素养中的视觉正确性和事实正确性
Disentangling Visual and Factual Correctness in LVLMs' Visualization Literacy
摘要
大视觉语言模型(LVLM)显示出强大的可视化解释,但尚不清楚它们的反应是否反映了对视觉证据或训练期间学到的事实先验的真实推理。当前的评估混合了这两种来源,当正确的视觉解释被记忆的事实覆盖时,就会变得模糊。我们提出了一个将视觉正确性与事实正确性分开的框架,揭示了现有可视化素养评估的有效性限制。在使用 15 个最先进的 LVLM 进行的三项实验中:(1) 多个模型在标准测试 (VLAT) 上达到了人类水平的表现,但这可能反映的是事实回忆而不是视觉理解,而当正确的视觉解释被事实先验取代时,随机数据测试 (reVLAT) 会低估读写能力。 (2) 使用我们的反事实可视化素养评估测试 (CVLAT) 和能力归一化仲裁指标,我们根据视觉事实信赖指数 (VFRI) 的符号对模型进行分类,揭示了以可视化为导向的大多数和以事实知识为导向的少数,尽管有几个接近零的案例值得谨慎对待。对相同反事实项目的人类基线 (N=30) 证实,人们在冲突情况下绝大多数遵循图表,提供了人类参考点。 (3)基于即时的干预可以改变优先顺序,但其有效性高度依赖于模型且方向不对称,并且高图表阅读能力并不能预测即时可控性。总体而言,高可视化准确性并不足以证明忠实的视觉推理:可靠地集成到视觉分析中不仅需要评估可视化素养,还需要评估当两者出现分歧时模型如何在视觉证据和事实先验之间进行仲裁。基准和代码:https://github.com/JaeyoungKim-HCIL/CVLAT