论文

ChartProbe:通过感知、基础和简单推理进行视觉推理的诊断研究

ChartProbe: A Diagnostic Study on Visual Reasoning through Perception, Grounding, and Simple Reasoning

模型评测基准与评测资源

摘要

视觉语言模型(VLM)对于需要对视觉量进行推理的图表问题仍然不可靠,这种弱点通常归因于推理缺陷,并通过更多的推理监督来解决。我们问困难是否在于推理本身,或者在于推理所依赖的更简单的技能:读取绘制的元素(\emph{perception}),定位它们并将它们绑定到标签(\emph{grounding}),以及执行单步计算,例如排名、总计和差异(\emph{简单推理})。我们引入 \textbf{ChartProbe},这是一个诊断框架,其探针直接从呈现每个图表的代码生成,因此每个标准答案都是准确的构造,不需要人工注释,并将每次失败归因于单一技能。 ChartProbe 实现了一种先前工作没有尝试过的干预:我们不合成复杂推理数据,而是完全保留复杂问题和推理痕迹,一次微调一项简单技能,并测量对保留的复杂推理问题的转移。在三个开放权重 VLM 中,仅监督较简单的技能就可以在模型从未训练过的复杂推理问题上产生巨大的收益:如果这些技能较弱并且可以教会模型阅读图像,则训练它们可以在没有推理数据成本的情况下恢复大部分复杂推理。收益在三种分布外设置中保持不变:看不见的图表类型(饼图)、与我们的图像和模板不相交的人工编写的基准(ChartQA)以及非图表视觉域(CLEVR)。因此,在没有复杂推理监督的情况下,复杂的视觉推理也可以得到改善。