论文

用于图表数据提取的自集成视觉语言模型

Self-Ensembling Vision-Language Models for Chart Data Extraction

模型推理推理验证与自校正

摘要

图表有效地传达了定量信息,但底层数据通常以图像形式锁定,阻碍了重用和分析。手动数字化图表非常耗时且容易出错,因此需要自动进行图表到表格的提取。最近的方法使用专门的视觉语言模型(VLM),但在具有许多数据点或大量风格变化的图表上,性能仍然落后。我们提出了一种 VLM 自集成方法,该方法可以对固定图表图像的同一 VLM 的多个表格输出进行重复采样,并在各个表格单元格的级别上聚合它们。我们对齐候选表并采用每个单元格的中位数而不是数值来生成更准确的共识表。我们的方法还包括收敛检测,一旦聚合表稳定就停止采样,以及基于样本分散度的不确定性估计,以帮助用户评估提取的可靠性。由于现有的图表提取基准包含相对简单的图表,改进空间有限,因此我们引入了 WB-ChartExtract,这是一个根据世界银行数据构建的新基准,具有更复杂和风格多样化的图表;平均而言,其图表包含的数据点比 ChartQA 基准中的数据点多 7 倍。在 ChartQA 和 WB-ChartExtract 中,我们的方法提高了单通道 VLM 输出的提取精度,在集成后相对于 WB-ChartExtract 提高了 23%。更广泛地说,我们的方法有助于解锁以前孤立在图表图像中的表格数据,从而实现下游分析和重用。