论文
少学多用:利用反事实进行数据高效的图表理解
Learning More from Less: Exploiting Counterfactuals for Data-Efficient Chart Understanding
摘要
视觉语言模型 (VLM) 在图表理解方面取得了显着进展,这主要是由在日益庞大的合成数据集上进行监督的 微调 (SFT) 推动的。然而,单独缩放 SFT 数据效率低下,并且忽略了图表的一个关键属性:图表是以编程方式生成的视觉工件,其中小的、代码控制的视觉变化可能会导致语义和正确答案的巨大变化。学习这种反事实敏感性需要 VLM 区分细粒度的视觉差异,而标准 SFT 独立处理训练实例并提供有限的监督来强制执行这种行为。为了解决这个问题,我们引入了 ChartCF,这是一种数据高效的训练框架,旨在增强反事实敏感性。 ChartCF 包括:(1) 通过代码修改的反事实数据合成管道,(2) 基于图表相似性的数据选择策略,过滤过于困难的样本以提高训练效率,以及 (3) 跨文本和视觉模态的多模态偏好优化。五个基准测试的实验表明,ChartCF 在使用显着更少的训练数据的同时,实现了优于或与强大的图表特定 VLM 相当的性能。