论文
ChartREG++:多样指代线索与多目标条件下的图表元素定位基准
ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring
摘要
参考表达基础是视觉基础中的核心问题,并被广泛用作视觉和语言模型中空间基础和推理的诊断,但大多数先前的工作都集中在自然图像上。相比之下,现有的图表引用表达式目标定位相关基准仍然有限:(1)它们主要采用边界框,限制了精细图表元素的定位精度(2)它们大多假设单个和两个引用的目标实例,无法处理多实例目标引用; (3) 语言表达过度依赖文本线索或数据排名线索 (4) 它们仅涵盖一小部分图表类型。为了解决这些问题,我们引入了图表引用表达基础基准,该基准系统地支持多种本地化形式、多个引用目标、多种基础线索和多种图表类型。代表性多模态大型模型的结果揭示了显着的性能差距。我们进一步介绍了一个代码驱动的合成管道,它利用绘图程序和渲染的图表基元之间的固有对齐来导出跨图表元素类型和粒度的像素精确的实例掩码。我们使用合成掩模训练实例分割模型,并将其集成到通用多模态基础框架中。由此产生的系统始终优于我们基准测试的基线,并很好地推广到 ChartQA 派生的真实图表基准基准。