论文

Knossos 和 Ariadne:使用视觉语言模型进行基准测试和学习完整的图拓扑提取

Knossos and Ariadne: Benchmarking and Learning Complete Diagram Topology Extraction with Vision-Language Models

模型评测基准与评测资源

摘要

结构图广泛用于表示跨科学、工程、程序和空间领域的复杂系统和关系信息。最近的视觉语言模型(VLM)越来越能够识别图表元素并推理其内容,而完整的图表拓扑提取仍然相对未得到充分探索。在本文中,我们研究图到图的拓扑提取:提取所有图实体以及它们之间的完整关系。为了实现大规模监督训练和对该任务的系统评估,我们引入了 Knossos,这是一个跨越六个不同领域的 19,200 个图表的基准,具有 245,179 个节点和 439,740 个边。其符号生成过程提供了渲染图与完整拓扑、关系类型和连接器几何形状的注释之间的精确对齐。为了解决完整拓扑提取的建模挑战,我们还提出了 Ariadne,这是一个结构化框架,它将任务分解为节点库存提取和源条件边缘预测。大量实验表明,Knossos 上的训练极大地改进了较小的开源VLM中的完整拓扑提取。 Ariadne 进一步改进了匹配监督下的一步提取,展示了结构化分解的额外好处。它在 Knossos 上的评估方法中实现了最高的平均 Edge F1,而两种骨干模型变体在现实世界的外部基准测试中也比未适应的对应方法有所改进。代码和基准可在 https://github.com/bangwayne/knossos_Ariadne_Public. 获取

Knossos 和 Ariadne:使用视觉语言模型进行基准测试和学习完整的图拓扑提取的原论文方法或结果图
图 1:Knossos 基准测试概述。 (a) 六个领域的代表性图表。 (b) 生成管道对生成控件进行采样,实例化符号拓扑,放置节点和路由边缘,并将图表与对齐节点、类型化边缘和几何注释一起渲染。结构验证和基于VLM的筛选产生冻结的训练和测试版本。 (c) 数据集统计总结了 19,200 个图、245,179 个节点和 439,740 个类型边的难度、拓扑规模、边方向性和多链接流行率。