论文
Knossos 和 Ariadne:使用视觉语言模型进行基准测试和学习完整的图拓扑提取
Knossos and Ariadne: Benchmarking and Learning Complete Diagram Topology Extraction with Vision-Language Models
摘要
结构图广泛用于表示跨科学、工程、程序和空间领域的复杂系统和关系信息。最近的视觉语言模型(VLM)越来越能够识别图表元素并推理其内容,而完整的图表拓扑提取仍然相对未得到充分探索。在本文中,我们研究图到图的拓扑提取:提取所有图实体以及它们之间的完整关系。为了实现大规模监督训练和对该任务的系统评估,我们引入了 Knossos,这是一个跨越六个不同领域的 19,200 个图表的基准,具有 245,179 个节点和 439,740 个边。其符号生成过程提供了渲染图与完整拓扑、关系类型和连接器几何形状的注释之间的精确对齐。为了解决完整拓扑提取的建模挑战,我们还提出了 Ariadne,这是一个结构化框架,它将任务分解为节点库存提取和源条件边缘预测。大量实验表明,Knossos 上的训练极大地改进了较小的开源VLM中的完整拓扑提取。 Ariadne 进一步改进了匹配监督下的一步提取,展示了结构化分解的额外好处。它在 Knossos 上的评估方法中实现了最高的平均 Edge F1,而两种骨干模型变体在现实世界的外部基准测试中也比未适应的对应方法有所改进。代码和基准可在 https://github.com/bangwayne/knossos_Ariadne_Public. 获取
