论文

TopoAgent:一种结构感知的感知推理框架,用于使用大型视觉语言模型进行图到图的拓扑提取

TopoAgent: A Structure-Aware Perception-to-Reasoning Framework for Diagram-to-Graph Topology Extraction with Large Vision-Language Models

模型推理推理策略与问题分解

摘要

图到图的拓扑提取旨在从结构图中提取实体及其连接的图。对于当前的视觉语言模型来说,这项任务仍然具有挑战性,因为它需要细粒度的感知基础和具有全局一致性的拓扑感知推理。我们推出了 TopoBench-180,这是一种经过人类验证的图到图拓扑提取基准,以及 TopoAgent,这是一种结构感知的感知到推理框架,用于使用大型视觉语言模型进行可靠的拓扑提取。 TopoBench-180 包含 180 个跨越 Web 风格和网络风格类别的结构图,并配有规范的图形注释。 TopoAgent 通过结合扎根感知、全局结构先验、规范节点库存构建、以节点为中心的局部到全局关系推理和拓扑一致性执行,逐步提取目标图。 TopoBench-180 上的实验表明,TopoAgent 的性能优于强大的视觉语言模型基线和最新的视觉推理框架,尤其是在边缘提取方面。更广泛地说,这项工作通过建立图到图拓扑提取的基准和框架,填补了多模态结构化理解中的一个重要空白。该基准测试和相关资源将在 https://huggingface.co/datasets/WayneGuo0011/TopoBench-180 上公开发布。