论文
超越像素:面向可靠原理图审计的矢量到图转换
Beyond Pixels: Vector-to-Graph Transformation for Reliable Schematic Auditing
摘要
多模态大语言模型(MLLM)在视觉理解上进展显著,却存在一个关键局限:结构盲视(structural blindness)。即便最先进的模型也难以捕捉工程原理图中的拓扑与符号逻辑,因为其像素驱动的范式丢弃了推理所需的显式矢量定义关系。为克服这一点,我们提出矢量到图(Vector-to-Graph,V2G)流水线,将CAD图转换为属性图:节点表示组件,边编码连接关系,使结构依赖显式化且可机审。在一个电气合规检查诊断基准上,V2G在所有错误类别上带来大幅的准确率提升,而领先的MLLM仍接近随机水平。这些结果凸显了基于像素的方法的系统性不足,并表明结构感知的表示为多模态AI在工程领域的实际部署提供了一条可靠路径。为促进后续研究,我们在https://github.com/gm-embodied/V2G-Audit发布基准与实现。
