论文
阅读前先学习基础:使用紧凑视觉语言模型进行统一 PCB 工程图解析
Learning to Ground Before Reading: Unified PCB Engineering Drawing Parsing with Compact Vision-Language Models
摘要
PCB工程图混合了稀疏的图形、密集的表格和文本,其含义取决于页面位置。本地化区域并将裁剪发送到专门的识别器被确定为大多数解析器的方法,因此丢失的区域无法在下游恢复。我们训练一个紧凑的 VLM 来读取整个页面并获取一系列区域类、标准化框以及文本或 HTML 内容。边界框被转换为坐标标记以进行监督。推理不使用检测器或裁剪解析器。联合目标很难优化,因为类和框标记相对于更长的内容序列来说是稀疏的。我们的本地化优先课程在通过内容感知重采样添加内容目标之前先学习类框格式。在工程制图数据集(ED 数据集)的固定验证分割上,Localization-First 将严格定位 F1 比联合训练提高了 0.0955(配对图像引导 95% 区间:[0.0350, 0.1572])。 G-Unified 具有最低的 NED、最高的单元 F1,并且只有非零的精确匹配分数。它为整页 PCB 绘图解析提供了无检测器基线。