用于交通标志增强的具有物理一致性的结构化先验引导扩散修复
Structured-Prior-Guided Diffusion Inpainting with Physical Consistency for Traffic Sign Augmentation
摘要
交通标志检测面临长尾数据分布。从监管的角度来看,许多罕见的迹象与常见的迹象一样重要,但它们的样本却很少。生成数据增强是一种出路。然而,通用修复模型在直接应用于标志区域时会扭曲数字、变形几何和透视,并改变颜色。我们将其追溯到一个间隙:条件信号对于符号的物理组成来说过于抽象。我们提出了一种具有物理一致性的结构化先验引导扩散修复框架。它通过三个正交路径注入符号的语义、外观和几何先验:JSON 格式的文本提示、使用测量的主色渲染的前视图矢量模板(通过 IP 适配器)以及仿射对齐矢量模板(通过 ControlNet)。两个物理一致性损失使用 CIELAB 色度 $L_1$ 项约束颜色,并使用 Sobel 梯度项约束边缘结构。我们通过自监督重建对 AMAP 内部收集的大量图像进行训练,然后在不同来源的公共 TT100K-2021 数据集上评估零样本。我们的方法使用大约 1.4B 参数的稳定扩散 1.5 主干。它在重建保真度、物理一致性和语义可控性的每一个指标上都击败了七个有代表性的竞争对手。其 OCR 精确匹配率达到 91.1%,而 12B 工业模型 FLUX.1 Fill [dev] 为 44.2%,并且只需要该模型推理时间的 1/14$。留一消融证实了三个先前路径中的每一个以及两个损失项都有自己的贡献。在下游检测中,合成数据使稀有类别的组池 AP50 比纯真实数据基线提高了 1.23 美元到 7.40 美元。代码和预训练模型可在 https://github.com/52hz-whale/TrafficSignInpaint 获取。