论文

低图像预算条件下工业目标检测的语义引导域随机化

Semantically-Guided Domain Randomization for Industrial Object Detection in Low-Image-Budget Regimes

模型训练合成数据

摘要

在高混合、小批量 (HMLV) 汽车制造中重新训练视觉感知管道必须在严格的注释、能源和时间预算下进行,但大多数合成数据生成 (SDG) 策略仍然在数千张图像中运行。这项工作评估了语义引导域随机化 (S-GDR),这是一种无注释自适应管道,它将小型未注释真实参考集的基于视觉语言模型 (VLM) 的语义字幕与基于扩散的背景合成(由 ControlNet 和 IP-Adapter 调节的稳定扩散 XL (SDXL))和基于掩模的对象组合结合起来。在汽车多目标检测基准上,在 200 个合成训练图像的固定预算下,S-GDR 在真实的保留测试集上达到 mAP50-95 = 0.739,优于域随机渲染基线 (mAP50-95 = 0.697) 以及共享相同 200 个图像预算的亮度过滤、感知哈希、CycleGAN 风格传输和无引导扩散变体。 These initial observations position S-GDR as a promising annotation- free alternative for extreme data-scarcity regimes.