论文

使用 GenAI 图像编辑进行域平移鲁棒目标检测

Domain shift-robust object detection with GenAI image editing

模型训练合成数据

摘要

物体检测器通常会在域变化(例如照明、天气或遮挡变化)下性能下降。这些转变改变了对象的外观,并暴露了对从训练分布中学到的视觉快捷方式的依赖,这些快捷方式不能跨领域推广。在专门的低数据环境中,获取足够的真实世界样本来捕获此类域变化尤其困难。基于扩散的生成图像编辑的最新进展显示出通过合成数据增强来提高对象检测器的域内性能的希望。然而,它们提高域外鲁棒性的潜力在很大程度上仍未得到开发。我们假设生成图像编辑可以模拟训练数据中的受控域转移,有效地弥合源域和目标域之间的差距。为了测试这一点,我们将伪装军用车辆检测作为具有挑战性的域转移场景进行研究。经过非伪装数据训练的探测器显示,在 15 个车辆类别的特写地面图像中,包含树叶、网和多光谱伪装的真实测试图像大幅退化。我们使用了两种基于扩散的编辑模型:Qwen Image Edit 2509 和 Flux.2 Dev,以及 LoRA 微调版本的 Qwen,以综合方式向训练数据添加伪装。非生成黑条遮挡基线作为增强质量的下限。使用经过真实和合成数据训练的 GroundingDINO 探测器,生成伪装增强为树叶 (+20.1) 和网状 (+14.4) 伪装带来了显着的 mAP 改进。事实证明,生成多光谱伪装更具挑战性,但 LoRA 微调 的性能比未伪装的基线提高了 4.4 mAP。