论文
用于基于无人机的物体检测的视觉原型条件焦点区域生成
Visual Prototype Conditioned Focal Region Generation for UAV-Based Object Detection
摘要
当应用于带有有限注释训练数据的动态变化场景时,基于无人机(UAV)的目标检测是一项关键但具有挑战性的任务。事实证明,布局到图像生成方法可以通过基于扩散模型合成标记图像来有效提高检测精度。然而,它们经常产生伪影,特别是在微小对象的布局边界附近,从而大大限制了它们的性能。为了解决这些问题,我们提出了 UAVGen,这是一种专为基于无人机的物体检测而定制的新型布局到图像生成框架。具体来说,UAVGen 设计了一个视觉原型条件扩散模型 (VPC-DM),它为每个类构造代表性实例,并将它们集成到潜在嵌入中以生成高保真对象。此外,引入了焦点区域增强数据管道(FRE-DP)来强调合成中对象集中的前景区域,并结合标签细化来纠正缺失、额外和错位的生成。大量的实验结果表明,我们的方法显着优于最先进的方法,并且在与不同的探测器集成时持续提高准确性。源代码可在 https://github.com/Sirius-Li/UAVGen 获取。