论文

特定类别的扩散模型改进了低数据域中的军事目标检测

Class-specific diffusion models improve military object detection in a low-data domain

模型训练合成数据

摘要

基于扩散的图像合成已成为基于人工智能的对象检测和分类的合成训练数据的有前景的来源。在这项工作中,我们研究了扩散生成的图像是否可以改善低数据条件下的军用车辆检测。我们使用 LoRA 对文本到图像扩散模型 FLUX.1 [dev] 进行了微调,其中 15 个车辆类别中的每个类别仅包含 8 或 24 个真实图像,从而产生了特定于类别的扩散模型,该模型用于根据自动生成的文本提示生成新样本。使用相同的真实图像来微调 RF-DETR 检测器以执行 15 类物体检测任务。然后,使用扩散模型生成的合成数据集来进一步提高探测器性能。重要的是,不需要额外的真实数据,因为生成模型利用相同的有限训练样本。 FLUX 生成的图像提高了检测性能,特别是在低数据情况下(8 个真实样本高达 +8.0% mAP$_{50}$)。为了解决基于文本提示的扩散的有限几何控制问题,我们还使用 ControlNet 和 Canny 边缘图调节生成了结构引导的合成数据,从而生成了对视点和姿势进行显式控制的 FLUX-ControlNet (FLUX-CN) 数据集。当数据稀缺时,结构指导进一步增强了性能(8 个真实样本 +4.1% mAP$_{50}$),但当有更多真实数据可用时,没有观察到额外的好处。这项研究表明,特定于物体的扩散模型对于改善低数据域中的军事物体检测是有效的,并且当真实数据高度有限时,结构引导是最有益的。这些结果凸显了生成图像数据可以作为军事人工智能系统训练传统模拟管道的替代方案。