论文
Contrastive-SDXL:用于行人检测的注释保留夜间增强
Contrastive-SDXL: Annotation-Preserving Night-Time Augmentation for Pedestrian Detection
摘要
夜间行人检测仍然具有挑战性,因为标记的夜间数据有限,并且较大的照明差异使得仅在白天训练的检测器不可靠。潜在扩散模型(LDM)为图像到图像转换和跨域增强提供了强大的基础,但它们在安全关键感知方面的有效性取决于在源域和目标域之间转换时是否保留与检测器相关的对象和局部语义结构。在这项工作中,我们提出了 Contrastive-SDXL,这是一种用于夜间行人检测的昼夜增强框架,基于 SDXL-Turbo 构建,并使用低秩适应 (LoRA) 进行微调。为了保留白天输入和翻译的夜间图像之间的语义对应关系,我们引入了由预训练的 DINOv2 编码器而不是生成器编码器特征引导的分块语义对比损失。多级 DINOv2 自注意力图强制执行局部和全局语义一致性,而对象一致性损失明确鼓励行人保留。 Contrastive-SDXL 可生成逼真的夜间图像,Frechet 起始距离 (FID) 达到 22.5。与仅白天的基线相比,使用我们的合成图像训练的探测器的漏失率降低了 6-7%,接近使用真实夜间数据训练的探测器的性能。这些结果表明,一致性驱动的扩散增强可以有效支持安全关键的夜间行人检测。