论文
解决 RGB 到 SWIR 图像转换的潜在扩散中的细节瓶颈
Addressing Detail Bottlenecks in Latent Diffusion for RGB-to-SWIR Image Translation
摘要
潜在扩散模型 (LDM) 可实现高效的图像到图像转换,但在压缩过程中会丢弃精细的空间细节,从而降低下游感知任务的性能。我们发现了两个瓶颈:自动编码器(它会丢失空间信息)和调节路径(它通过朴素下采样进一步降低源信号的质量)。我们提出了两种轻量级、与主干网无关的修复方案:源条件自动编码器(SCAE),通过跳过连接将高分辨率源特征注入解码器;以及可学习指导编码器(LGE),用学习的条件信号取代朴素的下采样。通过对具有两个降噪主干(U-Net 和 DiT)的驾驶场景的 RGB 到 SWIR 转换进行评估,我们的方法将检测 mAP 比潜在扩散基线提高了 2 倍,对小物体(COCO-small,<32^2 px^2)的增益提高了 3.4 倍,同时实现了最先进的 FID。我们进一步表明 FID 和检测性能的相关性较差,从而激发了多轴评估。结果将零样本推广到公共 RASMD 基准。我们将公开发布带有注释的测试数据、所有检查点和训练代码。