论文

SC-Diff:用于可见光到红外图像转换的语义校准扩散

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

模型架构Transformer

摘要

可见光到红外图像转换提供了一种使用丰富的可见图像扩展红外训练数据的实用方法。扩散模型因其强大的生成性能而有望完成这项任务。然而,现有的基于扩散的方法通常仅使用语义先验作为外部条件,而没有明确调节去噪网络内的词元交互。因此,他们很难保留可靠注释重用所需的对象位置、形状和语义布局。我们提出了 SC-Diff,一种语义校准的潜在扩散框架,它使用语义先验进行条件指导和内部自注意力校准。具有预定义文本提示的预训练 SAM3 模型首先从可见图像中提取特定于类别的语义掩码。这些掩模被合并成语义图并与可见图像融合作为输入条件。相同的映射被转换为 词元级 语义标签以校准去噪网络中的自注意力。基于这些标签,我们引入了语义引导自注意力校准(SGSC),它自适应地将正偏差应用于同一类别的查询键对。查询式校准强度取决于语义类别之间的注意力分散度以及分配给查询自身类别的注意力。原始的注意力分数进一步调节了偏差,为具有更强响应的同类别键提供了更大的校准。这种软校准减少了跨类别干扰,同时保留了全局上下文交互,从而提高了生成的红外图像的语义一致性。大量实验表明,SC-Diff 提高了感知质量,并为下游红外物体检测生成更有效的合成训练数据。