论文
MTVDiff:用于增强热到可见面转换的多模态条件潜在扩散
MTVDiff: Multimodal Conditional Latent Diffusion for Enhanced Thermal-to-Visible Face Translation
摘要
热到可见人脸转换带来了基本挑战,包括几何不连续性、语义属性不匹配和身份退化。我们提出了 MTVDiff,一种新颖的多模式潜在扩散框架,它协同整合深度和文本信息来解决这些限制,同时保留身份特征。 MTVDiff框架提出了三个核心技术贡献:(1)用于多尺度热深度特征提取和融合的双分支交叉注意融合(DBCAF)模块; (2) 用于语义引导生成的门控文本到视觉特征对齐机制; (3) 用于自适应多模态先验积分的空间特征变换(SFT)。对MCXFace和SpeakingFaces数据集的大量实验表明,我们的多模态方法在多个指标上显着优于现有的基于GAN和基于扩散的方法,在图像质量和人脸验证性能方面实现了显着改进,FID降低了高达48.3%,Rank-1精度提高了高达8.9%。我们的工作为在不同照明条件下运行的人脸识别系统提供了强大的解决方案,并通过有效的多模态集成推进了跨光谱人脸图像转换的最先进技术。