论文
用于时空对齐图像转换和生成的离散扩散桥
Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation
摘要
我们提出了离散扩散桥(DDB),这是一种新颖的框架,旨在解决图像转换和生成中标准离散扩散的基本时空错位。通过随机调度将数据破坏为纯掩模状态,传统的前向过程会引起双重错位:在空间上,这种纯掩模目标完全丢弃了源图像丰富的结构先验;在空间上,这种纯掩模目标完全丢弃了源图像的丰富结构先验;在时间上,随机掩码顺序本质上与推理过程中使用的“先易后难”的解码机制相矛盾。为了解决这个问题,DDB 在域之间构建了直接有效的轨迹。在空间上,我们引入了一种混合吸收机制,将吸收状态重新定义为掩模和源词元的随机混合,有效地将源先验作为空间锚注入到潜在空间中。在时间上,我们设计了一种信息引导的噪声计划,该计划可以量化语义变化,以优先考虑早期时间步长的高信息区域的损坏。这确保模型学习使用来自不变区域的强大上下文来解决困难的语义变化。大量的实验验证了我们的框架在不同生成范式中的多功能性和稳健性。 DDB 在文本引导的语义操作和纯结构图像翻译中有效地平衡了编辑对齐与结构保真度,同时本质上补充了文本到图像的生成,并保证在极低的采样步骤下实现稳健的高质量解码。代码和模型可在 \href{https://github.com/HKU-HealthAI/DDB}{https://github.com/HKU-HealthAI/DDB} 获取。