并发图像理解和生成:自校正耦合马尔可夫跳跃过程
Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes
摘要
人类认知并不将理解和生成分开。一位老师在白板上讲话并画画$\textit{together}$,每种模式重塑另一种模式。在本文中,我们将这种耦合循环引入人工系统。掩蔽扩散模型 (MDM) 非常适合此任务,但现有采样器要么交替解码文本和图像,要么在仅共享前一步历史记录的并行分支中独立更新它们,但不共享同一步骤中其他模态的最新决策 $\textit{with}$ ;再加上 MDM 无法重新屏蔽,跨模式矛盾既无法检测也无法修复。我们引入$\textbf{自校正耦合马尔可夫跳跃过程(SC-CMJP)}$,这是一个框架,其中一种模态的转换率是另一种模态置信度的函数,由跨模态注意力加权。此外,一旦跨模式证据对承诺不利,重新屏蔽跳跃就会收回承诺。结合 SC-CMJP,我们引入了 $\texttt{CO}_\texttt{2}\texttt{Jump}$ (Self-$\underline{\text{CO}}$rrecting $\underline{\text{CO}}$upled $\underline{\text{Jump}}$),一种用于联合多模态生成的新型 无需训练 单通道采样器。出于训练和评估的目的,我们已经创建并将发布三个大规模联合多模态生成语料库:$\text{JEdit-1M}$、$\text{JMaze-200K}$、$\text{JNono-200K}$,并具有匹配的分布内和分布外基准。 $\texttt{CO}_\texttt{2}\texttt{Jump}$ 在图像理解和编辑以及视觉推理(迷宫和非图解)方面实现了最佳联合性能。采样器的性能随着去噪步骤的数量单调缩放,这证明了跨模态耦合 $\textit{compound}$ 跨轨迹的好处。项目页面:https:// Coupled-jump.github.io