论文

通过连续时间强化学习的图像辅助

Image AID via continuous-time reinforcement learning

模型训练强化学习

摘要

我们使用生成扩散模型研究图像修复。现有方法通常要么训练专用的特定于任务的模型,要么在部署时为每个屏蔽图像单独调整预训练的扩散模型。我们引入了一种中间模型,称为扩散分摊修复(AID),它保持预训练的扩散主干固定,离线训练一个小型可重用指导模块,然后在遮罩图像中重用它,而无需针对每个实例进行优化。我们将其表述为具有监督最终目标的确定性指导问题。为了使这个问题在高维度上可学习,我们推导了一个辅助高斯公式,并证明解决这个随机问题可以恢复最佳的确定性制导场。这个桥梁产生了一个有原则的连续时间演员-评论家算法,用于以完全数据驱动的方式学习引导模块。根据经验,在像素 EDM 管道下的 AFHQv2 和 FFHQ 上以及在潜在 EDM2 管道下的 ImageNet 上,AID 持续提高了质量 - 与强大的固定骨干和跨多个掩模类型的摊销修复基线进行速度权衡,同时增加了不到 1% 的可训练开销。