论文
Control-DINO:用于可控图像到视频扩散的特征空间调节
Control-DINO: Feature Space Conditioning for Controllable Image-to-Video Diffusion
摘要
视频扩散模型最近已成功应用于内容生成、新颖视图合成以及更广泛的世界模拟等问题。生成和传输中的许多应用都依赖于调节这些模型,通常通过感知、几何或简单的语义信号,从根本上将它们用作生成渲染器。与此同时,通过对图像或点云进行大规模自监督学习获得的高维特征越来越多地用作视觉模型的通用接口。已经针对特定主题的编辑、对齐和训练视频扩散模型探索了两者之间的联系,但并未在预训练视频扩散模型的密集调节信号中发挥作用。通过像 DINOv3 这样的自监督学习获得的特征包含大量关于场景的风格、光照和语义的复杂信息。这使得它们擅长重建任务,但限制了它们的生成能力。在本文中,我们展示了如何将这些功能用于视频域传输和 3D 视频生成等任务。我们引入了一种轻量级控制架构和训练策略,将外观与我们希望保留的其他功能分离,从而能够对外观变化(例如风格化和重新照明)进行稳健控制。此外,我们表明,低空间分辨率可以通过更高的特征维度来补偿,从而提高显式空间表示生成渲染的可控性。