论文

DAGS:冻结图像DiT的外观、几何与时序控制

DAGS: Disentangled Appearance-and-Geometry Steering of a Frozen Image DiT for Temporally Stabilized Generative Rendering

模型推理解码与生成控制

摘要

扩散Transformer(DiT)能根据文本和图像条件生成高保真图像,但输出方差较大,目标忠实度高度依赖条件的提供方式。我们提出DAGS,一种轻量、无注意力的外观与几何解耦条件方案,引导冻结图像DiT产生高保真、高忠实且可独立控制的渲染结果。两个小型卷积编码器每帧计算一次条件特征,并以可学习的逐层逐元素残差注入图像token,避免通过注意力堆叠条件的二次成本。控制和时序处理位于冻结骨干之外,因此保留其丰富的预训练先验,并消除骨干过拟合风险。我们还加入小型循环光照稳定器与免训练时序引导项,结合条件方案,将逐帧图像模型变为流式渲染器。DAGS以路径追踪的一小部分计算成本产生可控高质量渲染;它并非实时方法,而是在计算、可控性与质量之间取舍。在匹配的1-spp加G-buffer输入下,相比实时降噪器Intel OIDN和扩散渲染器RGB<->X,逐帧DAGS的重建PSNR分别提高8.6 dB和10.1 dB,感知时序稳定性以temporal-LPIPS闪烁度衡量提高2.5—8倍。