论文

视频生成模型是固有的光照估计器

Video Generation Models Are Inherent Lighting Estimators

应用与实践视觉感知与空间理解

摘要

从单个野外视频中恢复动态环境地图对于真实感渲染至关重要,但仍然是一个挑战。最近的视频生成模型可以生成具有复杂光照的逼真场景,并对光照具有固有的理解。在本文中,我们介绍了 V-LITE(视频生成模型是固有的光照估计器),该框架通过将光照估计重新定义为引导视频修复任务来解锁这种内部知识。受视觉特效行业实践的启发,我们在场景中插入了一个合成铬球,以迫使模型从周围的时空环境中生成物理上合理的反射。为了弥合 LDR 原生模型与 HDR 领域之间的差距,我们设计了一个 HDR 感知 VAE,并采用了高效的基于 LoRA 的 微调 策略。然后,我们构建一个混合数据集,其中包含高保真 HDR 图像以提供真实的 HDR 先验,以及野外 HDR 视频以提供动态时空上下文。大量实验表明,V-LITE 可以生成时间相干的 HDR 环境图,这表明现代视频扩散模型不仅是合成器,而且还是强大的、固有的物理场景照明估计器。