论文
RelightFormer:用于多视图对象重新照明的前馈生成 Transformer
RelightFormer: Feed-forward Generative Transformer for Multiview Object Relighting
摘要
传统上,图像重新照明是通过复杂的逆渲染管道来解决的,这些管道会受到不适定优化的影响,或者单图像生成模型会忽略理解 3D 几何和材料相互作用所需的关键多视图线索。为了解决这些限制,我们引入了前馈生成 Transformer,用于直接单视图和多视图图像重新照明,完全绕过显式内在属性估计。我们的架构改编自视频基础模型,具有潜在照明模块,可通过交叉注意力动态地将目标环境图注入空间特征。此外,我们采用排列不变位置编码来对称处理无序多视图输入,而没有顺序偏差。为了训练这个强大的数据驱动模型,我们构建了庞大的 Laval Objaverse 数据集 (LOD),其中包含 90K 个对象和 39K 个独特的照明。大量的实验证明了最先进的视觉质量、逼真的重新照明质量以及跨单视图、多视图和新颖视图重新照明任务的强大的零镜头泛化能力。