论文

FixAnything:通过视频生成先验进行 3D 一致渲染细化

FixAnything: 3D-Consistent Rendering Refinement via Video Generative Priors

模型训练偏好优化

摘要

当输入视图稀疏或目标视图远离输入时,使用 3D 场景表示(例如高斯泼溅 (3DGS)、神经辐射场 (NeRF)、网格甚至点云)渲染视图会产生伪影。最近的工作使用基于扩散的生成先验来减轻这些伪影,但专门针对个体表示,并且需要定制架构或广泛的再训练。我们推出了 FixAnything,这是一个用于修复各种渲染工件的单一模型。它通过重新利用预训练的视频生成模型,利用其隐式多视图先验,仅进行最小的修改和轻量级微调来实现这一点。我们的主要见解是,即使是嘈杂渲染的序列也能保留相机运动和粗糙的场景结构,从而允许将清理公式化为视频到视频的转换。为了控制应保留的场景结构,我们引入了表示干净像素的二进制掩码,使模型能够将其输出锚定到高质量输入(例如训练视图),同时细化其余部分。为了鼓励 FixAnything 生成支持下游重建的 3D 一致渲染,我们使用相机姿势精度(通过运动结构恢复)作为直接偏好优化 (DPO) 的奖励信号。在四种不同的 3D 表示中,FixAnything 通过轻量级微调持续提高渲染质量,证明单个通用视频先验可以取代多个专业细化管道。该框架的简单性使得无需重新设计架构即可立即采用更强大的未来视频模型。