论文

ROAR-3D:路由任意视图以实现高保真 3D 生成

ROAR-3D: Routing Arbitrary Views for High-Fidelity 3D Generation

上下文与知识上下文工程

摘要

单图像到 3D 生成模型现在可以生成高质量的几何图形,但对单个视图的调节不可避免地会引入关于未见区域的模糊性。多视图调节可以减少这种模糊性,但现有方法要么需要固定的规范视点,要么依赖外部重建模块,这会带来沉重的训练成本并限制生成质量。我们观察到预训练的单视图模型已经拥有强大的 2D 到 3D 基础,可以重复用于多视图调节。然而,更仔细的分析表明,它们的调节机制将方向控制与几何传递纠缠在一起,当来自不同视点的图像被简单地组合时,这两个功能会发生冲突。基于此分析,我们提出了 ROAR-3D,这是一种轻量级方法,可升级预训练的单视图模型以接受任意数量的未摆出图像。词元智能视图路由器将每个 3D 潜在词元分配给其最相关的视图,隐式建立 2D 到 3D 对应关系,而无需显式姿势输入。双流注意力设计保留了预训练的主视图行为,同时通过专用于几何丰富的单独路径路由辅助视图。方向扰动策略确保辅助路径学习与方向无关的几何传递。这些组件引入了最少的可训练参数,并且相对于单视图基线增加了可以忽略不计的推理开销。 ROAR-3D 实现了最先进的多视图 3D 生成质量,并支持测试时视图从 1 个视图缩放到 12 个以上视图,并进行了持续改进。