论文

宏观:无需训练 用于特写渲染优化的多平面注意力

MACRO: Training-free Multi-plane Attention for Closeup Render Optimization

模型推理解码与生成控制

摘要

特写渲染,放大远超出任何训练摄像机的场景,对于虚拟制作和交互式 3D 内容非常重要,但仍然是一个开放的挑战。 3D 高斯泼溅 (3DGS) 可实现高保真、实时新颖的视图合成,但其渲染质量在近距离时会降低。最近基于扩散的方法通过调节训练集中的参考图像来增强渲染,在此设置中会产生明显的伪影。我们分析了这种失败并确定了其根本原因:特写视图和参考视图之间的比例差距。我们表明,参考条件增强模型中的特征不是尺度不变的,当相同内容出现在不同尺度时,会导致跨视图注意力检索不正确的对应关系,并且这种不匹配无法在潜在空间中纠正,因为 VAE 编码器不是尺度等变的。在此分析的基础上,我们介绍了 MACRO(用于特写渲染优化的多平面注意),这是一种用于从 3DGS 合成高质量特写新颖视图的 无需训练 方法。 MACRO 通过利用场景已知的 3D 结构来解决比例差距:它将特写分解为深度平面,裁剪并调整图像空间中的参考大小,以在编码之前匹配每个平面的比例,并应用深度感知注意掩模,以便每个标记仅关注比例匹配的参考。该方法不需要架构更改或额外训练。我们进一步贡献了两个新的特写新颖视图合成基准,这是该设置的第一个标准化评估协议,并在这两个基准上展示了最先进的结果,在重建和感知指标方面均优于现有的 3DGS 和基于扩散的方法。项目页面:https://nitzanhod.github.io/MACRO