论文

通过可学习的掩模注意力和支持token细化进行无姿势前馈 3D 修复

Pose-Free Feed-Forward 3D Inpainting via Learnable Mask Attention and Support Token Refinement

应用与实践内容创作视觉感知与空间理解

摘要

3D 场景修复旨在恢复编辑的 3D 场景中丢失或遮挡的区域,同时确保几何和纹理的一致性。然而,现有的方法通常需要精确校准的相机姿态,这限制了它们在休闲、野外场景中的适用性,并引入了额外的预处理开销。为了克服这一限制,我们提出了 FreeInpaint,这是一种新颖的前馈框架,可以直接从具有遮罩区域的未摆出的多视图图像生成完整且 3D 一致的场景。 FreeInpaint 的核心是扩展 3D 基础模型,将遮罩区域从参考视图传播到其他未摆姿势的视图,桥接 3D 重建和场景修复,同时保留模型恢复相机姿势和场景几何形状的本机能力。我们的方法解决了使前馈 3D 基础模型适应屏蔽输入的两个关键挑战。首先,遮蔽区域会破坏跨视图对应推理,降低姿态估计和几何恢复。为了解决这个问题,我们引入了一种可学习的掩模注意力机制 保留可靠观测的空间锚定,同时允许屏蔽区域逐步吸收更深层中的有用上下文。其次,在严重遮挡的情况下,单次前向传球往往缺乏足够的外观证据来实现高保真完成。因此,我们提出了一种支持token细化策略,它将扩散生成的支持证据作为置信加权辅助token注入,以细化观察不足的区域,同时保留原始空间锚。跨不同数据集的大量实验表明,FreeInpaint 实现了卓越的修复质量,消除了对预先计算的相机姿势的依赖,同时保持了快速的推理速度。项目页面为https://rorisis.github.io/FreeInpaint/.