论文

GenIA:具有测试时输入对齐的生成重建

GenIA: Generative Reconstruction with Test-Time Input Alignment

模型推理应用与实践解码与生成控制视觉感知与空间理解

摘要

从单眼或稀疏多视图观察中重建完整的 3D 对象资产仍然具有挑战性。生成 3D 基础模型可以完成观察到的视图之外的对象几何形状,但它们的预测可能无法忠实地再现观察到的几何形状、外观或姿势。我们引入了 GenIA,这是一个用于测试时输入对齐生成的框架,它为 SAM3D 在几何和光度观测方面的生成先验奠定了基础,而无需重新训练基础模型。我们通过从几何中导出平移和缩放来改进对象姿势,同时保留先学的旋转,并通过可见性偏向注意力、交叉观察融合和去噪期间的可微渲染指导来对齐外观。可选的去噪后细化进一步调整了外观潜在、轻量级解码器适配器和对象放置以适应观察结果。我们的框架还支持外部提供的几何体;当给定动态对象的时间形状时,它会恢复共享的、与输入对齐的规范外观和稳定的世界空间放置。穿过 GenIA 通过合成和真实基准改进了单目、多视图和动态输入的姿态预测和对象重建,优于最近基于优化的每帧图像到 3D 和视频到 4D 方法。我们的项目页面可在https://facebookresearch.github.io/GenIA.上找到