论文
在测试时间内利用先验知识学习 3D 重建
Learning 3D Reconstruction with Priors in Test Time
摘要
我们引入了多视图 Transformer (MVT) 的测试时间框架,该框架结合了先验知识(例如相机姿势、内在函数和深度)来改进 3D 任务,而无需重新训练或修改预训练的纯图像网络。我们没有将先验输入到架构中,而是将它们作为预测的约束并在推理时优化网络。优化损失由自监督目标和先验惩罚项组成。自监督目标捕获多视图预测之间的兼容性,并使用来自其他视图和每个视图本身的渲染之间的光度或几何损失来实现。任何可用的先验都会转换为相应输出模式的惩罚项。在一系列 3D 视觉基准测试中,包括点图估计和相机姿态估计,我们的方法始终比基础 MVT 大幅提高性能。在 ETH3D、7-Scenes 和 NRGBD 数据集上,与仅基础图像模型相比,我们的方法将点图距离误差减少了一半以上。我们的方法还优于经过再训练的先验感知前馈方法,证明了我们的测试时间约束优化 (TCO) 框架将先验纳入 3D 视觉任务的有效性。