论文

OTT3R:多视图 3D 重建和 1% 计算的快速数据集生成

OTT3R: Multi-View 3D Reconstruction and Fast Dataset Generation at 1% Compute

摘要

前馈 3D 重建模型通过缩放模型和数据集大小取得了令人印象深刻的性能,但其成本排除了大多数研究小组并妨碍了边缘部署。此外,在没有传感器的情况下生成 3D 监督仍然依赖于缓慢且不可靠的运动结构,因为社区缺乏用于神经 3D 伪标签生成的类似 COLMAP 的系统。我们提出了 OTT3R(用于 3D 重建的 RGB-Only Tiny Transformer),这是一个知识蒸馏框架,可以在配备 2 个 GPU 的单个工作站上解决这两个问题。将 $π^3$(959M 参数)提炼为 102M 参数的学生,可产生 9.4$\times$ 压缩率和高达 7$\times$ 的推理速度,并以 VGGT 训练计算的 1.6% 进行训练。集成的伪标签管道提供了 COLMAP 的可靠、高吞吐量替代方案,可在 3.5 小时内在两个商用 GPU 上生成密集的每像素点图和 SE(3) 相机姿势,以生成 667K 图像语料库,并在我们测试的每个序列上取得成功,包括 COLMAP 失败的序列。一般学生在分布内单目深度和零样本方面跟踪教师,在 7 场景和 DTU 完成上优于 COLMAP,但它不能在分布外多视图几何上取代教师。可部署的工件是领域专业学生:在 0.2% 计算的专业化之后,它在 7 场景上以 980$\times$ 吞吐量比 COLMAP 准确 4$\times$,完成度接近教师。代码可在 https://github.com/TheFourthKaramazov/OTT3R 获取