论文
Mem3R:通过测试时训练使用混合内存进行流式 3D 重建
Mem3R: Streaming 3D Reconstruction with Hybrid Memory via Test-Time Training
摘要
流式 3D 感知非常适合机器人技术和增强现实,其中必须高效且一致地处理长视觉流。最近的循环模型通过维持固定大小的状态并实现线性时间推理提供了一种有前途的解决方案,但由于压缩潜在记忆的容量有限,它们经常遭受长序列的漂移积累和时间遗忘。我们提出了 Mem3R,一种采用混合内存设计的流式 3D 重建模型,可将相机跟踪与几何映射分离,以提高长序列的时间一致性。对于相机跟踪,Mem3R 采用隐式快速权重存储器,作为通过测试时训练更新的轻量级多层感知器实现。对于几何映射,Mem3R 维护显式的基于标记的固定大小状态。与CUT3R相比,该设计不仅显着提高了长序列性能,而且将模型大小从793M参数减少到644M。 Mem3R 支持为 CUT3R 开发的现有改进的即插即用状态更新策略。具体来说,与 500 至 1000 帧序列的基本实现相比,将其与 TTT3R 集成可将绝对轨迹误差降低高达 39%。由此产生的改进还扩展到其他下游任务,包括视频深度估计和 3D 重建,同时保持恒定的 GPU 内存使用和可比较的推理吞吐量。项目页面:https://lck666666.github.io/Mem3R/