论文

实现一致的视频几何估计

Towards Consistent Video Geometry Estimation

模型架构Transformer

摘要

这项工作提出了 ViGeo,一种前馈基础模型,用于从视频序列中恢复空间密集且时间一致的几何形状。 ViGeo 基于普通的 Transformer 架构而构建,无需针对特定任务的架构进行修改,支持统一模型内的流式传输、全序列和长视频推理。关键设计是动态分块注意力,它在训练期间将模型暴露在双向和因果时间上下文中,并允许模型在测试时调整其注意力模式而无需重新训练。为了提高监管质量,我们进一步引入了基于完成的数据细化框架。该框架训练视频深度补全教师,该教师以稀疏和噪声注释为条件,并利用视频/多视图上下文来生成密集、时间连贯且几何可靠的训练目标。除了深度图和点图之外,ViGeo 还可以在同一框架内预测表面法线。 ViGeo 仅在公共数据集上进行训练,在在线、离线和长视频深度估计、表面法线估计和视频点图估计方面实现了最先进的性能。