论文

GeoWM:在显式几何中高效预测未来世界

GeoWM: Efficient Direct World Modeling in Explicit Geometry

模型架构混合架构

摘要

建模 3D 场景几何及其随时间的演变对于自动驾驶和机器人技术至关重要。一个常见的范例是使用世界模型来预测未来图像或环境的潜在表示,然后从这些预测中恢复几何形状。然而,这种范式没有明确地对几何结构进行建模,并且通常依赖于递归 执行轨迹 来达到更长的预测范围,从而导致错误累积并增加计算成本。为了解决这些限制,我们提出了 GeoWM,一种几何世界模型,可以直接预测指定未来地平线的未来场景几何形状,而无需递归 执行轨迹。关键思想是利用几何基础模型将观察到的 RGB 帧转换为几何历史,从而调节流匹配转换器来预测指定未来地平线的场景几何。我们进一步表明,轻量级相机运动预测器可以准确估计未来的视点,并且将观察到的几何图形投影到预测的视点中,为未来的几何预测提供了有效的几何先验。对涵盖城市驾驶、空中飞行和动态操纵的四个数据集进行的广泛实验表明,GeoWM 在预测深度、相机姿态和 3D 场景几何形状方面优于评估的世界模型,同时大大减少了较长视野下的推理时间。

GeoWM:在显式几何中高效预测未来世界:论文原图
图 2:GeoWM 概述:(a) 显式几何预测,(b) 流匹配转换器,以及 (c) 独立水平查询。