论文
3D-Belief:通过生成 3D 世界建模进行具体信念推断
3D-Belief: Embodied Belief Inference via Generative 3D World Modeling
摘要
视觉生成模型的最新进展凸显了学习生成世界模型的前景。然而,大多数现有方法将世界建模框架为新颖的视图合成或未来框架预测,强调视觉现实主义,而不是在部分可观察性下行动的具体代理所需的结构化不确定性。在这项工作中,我们提出了一个不同的观点:世界建模作为 3D 空间中体现的信念推理。从这个角度来看,世界模型不应该仅仅渲染可能看到的东西,而是在获得新的观察结果时维护和更新智能体对未观察到的 3D 世界的信念。我们确定了此类模型的几个关键功能,包括空间一致的场景记忆、多假设置信采样、顺序置信更新以及对未见区域的语义通知预测。我们在 3D-Belief 中实例化这些想法,这是一种生成 3D 世界模型,可以从部分观察中推断出明确的、可操作的 3D 信念,并随着时间的推移在线更新它们。与之前的视觉预测模型不同,3D-Belief 直接以 3D 形式表示不确定性,使具体代理能够想象合理的场景完成情况,并对部分观察到的环境进行推理。我们使用我们提出的 3D-CORE 基准评估场景记忆和未观察场景想象、对象和场景级 3D 想象的 2D 视觉质量的 3D-Belief,以及模拟和现实世界中具有挑战性的对象导航任务。实验表明,与最先进的方法相比,3D-Belief 提高了 2D 和 3D 想象质量以及下游具体任务性能。