论文

GeoSem-WAM:几何和语义感知的世界行动模型

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

模型训练预训练

摘要

最近的世界行动模型(WAM)在具体决策方面表现出了令人印象深刻的能力。然而,它们的有效性是否源于预测训练引起的推理或表征学习过程中明确的未来想象仍然是一个悬而未决的问题。新出现的证据表明,主要优势在于学习强大的潜在表示,而不是在测试时生成未来的观察结果。然而,现有的 WAM 主要依赖于基于 RGB 的未来预测,这对复杂环境提供了有限的结构和空间理解。为了解决这个问题,我们提出了一个结构化的世界建模框架,通过几何和语义监督增强潜在表示。除了未来的 RGB 预测之外,我们的模型还引入了两个用于未来几何和语义表示的辅助预测分支,使其能够在统一的潜在空间中联合捕获场景动态、空间几何和语义上下文。至关重要的是,我们的方法通过避免在测试时明确的未来执行轨迹或视频生成来保持有效的推理。大量实验表明,结合结构化世界监督可以持续提高动作预测的准确性、场景理解以及在具有挑战性的具体场景下的鲁棒性,突显其推进可扩展且高效的 WAM 的潜力。