论文

HERMES++:迈向 3D 场景理解和生成的统一驾驶世界模型

HERMES++: Toward a Unified Driving World Model for 3D Scene Understanding and Generation

摘要

驾驶世界模型通过模拟环境动态,成为自动驾驶的关键技术。然而,现有方法主要关注未来场景生成,往往忽视全面的 3D 场景理解。相反,虽然 大语言模型 (LLM) 表现出令人印象深刻的推理能力,但它们缺乏预测未来几何演化的能力,从而在语义解释和物理模拟之间造成了显着差异。为了弥补这一差距,我们提出了 HERMES++,这是一种统一的驾驶世界模型,它将 3D 场景理解和未来几何预测集成在一个框架内。我们的方法通过协同设计来满足这些任务的独特要求。首先,BEV 表示将多视图空间信息合并到与 LLM 兼容的结构中。其次,我们引入 LLM 增强的世界查询,以促进理解分支的知识转移。第三,当前到未来的链接旨在弥合时间差距,根据语义上下文调节几何演化。最后,为了加强结构完整性,我们采用联合几何优化策略,该策略将显式几何约束与隐式潜在正则化相结合,以使内部表示与几何感知先验保持一致。对多个基准的广泛评估验证了我们方法的有效性。 HERMES++ 实现了强大的性能,在未来点云预测和 3D 场景理解任务中均优于专业方法。模型和代码将在https://github.com/H-EmbodVis/HERMESV2公开发布。