论文
EgoSim:用于生成具身交互的以自我为中心的世界模拟器
EgoSim: Egocentric World Simulator for Embodied Interaction Generation
摘要
我们介绍 EgoSim,一个闭环自我中心世界模拟器,它生成空间一致的交互视频并持续更新底层 3D 场景状态以进行连续模拟。现有的以自我为中心的模拟器要么缺乏明确的 3D 基础,导致视点变化时的结构漂移,要么将场景视为静态,无法跨多阶段交互更新世界状态。 EgoSim 通过将 3D 场景建模为可更新的世界状态来解决这两个限制。我们通过几何动作感知观察模拟模型生成实施例交互,并通过交互感知状态更新模块实现空间一致性。为了克服难以获取密集对齐的场景交互训练对所带来的关键数据瓶颈,我们设计了一个可扩展的管道,可以从野外大规模单目自我中心视频中提取静态点云、相机轨迹和实施动作。我们进一步介绍了 EgoCap,这是一种捕获系统,可以通过未校准的智能手机实现低成本的现实世界数据收集。大量实验表明,EgoSim 在视觉质量、空间一致性、复杂场景泛化和野外灵巧交互方面显着优于现有方法,同时支持跨实体迁移到机器人操作。代码和数据集即将开放。项目页面位于 egosimulator.github.io。