论文

Exo2EgoHOI:手部物体交互感知的外中心到自我中心视频生成

Exo2EgoHOI: Hand-Object-Interaction Aware Exocentric-to-Egocentric Video Generation

模型训练参数高效训练

摘要

以自我为中心的人类操纵视频为具体智能提供了宝贵的视觉体验,但大规模收集此类数据的成本很高。从外心到自我中心的视频生成通过将丰富的第三人称操作视频转换为第一人称观察提供了一种可扩展的替代方案。然而,由于细粒度交互指导不足和以对象为中心的锚定较弱,现有方法常常难以在大的视点变化中忠实地保留演示的手与对象交互(HOI)。我们提出了 Exo2EgoHOI,一个 HOI 感知视频生成框架,用于保留交互的外中心到自我中心的转换。为了保留细粒度的 HOI,我们引入了统一的 4D HOI 先验,它结合了场景几何、铰接式手渲染和密集的手-对象关系场,以及用于将结构和关系线索注入视频生成主干的双分支残差适配器。为了保持对象一致性,我们引入了分解门控交叉注意,它分别对对象和背景引用进行编码,并自适应地将全局语义和局部外观特征集成为以对象为中心的锚点。 ARCTIC-HOI 和 Ego-Exo4D 上的实验表明,在保持有竞争力的视觉保真度的同时,对象一致性和 HOI 保存方面有了显着改进。特别是,在 ARCTIC-HOI 上,相对于各自的最佳基线结果,Exo2EgoHOI 将对象 mIoU 提高了 32.3%,并将 MPJPE 和 PA-MPJPE 分别降低了 34.7% 和 50.0%。项目页面:https://rcl-robotics.github.io/Exo2EgoHOI/.