论文
HVG-3D:桥接真实域和模拟域以实现 3D 条件手-对象交互视频合成
HVG-3D: Bridging Real and Simulation Domains for 3D-Conditional Hand-Object Interaction Video Synthesis
摘要
最近的方法在手对象交互视频合成的视觉质量方面取得了显着的进步。然而,大多数方法依赖于缺乏空间表现力的 2D 控制信号,并限制了合成 3D 条件数据的利用。为了解决这些限制,我们提出了 HVG-3D,这是一个基于显式 3D 表示的 3D 感知手部对象交互 (HOI) 视频合成的统一框架。具体来说,我们开发了一种基于扩散的架构,并通过 3D ControlNet 进行增强,该架构对来自 3D 输入的几何和运动线索进行编码,以在视频合成期间实现显式 3D 推理。为了实现高质量合成,HVG-3D 设计有两个核心组件:(i) 3D 感知 HOI 视频生成扩散架构,对来自 3D 输入的几何和运动线索进行编码,以进行显式 3D 推理; (ii) 用于构建输入和条件信号的混合管道,从而在训练和推理过程中实现灵活和精确的控制。在推理过程中,给定单个真实图像和来自模拟或真实数据的 3D 控制信号,HVG-3D 会生成具有精确空间和时间控制的高保真、时间一致的视频。 TASTE-Rob 数据集上的实验表明,HVG-3D 实现了最先进的空间保真度、时间一致性和可控性,同时能够有效利用真实数据和模拟数据。