论文
Imagine2Real:通过视频生成先验实现零样本人形物体交互
Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors
摘要
全身人形物体交互 (HOI) 因缺乏高保真 3D 数据而受到瓶颈。虽然视频生成先验提供了一种有前途的替代方案,但现有方法由于依赖几何先验(例如显式 CAD 模型)而遭受 \textit{表示错位},以及由于密集变形和形态不匹配而产生的 \textit{重定向复杂性}。我们提出 Imagine2Real,一个零样本 HOI 框架,用于灵活、无几何形状的交互。为了解决未对准问题,我们将机器人和物体运动制定为统一的 4D 点轨迹。为了克服重定向的复杂性,我们的关键点跟踪器仅跟踪稀疏的关键点(底座、手和物体),完全绕过错误放大的重定向过程。为了在信号稀疏的情况下保持自然步态,我们利用行为基础模型(BFM)的潜在空间作为跟踪器的搜索域。 Imagine2Real 使用渐进式训练策略,通过简单的跟踪奖励来学习稳健的行为,从而在动作捕捉 (mocap) 系统中实现零镜头物理部署。