论文

DeVI:通过合成视频模仿实现基于物理的灵巧人机交互

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

模型训练强化学习

摘要

视频生成模型的最新进展使得能够在各种场景和对象类别中合成真实的人与对象交互视频,包括运动捕捉系统难以捕捉的复杂灵巧操作。虽然这些合成视频中嵌入的丰富的交互知识在灵巧的机器人操作中具有强大的运动规划潜力,但它们有限的物理保真度和纯 2D 性质使得它们难以直接用作基于物理的角色控制中的模仿目标。我们提出了 DeVI(灵巧视频模仿),这是一种新颖的框架,它利用文本调节的合成视频来实现物理上合理的灵巧代理控制,以便与看不见的目标对象进行交互。为了克服生成 2D 线索的不精确性,我们引入了一种混合跟踪奖励,它将 3D 人体跟踪与强大的 2D 对象跟踪集成在一起。与依赖高质量 3D 运动学演示的方法不同,DeVI 仅需要生成的视频,从而实现跨不同对象和交互类型的零镜头泛化。大量实验表明,DeVI 的性能优于模仿 3D 人与物体交互演示的现有方法,特别是在建模灵巧的手与物体交互方面。我们进一步验证了 DeVI 在多对象场景和文本驱动的动作多样性中的有效性,展示了使用视频作为 HOI 感知运动规划器的优势。