论文
GenHOI:通过模仿生成的视频来实现接触感知的人形物体交互,无需特定任务的训练
GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training
摘要
人形-物体交互(HOI)是人形机器人的一项基本能力,但由于动态平衡和与不同物体的稳定交互之间的紧密耦合,它仍然具有挑战性。现有方法通常需要耗时的特定任务策略训练或依赖于严格的轨迹重放,这限制了它们适应新交互场景的能力。在这项工作中,我们提出了 \textit{GenHOI},一个简单而有效的框架,使人形机器人能够通过直接模仿单个生成的视频,以零镜头的方式执行各种对象交互任务,而无需特定于任务的训练或物理演示数据。 GenHOI 首先在模拟中重建机器人对象场景并渲染第一帧图像,该图像与语言命令一起决定了面向任务的交互视频的合成。然后分析生成的视频,以识别与交互相关的接触事件并估计手部物体接触区域,这些区域被编码为以物体为中心的几何约束,将视觉交互线索转换为基于物理的优化先验。在这些先验的指导下,从视频中恢复的参考运动被细化和平滑,以解决 2D 视频生成中固有的尺度模糊性,同时使单个参考轨迹适应看不见的机器人-物体相对姿势。优化后的轨迹最终由闭环跟踪控制器执行。我们在广泛的模拟和现实世界实验中验证了所提出的框架,涉及各种对象交互任务,包括盒子抓取、不对称双手椅子搬运、从下面抬起桌子和圆柱形物体包围。