论文
LOME:通过动作条件的自我中心世界模型学习人机操作
LOME: Learning Human-Object Manipulation with Action-Conditioned Egocentric World Model
摘要
由于所涉及的运动的细粒度和接触丰富的性质,学习人体操纵提出了重大挑战。传统的基于物理的动画需要大量的建模和手动设置,更重要的是,它既不能很好地概括不同的对象形态,也不能有效地扩展到现实世界环境。为了解决这些限制,我们引入了 LOME,这是一种以自我为中心的世界模型,可以根据输入图像、文本提示和每帧人类动作(包括身体姿势和手势)生成逼真的人与物体交互。 LOME 通过在训练期间联合估计空间人类行为和环境背景,为物体操纵注入强大而精确的动作指导。在对各种以自我为中心的人与物体交互的视频上对预训练的视频生成模型进行微调后,LOME 不仅展示了较高的动作跟随准确性和对未见过的场景的强泛化性,而且还展示了手与物体交互的真实物理后果,例如,在执行“倒”动作后,液体从瓶子流到杯子中。大量的实验表明,我们的基于视频的框架在时间一致性和运动控制方面显着优于最先进的基于图像和基于视频的动作条件方法以及图像/文本到视频(I/T2V)生成模型。 LOME 为逼真的 AR/VR 体验和可扩展的机器人训练铺平了道路,而不受模拟环境或依赖显式 3D/4D 建模的影响。