论文

IMAGIN-4D:图像引导的可控交互生成

IMAGIN-4D: Image-Guided Controllable Interaction Generation

应用与实践内容创作

摘要

生成人机交互 (HOI) 是角色动画、机器人、AR/VR 和实体 AI 的核心。最近的 HOI 生成方法从文本、对象几何形状和稀疏路径点合成运动,控制动作语义和对象轨迹。然而,这些信号未指定交互:相同的提示和轨迹可以产生不同的抓握、接近方向、身体姿势、物体姿势、接触和身体-物体布局。我们通过参考图像作为所需交互快照的视觉规范来解决这种模糊性。然而,单个全局图像表示将不同的线索合并在一起,并将所有帧置于相同的视觉证据上。因此,我们引入了 IMAGIN-4D,一种基于扩散的 HOI 生成器,可在时空上分解图像调节。对于空间调节,IMAGIN-4D 提取所描绘帧处的身体姿势、物体姿势、身体-物体接触和空间关系的监督交互状态标记。对于时间调节,它通过查询每个生成帧的图像补丁来计算帧感知标记,从而允许序列片段关注同一图像中的不同视觉线索。为了平衡图像、文本和路点提示,IMAGIN-4D 使用角色感知调节:文本、路点和交互状态标记使用单独的 AdaLN 流,而帧感知视觉标记与运动标记交叉参与。由于 HOI 运动数据集缺乏配对图像,因此我们从 FullBodyManipulation (FBM) 构建了一个合成的运动到图像渲染管道,并引入了图像粘附指标来评估生成的运动是否与参考快照匹配。 FBM 和 BEHAVE 实验表明,IMAGIN-4D 改进了对单标记和统一图像条件基线的细粒度交互控制,同时保留了航路点跟踪和运动质量。代码和模型将在 https://imagin4d.github.io 发布。