论文

Ego-InBetween:在以自我为中心的视频中生成对象状态转换

Ego-InBetween: Generating Object State Transitions in Ego-Centric Videos

应用与实践内容创作

摘要

理解物理转换过程对于人类认知和人工智能系统都至关重要,特别是从自我中心的角度来看,它是动作建模中人类和机器之间的关键桥梁。我们将这个建模过程定义为以自我为中心的指示视觉状态转换(EIVST),它涉及生成中间帧,这些中间帧描述了在简短的动作指令下初始状态和目标状态之间的对象转换。 EIVST 给当前的生成模型带来了两个挑战:(1)理解初始状态和目标状态的视觉场景,并从自我中心的角度推理转换步骤,以及(2)生成遵循给定指令的一致的中间过渡,同时保留两个视觉状态下的对象外观。为了应对这些挑战,我们提出了 EgoIn 框架。它首先使用 TransitionVLM 推断两个给定状态之间的多步骤转换过程,并在我们策划的数据集上进行微调,以更好地适应此任务并减少幻觉信息。然后,它根据所提出的转换条件模块产生的转换条件生成帧序列。此外,我们引入了对象感知辅助监督,以在整个转换过程中保持一致的对象外观。对人与物体和机器人与物体交互数据集的大量实验证明了 EgoIn 在生成语义上有意义和视觉上连贯的转换序列方面的卓越性能。