论文
EgoMotion:以自我为中心的视觉语言运动生成的分层推理和扩散
EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation
摘要
在动态环境中忠实地模拟人类行为是体现智能的基本挑战。虽然条件运动合成已经取得了重大进展,但由于第一人称感知固有的复杂性,以自我为中心的运动生成在很大程度上仍未得到充分探索。在这项工作中,我们研究了以自我为中心的视觉语言(Ego-VL)运动生成。这项任务需要根据第一人称视觉观察和自然语言指令来合成 3D 人体运动。我们确定了一个关键的 \textit{推理生成纠缠} 挑战:语义推理和运动学建模的同时优化引入了梯度冲突。这些冲突系统地降低了多模态语义对齐和运动质量的保真度。为了应对这一挑战,我们提出了一个分层生成框架 \textbf{EgoMotion}。受认知推理和运动控制的生物解耦的启发,EgoMotion 分两个阶段运行。在认知推理阶段,视觉语言模型 (VLM) 将多模态输入投射到离散运动基元的结构化空间中。这迫使 VLM 获得目标一致的表示,有效地弥合了高级感知理解和低级动作执行之间的语义差距。在运动生成阶段,这些学习到的表示充当基于扩散的运动生成器的表达调节信号。通过在连续潜在空间内执行迭代去噪,生成器合成物理上合理且时间上相干的轨迹。广泛的评估表明,EgoMotion 实现了最先进的性能,并且产生的运动序列在语义上和运动学上都优于现有方法。