论文

MotionMERGE:用于人体动作编辑、推理、生成和解释的多粒度框架

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

模型训练预训练

摘要

最近的运动语言模型统一了理解和生成等任务,但操作粒度较粗,缺乏对动画或交互所需的身体部位的细粒度理解和细致入微的控制。这源于模型和数据的根本问题,其中模型无法关注运动的局部模式,并且训练数据缺乏细粒度的监督。为了解决这个问题,我们提出了 MotionMERGE,这是一个弥合粒度差距的统一框架。首先,我们开创了细粒度语言引导运动控制的研究,包括详细理解和本地化编辑,通过在单个 LLM 内对部分和时间级别的运动进行显式建模,从而赋予模型强大的先验以进行精确控制。其次,我们设计了 ReasoningAware Granularity-Synergy 预训练,这是一种新颖的策略,采用联合监督来进行跨粒度对齐、时间基础、局部对齐、运动一致性和运动基础思想链(CoT)推理。这使模型具有细粒度的运动语言对齐、跨粒度协同和显式推理能力。第三,我们策划了MotionFineEdit,一个大规模数据集(837K原子+144K复杂三元组),具有第一个细粒度时空校正指令和基于运动的CoT注释,为细粒度文本驱动的运动编辑和基于运动的推理建立了新的基准。大量实验证明了 MotionMERGE 能够实现更精确的运动生成、理解和编辑,以及对其他复杂运动任务的引人注目的零样本泛化。这项工作代表着朝着以更细粒度和类人推理与运动交互的模型迈出了重要一步。