论文

MoTiGA 用因果动作表示与偏好优化生成人体动作

Multi-level Causal LLM-based Text-to-Motion Generation with Human Alignment

应用与实践模型训练模型推理偏好优化解码与生成控制内容创作

摘要

基于大语言模型的文本驱动人体动作生成虽已有进展,仍难生成细粒度且语义一致的动作。问题来自细粒度动作量化误差、因果推理语言与非因果动作表示不匹配,以及缺乏人类偏好对齐。我们提出MoTiGA,一个结合人类对齐的多级因果文本生成动作框架。首先使用因果RVQ-VAE构建多级、细粒度因果动作表示,以迭代残差量化和因果卷积减少量化误差,同时保持与语言表示一致的因果性。随后引入时滞因果预测,在保持时间依赖的同时,并行预测不同动作Token层级。最后提出多级混合加权偏好优化(MHPO),动态调整语义相似性权重及连续相似性评分,以增强人类对齐。配套发布首个大规模动作生成偏好数据集HumanML3D-R,包含101,490组人类偏好对。相较其他基于大语言模型的方法,MoTiGA在HumanML3D和KIT-ML上的FID分别改善82.3%和64.7%。