论文

UniMo:基于思维链的统一运动生成与理解

UniMo: Unified Motion Generation and Understanding with Chain of Thought

模型训练强化学习

摘要

现有的 3D 人体运动生成与理解方法常常缺乏可解释性,限制了这两个天然相关任务之间的有效相互增强。虽然当前基于大语言模型(LLM)的统一框架利用了语言先验,但它们经常在语义对齐与任务一致性上遇到挑战。此外,LLM 的下一 token 预测范式并不适合运动序列,会造成累积预测误差。为解决这些局限,我们提出 UniMo,一个通过监督微调(SFT)将运动-语言信息与可解释的思维链(CoT)推理集成到 LLM 中的新框架。我们进一步引入以 Group Relative Policy Optimization(GRPO)进行的强化学习作为后训练策略,它在 token 组上优化以强化结构正确性与语义对齐,缓解运动 token 预测中的累积误差。大量实验表明,UniMo 显著优于现有统一模型与任务专用模型,在运动生成与理解两方面均达到最先进性能。

UniMo:基于思维链的统一运动生成与理解
图3:在 text-to-motion 任务上,我们的方法与其他开源 SOTA(如 MoMask(Guo et al. 2024)与 MotionLLM(Wu et al. 2024a))的定性比较。我们的方法表现出更强的指令遵循能力,并能生成连续(sequential)动作。我们强烈建议读者观看补充材料中的视频对比。