论文
UniMo:基于思维链的统一运动生成与理解
UniMo: Unified Motion Generation and Understanding with Chain of Thought
摘要
现有的 3D 人体运动生成与理解方法常常缺乏可解释性,限制了这两个天然相关任务之间的有效相互增强。虽然当前基于大语言模型(LLM)的统一框架利用了语言先验,但它们经常在语义对齐与任务一致性上遇到挑战。此外,LLM 的下一 token 预测范式并不适合运动序列,会造成累积预测误差。为解决这些局限,我们提出 UniMo,一个通过监督微调(SFT)将运动-语言信息与可解释的思维链(CoT)推理集成到 LLM 中的新框架。我们进一步引入以 Group Relative Policy Optimization(GRPO)进行的强化学习作为后训练策略,它在 token 组上优化以强化结构正确性与语义对齐,缓解运动 token 预测中的累积误差。大量实验表明,UniMo 显著优于现有统一模型与任务专用模型,在运动生成与理解两方面均达到最先进性能。
