论文
MUGEN:高效运动理解和生成的统一框架
MUGEN: A Unified Framework for Efficient Motion Understanding and Generation
摘要
将人类运动建立在语言基础上,并将语言建立在运动基础上,是迈向能够理解、生成和交流人类行为的物理人工智能系统的核心一步。统一运动语言系统首先通过共享的离散运动码本将两个方向耦合起来,但量化限制了生成质量。最强大的生成器以不断增长的成本买回质量:堆叠的剩余码本扩大了表示;屏蔽解码阶段、长自回归生成轨迹以及数十到数百步的去噪链延伸了推理;即使其中的连续潜在设计也只能通过迭代扩散头才能达到其潜在能力;这些解码机制都无法帮助理解。因此,我们提出了 MUGEN,一种统一的运动语言框架,无需支付任何费用:无需密码本,只需一次抽奖。单个自适应长度自动编码器将任意长度的运动压缩为几个连续的潜在槽,这是系统唯一的运动表示:语言模型生成它们以用于文本到运动,并读回它们以进行运动理解。深度路由隐藏状态让每个槽从它需要的 Transformer 深度读取,并且校准头预测整个潜在集上的联合分布,因此单次绘制携带描述允许的文本条件、跨槽变化。以 K 个语言模型步骤、一次绘制和一次解码器传递的解码成本,MUGEN 在 HumanML3D 上的 FID 上领先语言模型基线,同时将检索精度提高到标准评估器下的真实运动参考之上,实现了最佳 CIDEr 和 BLEU@4 分数,并在 SnapMoGen 上的每个检索和对齐指标上超越了离散词元的最新技术。