论文

用于文本到动作生成的下一代自回归模型

Next-Scale Autoregressive Models for Text-to-Motion Generation

应用与实践内容创作

摘要

自回归 (AR) 模型提供稳定且高效的训练,但标准的下一个标记预测与文本条件运动生成所需的时间结构并不一致。我们引入了 MoScale,这是一种下一代 AR 框架,可以从粗略到精细的时间分辨率分层生成运动。通过提供最粗尺度的全局语义并逐步细化它们,MoScale 建立了一个更适合远程运动结构的因果层次结构。为了提高有限文本运动数据下的鲁棒性,我们进一步结合跨尺度分层细化来改进每尺度初始预测和尺度内时间细化以进行选择性双向重新预测。 MoScale 以高训练效率实现了 SOTA 文本到运动的性能,可根据模型大小有效扩展,并将零样本推广到各种运动生成和编辑任务。