论文

MotionVLA:人形运动的视觉-语言-动作模型

MotionVLA: Vision-Language-Action Model for Humanoid Motion

摘要

从场景图像和文本生成逼真的人形运动涉及低频姿势语义和高频物理动力学。然而,许多现有方法使用单个共享码本对运动进行标记,迫使异构运动信号进入相同的量化空间。我们对人体运动数据的频域分析揭示了单码本量化和运动统计之间明显的不匹配:五个 DCT 系数捕获了 93% 的关节位置能量,但仅捕获了 37% 的关节速度能量,这可能会使量化偏向姿态统计并不能充分表示高频速度分量。第二个挑战在于采用标准自回归模型来有效地对运动序列中的高频物理信号进行建模。因此,我们提出 DSFT,一种双流频率分词器,它将运动分离为基本流和物理流,并使用 DCT 截断和 BPE 独立压缩它们。此外,我们提出了 MotionVLA,一个基于 Qwen3.5 的模型,它将 Base 和物理词元按统一的顺序排列,其中 Phys 词元在 Base 词元之后预测。 HumanML3D 和 MBench 上的实验表明,尽管使用轻量级 2B 主干,MotionVLA 在 HumanML3D 上将与真实数据的多样性差距减少了 50% 以上,在 MBench 上将运动条件一致性提高了 3.8%,支持频率感知双流解耦作为自回归运动生成的有效公式。代码:https://github.com/AIGeeksGroup/MotionVLA。网站:https://aigeeksgroup.github.io/MotionVLA。