论文
Open-UniMo:在开放世界中迈向统一运动语言理解和生成
Open-UniMo: Towards Unified Motion-Language Understanding and Generation in the Open World
摘要
统一运动的生成和理解对于可以在开放世界环境中合成和解释人类行为的具体人工智能系统至关重要。现有的运动语言模型通常将运动视为语言模型的辅助模态,导致文本主导的表示和有限的跨模态交互。此外,下一个词元预测范例并不自然地适合长运动序列,其中自回归生成可能会积累预测误差。为了应对这些挑战,我们提出了 Open-UniMo,这是一种在百万级开放世界运动语言数据上进行训练的统一大型运动语言模型 (LMLM)。 Open-UniMo 通过使用 64K 动作标记扩展 Qwen 约 150K 文本标记的词汇量来促进模态对等,使动作和语言能够共享统一的标记空间。我们进一步引入运动一致的思想链推理作为桥梁语言语义和运动动力学的中间表示。 Open-UniMo 采用两阶段管道进行训练,其中监督微调建立了 CoT 引导的双向运动语言映射,组相对策略优化 (GRPO) 改进了语义对齐,同时减少了自回归运动词元生成中的累积错误。为了支持综合评估,我们提出了 Open-MoBench,这是一个 VLM 引导的基准,用于评估文本到运动 (T2M) 生成、运动到文本 (M2T) 理解和双向一致性。大量实验表明,Open-UniMo 在传统指标和 Open-MoBench 上均实现了最先进的性能。此外,消融研究表明,M2T 理解主要不受动作标记词汇量的限制;相反,将 M2T 与可学习的 T2M 生成路径相结合会产生更强的跨模式表示,证明生成可以促进基于 AR 的运动语言建模的理解。