论文
计划,而不是姿势:使用文本对齐的 BFM 生成长复合运动
Plan, Don't Pose: Long Composite Motion Generation with Text-Aligned BFM
摘要
文本到动作 (T2M) 生成在角色动画、虚拟化身和人机交互中具有广泛的应用。现有方法通常直接从语言生成姿势轨迹或运动标记,迫使单个模型处理语义解释、长视野结构和低级物理实现。这种耦合使得它们成本高昂,并且对于长的、组合的或语义密集的提示来说通常不可靠。我们提出了 Text2BFM,这是第一个将自然语言与预训练的行为基础模型 (BFM) 结合起来的框架,用于 T2M 生成,而无需依赖繁重的端到端运动生成器。 Text2BFM 在冻结 BFM 的潜在策略空间中运行,将其用作可执行的运动先验。文本对齐的变分行为瓶颈将 BFM 策略潜在序列压缩为与语言兼容并保留长视野行为结构的紧凑运动表示。生成是使用轻量级条件生成器在这个紧凑的行为流形中执行的,并且生成的潜在编码行为被解码为驱动预训练的冻结 BFM 的策略潜在。通过将语义规划与运动执行解耦,Text2BFM 实现了高效、稳健的 T2M 生成,并在长的组合文本描述上实现了强大的性能。