论文

Timo:运动学感知多模态扩散 Transformer

Timo: $\textbf{T}$aming Mult$\textbf{i}$modal Diffusion Transformer for Human $\textbf{Mo}$tion Generation

模型架构Transformer

摘要

大多数现有的人体运动生成(HMG)方法使用交叉注意模块来注入文本语义,但忽略了运动和文本标记之间双向建模的重要性,这限制了文本理解。一个简单的想法是将多模态扩散变换器 (MMDiT) 引入 HMG,该变换器已在视觉生成中展示了有效的联合文本(视觉建模)。然而,我们发现关节运动在时间上是连贯的,但关节之间的相关性较弱,其中直接应用具有流匹配的 MMDiT 会产生协调性差且不稳定的运动。在这项工作中,我们提出了 Timo,一种专为 HMG 量身定制的新型运动学感知 MMDiT 框架。 Timo 将双向文本的完全共享的多模态注意力结合起来——运动建模与流匹配、几何和旋转运动学监督(比较实际旋转及其随时间的变化)以及从广泛的运动学习到详细的字幕对齐的两阶段课程。此外,我们从涵盖不同动作的六个公共数据集中构建了包含40025个留出动作片段的基准,在通用评估器和评分协议下评估了六个互补维度。我们的模型在定量和定性评估方面都远远优于最先进的方法。值得注意的是,Timo 在六个维度中的五个维度上超越了 Kimodo,平均基准得分相对提高了 40.8%。项目页面:https://kyfafyd.wang/projects/timo。演示页面:https://timo.kyfafyd.wang。

Timo的文本—动作联合生成、模型块结构与运动学训练目标。
图2(图注摘要):Timo的文本—动作联合生成、模型块结构与运动学训练目标。