论文
Odoriko:用于人体运动的形状感知多模态扩散框架
Odoriko: A Shape-Aware Multimodal Diffusion Framework for Human Motion
摘要
人体运动生成已在不同的输入模式、文本、音乐和视频中得到了广泛研究,最近的努力已将这些统一到单一的多模式框架中。然而,虽然已知性别和体型等形态因素会产生不同的运动学特征,但现有的统一框架没有将其纳入生成中,将所有受试者视为形态上等效的。我们提出了 Odoriko,这是第一个统一的多模态运动生成框架,它直接在合成运动输出中反映受试者的生物形态信息。 Odoriko 不是对主体变化进行平均,而是在单个模型内的文本、音乐和视频条件下生成与移动者一致的运动,而不仅仅是他们被要求做的事情。当无法获得明确的形态信息时,Odoriko 还可以恢复对象的形态和运动,将估计和生成统一在一个框架中。文本到动作、音乐到舞蹈和视频到动作基准的广泛实验表明,Odoriko 在标准指标上匹配或超过了先前的专用模型,同时实现了现有统一框架不支持的形态一致的生成。