论文
THFM:用于 4D 人类感知及超越的统一视频基础模型
THFM: A Unified Video Foundation Model for 4D Human Perception and Beyond
摘要
我们提出了 THFM,一种以人为中心的感知的统一视频基础模型,它在单一架构中联合解决密集任务(深度、法线、分割、密集姿势)和稀疏任务(2d/3d 关键点估计)。 THFM 源自预训练的文本到视频扩散模型,被重新用作单前向传递感知模型,并通过可学习标记进行增强以进行稀疏预测。通过文本提示的调制,我们的单一统一模型能够执行各种感知任务。至关重要的是,尽管我们的模型只接受了合成数据的训练(即没有对现实世界或基准特定数据进行训练),但我们的模型在各种基准上都达到或超过了最先进的专业模型。我们进一步强调了我们模型的有趣的新兴特性,我们将其归因于底层基于扩散的视频表示。例如,我们的模型在场景中只有一个人的视频上进行训练,可以推广到多个人和其他对象类别,例如拟人化角色和动物——这种能力在过去尚未得到证实。