论文

Archon:用于整体数字人类生成的统一多模态模型

Archon: A Unified Multimodal Model for Holistic Digital Human Generation

模型训练预训练

摘要

数字人类是沉浸式交互的基础,但为包括文本、音频、动作和视觉内容在内的整体模式创建统一的模型仍然是一个开放的挑战。在本文中,我们提出了 Archon,一个完全预训练的、以人为中心的统一多模态模型,用于生成整体化身。 Archon 将七种模态与特定模态分词器统一起来,并在同步模态和 72 个不同任务上预训练了原生自回归统一多模态模型,以对整体联合分布进行建模。为了解决高保真谈话视频中的词元爆炸挑战,我们引入了一种内存高效的语义视频重新参数化,在保留细粒度动态的同时实现了 4 倍的词元减少,再加上语义驱动的视频扩散解码器。我们进一步提出“模态思维”,将模糊的跨模态任务分解为替代模态链中的逐步思维,逐步增强保真度和可控性。大量实验表明,Archon 在不同的数字人类生成任务中实现了卓越或相当的性能,验证了我们统一框架的有效性。项目页面:https://zju3dv.github.io/archon/。