论文

OmniHuman:以人为中心的视频生成的大规模数据集和基准

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation

模型评测基准与评测资源

摘要

音视频联合生成模型的最新进展展示了令人印象深刻的内容创建能力。然而,在复杂的真实物理场景中生成以人为中心的高保真视频仍然是一个重大挑战。我们发现,根本原因在于现有数据集在三个维度上的结构缺陷:有限的全局场景和摄像机多样性、稀疏的交互建模(人与人和人与物体)以及个体属性对齐不足。为了弥补这些差距,我们推出了 OmniHuman,这是一个专为细粒度人体建模而设计的大型多场景数据集。 OmniHuman 提供了涵盖视频级场景、帧级交互和个体级属性的分层注释。为了促进这一点,我们开发了一个用于高质量数据收集和多模式注释的全自动管道。作为数据集的补充,我们建立了 OmniHuman Benchmark (OHBench),这是一个三级评估系统,为以人为中心的音视频合成提供科学诊断。至关重要的是,OHBench 引入了与人类感知高度一致的指标,通过提供跨全局场景、关系交互和个体属性的全面诊断,填补了现有基准的空白。