论文
Flex4DHuman:用于 4D 人体重建的灵活多视图视频扩散
Flex4DHuman: Flexible Multi-view Video Diffusion for 4D Human Reconstruction
摘要
我们提出了 Flex4DHuman,一种多视图视频扩散模型,仅使用相对相机姿势调节即可将动态主体的单眼或稀疏多视图视频转换为同步密集多视图视频。与之前依赖于骨架、深度图、法线或渲染的目标视图几何形状的以人为中心的方法不同,Flex4DHuman 不需要显式的几何先验,而是通过相对相机姿势位置编码生成条件。生成的视频可以直接由下游重建管道摄取,以创建动态 4D 高斯图。 Flex4DHuman 基于 Wan 2.1 1.3B 文本到视频模型构建,保留了骨干架构,并通过五轴位置编码对相机和视图信息进行编码,该编码通过视图索引和连续 SE(3) 相对相机几何扩展了时空 RoPE。三阶段课程逐步训练模型的姿势跟踪、灵活的参考目标视图生成和时间采样轨迹。为了支持时间采样轨迹,我们使用干净的历史目标视图标记进行训练。我们还添加多视图描述以启用测试时文本控制。结合现成的 4D 高斯泼溅阶段,我们的框架将单目静态摄像机视频提升为动态 4D 高斯泼溅。 DNA-Rendering 和 ActorsHQ 的实验表明,Flex4DHuman 超越了之前最先进的方法,而相同的公式在人与动物混合训练后可以推广到动物类别。这些功能使 Flex4DHuman 迈出了从休闲单眼视频创建可扩展 4D 内容的实际一步,用于模拟、游戏、AR/VR 和视频重新拍摄。