论文
4DAnyone:通过休闲单眼视频以 4D 形式创建任何人
4DAnyone: Create Anyone in 4D from a Casual Monocular Video
摘要
我们提出了 4DAnyone,这是一个框架,用于通过生成重建级多视图一致视频并将其提升为 4D 高斯泼溅 (4DGS),从未经校准的单眼视频重建 4D 人类。现有的摄像机控制视频扩散模型可以合成合理的新颖视图视频,但在扩展到 4DGS 重建所需的数十个目标视图时无法保持一致性。我们将这种失败识别为有界注意上下文问题:当目标视图超过单个 DiT 前向传递的容量时,它们必须分成组,从而暴露两个耦合的瓶颈。在参考上下文方面,对所有先前生成的视图的调节随着 $O(N)$ 增长,削弱了跨视图外观指导。在目标上下文方面,不相交的群体无法直接交换信息,导致全局结构漂移。 4DAnyone 通过两种互补的设计解决了这两个瓶颈:参考上下文打包 (RCP) 将不断增长的参考视图压缩为固定长度的混合分辨率上下文,参考上下文复杂度为 $O(1)$,而目标上下文路由 (TCR) 在去噪期间旋转目标视图分组,以便在高噪声步骤中跨组共享上下文,并在低噪声步骤中稳定细节。我们使用我们的内部游戏引擎进一步构建 MVGameHuman 数据集,并将其与光舞台和野外视频数据集相结合进行训练。 DNA-Rendering 和 DyMVHumans 的实验表明,4DAnyone 在新视角视频质量和下游 4DGS 重建方面均优于先前方法,并具有强大的野外泛化能力。请参阅我们的项目页面以获取视频结果和源代码:https://4danone.github.io。