论文
ReViV:从单目自我中心视频重建观看者和 4D 视图
ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video
摘要
以自我为中心的设备,例如可穿戴前置摄像头,为捕捉人类观看者与周围环境之间的持续交互提供了独特的视角。因此,非常需要一个能够重建这种 4D 表示的整体且高效的多模态模型。然而,现有的方法通常依赖于辅助输入,例如预先计算的相机轨迹,将场景感知和人类自我运动建模视为单独的问题,尽管它们相互依赖性很强,并且推理时间很慢。为了解决这些限制,我们提出了 ReViV,这是第一个用于整体自我中心 4D 重建的统一框架,可以从单个单目 RGB 视频中提取观看者和视图动态。我们将任务制定为学习多模态信号的完整联合概率分布,包括 RGB 视频、相机轨迹、注视方向、全身运动、手部运动和深度。 ReViV 由 Masked Generative Egocentric Transformer 提供支持,在单个前馈架构中运行,以快速推理速度同时重建跨观看者和视图的时间一致的 4D 重建。在 HoloAssist、HOT3D、ARCTIC、Aria Digital Twin 和 TACO 等不同基准上进行的大量实验表明,ReViV 在整体自我身体、手部和视线重建、相机跟踪方面实现了最先进的准确性和效率,同时保持高度竞争性的以自我为中心的深度估计,而不依赖于繁重的特定任务先验。代码和模型完全开源:https://reviv4d.github.io/。