论文
RHINO:通过单目视频重建人类与新物体的交互
RHINO: Reconstructing Human Interactions with Novel Objects from Monocular Videos
摘要
以 3D 方式重建人、物体及其交互是智能系统的长期目标。通常,输入是来自移动摄像机的 RGB 视频,这使得任务不适定;深度不明确,人和物体相互遮挡,相机和物体运动纠缠以产生明显的运动。大多数先前的工作都是孤立地处理人或物体,忽略他们的相互作用,或者假设已知的 3D 形状或相机,这对于现实世界的应用来说是不切实际的。我们开发了 RHINO(用新颖对象重建人类交互),这是一个三步框架,可以从单眼 RGB 视频中以 3D 方式恢复人类、新颖(看不见的)操纵对象以及公共世界框架中的静态场景。首先,我们利用 3D 感知基础模型来获取稳定运动结构 (SfM) 的线索,即使对于低纹理区域也是如此;这会根据前景像素产生被操纵对象的粗略形状和表观运动,并根据背景像素产生粗略的场景形状和相机运动。其次,我们通过现成的方法估计相机帧中的人,并从表观运动中减去相机运动来提取物体运动;这将人类、物体和粗糙的场景形状记录到一个共同的世界框架中。第三,我们使用具有每个组件符号距离场的组合神经场来细化形状。后者进一步实现了可微分的接触先验,吸引表面,同时惩罚相互渗透,提高最终重建的物理合理性。为了进行评估,我们捕获了与体积 4D 捕获平台同步的手持式单目视频的新数据集,提供了 真值 形状和相机运动。 RHINO 在新颖视图合成和 4D 重建方面优于最先进的基线。消融表明每个阶段都有很大的贡献。代码和数据可在 https://lxxue.github.io/RHINO 获取。