论文
HandsOnWorld:通过与相机分离的手部控制来生成不受约束的以自我为中心的视频
HandsOnWorld: Unconstrained Egocentric Video Generation with Camera-Disentangled Hand Control
摘要
我们提出了 HandsOnWorld,这是一个手动控制的以自我为中心的视频生成框架,可以直接从不受约束的单目视频中学习。先前的生成器依赖于来自多视图或基于标记的运动捕捉的 3D 手部注释,将它们限制在狭窄的、仪器化的场景分布中。为了弥补这一差距,我们引入了一个以主角为中心的注释管道,该管道在动作语义、图像质量和 3D 几何级别上过滤单眼 3D 重建,产生 EgoVid-Pro,这是一个干净的、仅限主角的手部轨迹数据集,跨越不同的日常场景,涵盖 103K 剪辑和大约 1200 万帧。这些不受约束的场景表现出大量的相机自我运动,这在桌面捕捉中基本上不存在,暴露了现有相机空间控制信号中相机和手部运动的纠缠。因此,我们提出了 Plücker Hand Map,它将 Plücker 射线从相机几何体扩展到手表面,表示与相机相同的世界框架中的手部运动,并在表示级别上解开两个运动源。实验表明,HandsOnWorld 在视觉保真度和控制精度方面优于先前的方法,并且可以推广到实验室环境之外。