论文

MoSE3:在每个像素学习世界系SE(3)

MoSE3: Learning World-Space SE(3) at Every Pixel

应用与实践视觉感知与空间理解

摘要

稠密3D点跟踪是建模动态场景运动的突出范式,但点轨迹只是每像素的3自由度平移曲线:它捕捉像素去哪里,不捕捉底层部件的旋转,也不捕捉哪些像素作为一个刚体一起运动。我们提出MoSE3——首个从单目RGB视频预测稠密SE(3)运动的前馈模型:在世界系中为每个像素产生完整6自由度刚性变换。逐像素SE(3)运动提供场景如何运动的更丰富视角:旋转、平移与分组同时获得。直接预测SE(3)很困难:旋转位于不适合欧氏回归的弯曲流形上,SE(3)标注特别难获取。为此MoSE3经由两个联合学习的中间量——3D点轨迹与刚性嵌入——预测逐像素SE(3),并在每个软刚性簇内以可微方式拟合变换恢复SE(3),实现端到端预测与监督。为弥合数据差距,我们引入Art-Kubric——带稠密SE(3)与刚性标签、含丰富物理交互的铰接物体大规模合成数据集。MoSE3在刚体与铰接基准的像素、部件与物体级取得SOTA的SE(3)估计,并在三数据集上取得SOTA平均3D点跟踪精度,同时尽管仅用合成运动数据训练仍对真实视频强泛化。