论文
LA-Pose:潜在动作预训练与姿势估计的结合
LA-Pose: Latent Action Pretraining Meets Pose Estimation
摘要
本文通过自监督预训练的视角重新审视相机姿态估计,重点关注逆动态预训练作为当前使用 3D 注释的完全监督训练趋势的可扩展替代方案。具体来说,我们采用逆向和正向动力学模型来学习潜在动作表示,类似于大规模驾驶视频中的 Genie。我们的想法简单而有效。现有方法以其原始能力使用潜在动作,即作为世界模型的动作调节或作为策略网络中机器人动作参数的代理。我们的方法被称为 LA-Pose,将潜在动作特征重新用作相机姿势估计器的输入,并在一组有限的高质量 3D 注释上进行微调。该公式能够实现准确且可概括的姿态预测,同时保持前馈效率。关于驾驶基准的大量实验表明,LA-Pose 在使用少几个数量级的标记数据的同时,实现了比最先进的方法有竞争力甚至更优越的性能。具体而言,在 Waymo 和 PandaSet 基准测试中,LA-Pose 的姿态精度比最近的前馈方法高出 10% 以上。据我们所知,这项工作是第一个展示逆动态自监督学习在姿态估计中的威力的工作。