论文

VGGT-HPE:将头部姿势估计重新定义为相对姿势预测

VGGT-HPE: Reframing Head Pose Estimation as Relative Pose Prediction

应用与实践视觉感知与空间理解

摘要

单目头部姿势估计传统上被表述为从单个图像到绝对姿势的直接回归。这种范式迫使网络隐式内化特定于数据集的规范参考框架。在这项工作中,我们认为预测两个观察到的头部配置之间的相对刚性变换从根本上来说是一个更容易、更稳健的公式。我们介绍 VGGT-HPE,这是一种基于通用几何基础模型构建的相对头部姿势估计器。我们的方法专门针对合成面部渲染进行了微调,通过将问题减少到从已知姿势的显式提供的锚点估计几何位移,从而避免了对隐式锚点的需要。作为一个实际好处,相关公式还允许在测试时选择锚点 - 例如,近中性帧或时间相邻的帧 - 以便应用程序可以控制预测难度。尽管真实世界训练数据为零,VGGT-HPE 在 BIWI 基准上取得了最先进的结果,优于在混合数据集和真实数据集上训练的既定绝对回归方法。通过受控的简单和困难对基准,我们还系统地验证了我们的核心假设:相对预测本质上比绝对回归更准确,其优势与目标姿势的难度一起缩放。项目页面和代码:https://vasilikivas.github.io/VGGT-HPE