论文

STATERA:使用冻结颞管通过零射击模拟到真实运动学进行隐藏质量估计

STATERA: Hidden Mass Estimation via Zero-Shot Sim-to-Real Kinematics using Frozen Temporal Tubelets

应用与实践视觉感知与空间理解

摘要

针对帧级外观进行预训练的视觉模型通常很难从运动中推断出隐藏的物理属性。我们研究短单目视频中不透明、不对称刚体的质心 (CoM) 定位,其中表面线索和点跟踪在自遮挡下不可靠。我们提出了 STATERA,它采用预训练的视频主干网 (V-JEPA),其大部分是冻结权重和轻量级时间小管混合器来预测每帧 CoM 热图和轨迹。为了支持这项任务,我们引入了 HiddenMass 基准,包括 50K MuJoCo 轨迹和 63 序列真实世界测试集,以及物理校准的 CoM 地面实况。在模拟中,STATERA-50K-Sigma 将归一化 CoM 误差从 41.7% (DINOv2) 提高到 25.2%。在零样本模拟到真实的传输中,我们观察到监督中的基本权衡:相位感知目标可以引发双峰预测,而相位不可知目标可以向统计上安全的质心崩溃。尽管如此,我们的相位感知 STATERA-50K-Crescent 是唯一一种经过评估的方法,能够证明向真正的隐藏偏移的一致移动。虽然这会导致单目矢量超调伪影,与静态几何质心相比,绝对欧几里得误差略有增加,但它将物理捕获从 2.6% 提高到 41.0%。这些结果表明,冻结时间表示可以更好地将惯性动力学与视觉几何分离,以进行隐藏参数估计。