论文

RLHND:以视频基础模型恢复手部位姿与触觉信息

RLHND: Video Foundation Models as Physically Grounded Hand Trackers for Robot Learning

应用与实践模型训练参数高效训练机器人视觉感知与空间理解

摘要

最近,利用人类视频数据集进行机器人策略训练的方法变得越来越普遍。然而,大多数现有的手部跟踪器从裁剪后的帧中回归姿势,而手部运动和物体交互的先验有限,导致估计不准确且物理上不一致。此外,缺乏物理线索(例如接触和力量)限制了人类视频在机器人策略训练中的使用。为此,我们提出了 RLHND,一种基于视频基础模型的手部跟踪模型,可以从单目自我中心视频中联合估计手部姿势和真实的触觉信息。 RLHND 通过干净潜在调节将预先训练的 Cosmos 3 视频扩散骨干网转变为确定性剪辑级特征提取器,将其学习到的手部运动和手部与物体交互的先验知识带入跟踪中。对于姿势估计,RLHND (i) 通过解剖学上合理的关节角度预测手部姿势,并且 (ii) 能够对形状参数进行可选调节,以在同一视频内甚至在同一视频录制的视频之间保持一致的手部形状 演员。对于触觉估计,一个单独的触觉专家流在姿势流冻结的情况下进行训练,可以预测手表面的密集接触和力。我们进一步采用基于 LBS 的特征传播来实现逐顶点特征提取,而无需昂贵的逐顶点关注。 RLHND 在姿势估计的各种基准数据集上实现了最先进的性能,同时在接触和力估计方面也实现了最先进的性能。此外,我们通过重定向结果和现实世界的机器人实验展示了 RLHND 在机器人学习中的实用性。该代码将在 https://seungjun-moon.github.io/rlhnd/。 上公开提供

RLHND:以视频基础模型恢复手部位姿与触觉信息:论文原图
图 2:RLHND 概述。预先训练的 Cosmos 3 主干通过其调节框架接口接收剪辑,并适应可训练的贴片嵌入和 LoRA 适配器。在第 1 阶段训练的姿势专家流产生 MANO 参数和度量相机空间平移,而触觉专家流在第 2 阶段训练,姿势流冻结。