论文

TAIHRI:用于近距离人机交互的任务感知 3D 人体关键点定位

TAIHRI: Task-Aware 3D Human Keypoints Localization for Close-Range Human-Robot Interaction

应用与实践视觉感知与空间理解

摘要

准确的3D人体关键点定位是机器人与用户实现自然、安全的物理交互的关键技术。传统的3D人体关键点估计方法主要关注相对于根关节的全身重建质量。然而,在实际的人机交互(HRI)场景中,机器人更关心以自我为中心的相机 3D 坐标下与任务相关的身体部位的精确公制尺度空间定位。我们提出了 TAIHRI,这是第一个专为近距离 HRI 感知而定制的视觉语言模型 (VLM),能够理解用户的运动命令并将机器人的注意力引导到与任务最相关的关键点。通过将 3D 关键点量化到有限的交互空间中,TAIHRI 通过下一个标记预测,通过 2D 关键点推理精确定位关键身体部位的 3D 空间坐标,并无缝适应下游任务,例如自然语言控制或全局空间人体网格恢复。以自我为中心的交互基准实验表明,TAIHRI 对任务关键的身体部位实现了卓越的估计准确性。我们相信 TAIHRI 在实体人机交互领域开辟了新的研究途径。代码可见:https://github.com/Tencent/TAIHRI。