论文
从手语生成到人形执行:具有碰撞缓解功能的视觉语言引导重定向
From Sign Language Generation to Humanoid Execution: Vision-Language Guided Retargeting with Collision Mitigation
摘要
最近的手语生成 (SLG) 系统越来越多地输出密集的 3D 身体表示,这可以更好地保留全身运动学和几何形状,以便在人形机器人上进行下游体现。然而,这些生成的运动经常表现出自相交,例如手-手和手-躯干穿透。虽然此类伪影在离线渲染中可以容忍,但它们在人形执行中变得至关重要,因为它们会导致不可行的逆运动学 (IK) 解决方案、碰撞和不稳定的重定向轨迹。我们提出了一个系统级框架,通过两个组件将 SLG 输出与人形关节空间执行连接起来。首先,我们引入了体积 SMPL-X 碰撞缓解模块,该模块将生成的签名运动投射到物理上合理的配置,同时尽量减少与原始轨迹的偏差。其次,我们提出了一种基于 IK 主干的视觉语言引导重定向算法:VLM 充当渲染人形运动的视觉视觉评估器,识别特定于实施例的故障模式,并触发有针对性的任务空间校正。我们的结果强调碰撞处理和感知引导的细化是可靠的人形签名的关键缺失组件。