采样、模拟、选择:无需训练即可实现人形机器人的物理在环文本到运动
Sample, Simulate, Select: Physics-in-the-Loop Text-to-Motion for Humanoids Without Training
摘要
文本到运动模型会生成合理的人体运动,但不会对机器人的动力学进行建模;全身跟踪控制器可靠地执行机器人参考,但无法重新规划不可行的参考。最近的语言到类人系统通过训练弥补了这一差距。我们通过将部署控制器本身放入循环中来测量在没有任何训练的情况下缩小了多少差距。样本模拟选择 (S$^3$) 每个提示从冻结的文本到运动模型中绘制 $N$ 个运动,通过方向匹配反向运动学将每个运动重新定位到 Unitree G1,使用预训练的 SONIC 跟踪策略在完全刚体动力学下将所有运动推出,并使候选者保持最佳执行的策略。因为验证者本身就是确定性模拟器,所以 S$^3$ 通过构造达到任意 $N$ 上限;我们衡量的是上限在哪里以及哪些地方低于上限。在 $N=8$ 的 200 个分层 HumanML3D 测试提示中,直接执行率从 83.5% 上升到 89.5%,硬件门通过率从 33 上升到 85;在完整的测试拆分(4,184 个提示)中,它从 80.5% 上升到 89.5%。预测良好的运动学验证器(AUROC 0.90)仅恢复了这一增益的四分之一:对提示自己的候选者进行排名比对总体进行分类更困难。选择无法解决的是一类提示降低骨盆的情况,这是由经过重定向机器人数据训练的生成器执行的。我们进一步使用标准文本运动评估器对执行运动的语义保真度进行评分,使用真实动作捕捉控制将损失归因于机器人投影,针对 GMR 消除重定向器(互补失败:8 中任意一个上限上升到两者的 95.0%),并在真实 G1 上执行所有 177 个门选择的剪辑:每个剪辑都完成站立,并使用硬件跟踪误差匹配模拟($r=0.94$)。