论文

具有动态在线姿势的无数据集兼容的人形机器人操纵

Dataset-Free Compliant Humanoid Loco-Manipulation with Dynamic Online Posture

摘要

大多数人形机器人控制器需要人体运动数据来学习全身协调和姿势,使得策略依赖外部源来提供这些数据。我们提出了 OCLO(在线姿势兼容 LOco 操纵),这是一种无需人体运动数据训练的人形机器人操纵系统,仅通过两个末端执行器目标进行命令。由于这些目标不能唯一地确定全身姿势,因此 OCLO 使用分析可达性先验在线生成骨盆高度和躯干方向,并通过策略循环采样进一步细化,成本与任务无关。 OCLO 还通过弹簧阻尼器模型根据测量的力移动末端执行器参考来学习全身顺应性,鼓励腿部、腰部和骨盆屈服于外部负载。在模拟中,使用可达性先验可以使获取命令参考的成功率达到 77.8%,比不使用可达性先验的 37.8% 成功率有了巨大的提高。此外,细化减少了所有评估任务的末端执行器方向误差。相同的姿势模块在五项任务中的四项上改进了预训练的 SONIC 控制器。如果没有合规性训练,策略往往会在干扰下失去平衡而不是牺牲跟踪。在 Unitree G1 上,OCLO 在导致消融故障的末端执行器干扰下保持平衡,并执行七项机器人操作任务,包括蹲下行走和从低表面捡起盒子。项目网址:https://oclo-humanoid.github.io/

具有动态在线姿势的无数据集兼容的人形机器人操纵的原论文方法或结果图
图2:训练和OCLO的部署。 (a) 下半身策略通过三阶段课程进行训练:运动、EE 与交互负载的接触,最后通过蹲伏和倾斜进行姿势适应。所有训练命令都是程序生成的,策略在训练之后被冻结。 (b) 在部署时,两个 EE 目标定义了操作意图。弹簧阻尼器模型为差分 IK 生成符合 EE 参考,而在线姿势模块则生成骨盆高度和躯干方向。对于实时硬件操作,直接应用分析先验(OCLO(Prior))。当需要更高的位姿精度时,可以通过交叉熵方法 (CEM) 优化器使用实时机器人状态快照 (OCLO (Prior + CEM)) 中的 freeze-策略执行轨迹进行细化。由此产生的姿势命令由下半身策略与 IK 控制的手臂一起执行。