论文
HumanoidArena:以自我为中心的分层全身学习基准测试
HumanoidArena: Benchmarking Egocentric Hierarchical Whole-body Learning
摘要
人形机器人承诺在以人为中心的环境中进行全身交互,但可扩展的策略学习仍然很困难,因为任务级决策和全身动态执行紧密耦合。一种实用的解决方案是分层控制,其中高级策略预测中间全身动作,底层通用运动跟踪器(GMT)将它们作为稳定的人形运动执行。然而,现有的基准测试很少评估策略跟踪器接口本身,中间整体操作是否可执行、在任务分配变化下是否稳健以及是否可以在不同的 GMT 后端之间转移仍是一个悬而未决的问题。我们推出了 HumanoidArena,这是一个以模拟为先的基准,用于以自我为中心的分层全身学习。该基准将策略学习制定为分层决策问题:高级策略将自我中心的视觉、本体感受和指令转换为紧凑的全身动作,随后由底层 GMT 执行。 HumanoidArena 并没有将腿视为平面运输工具,而是强调交互,其中下半身协调在结构上是完成任务所必需的。因此,我们设计了 7 项腿部关键 HOI/HSI 任务,其中成功需要足部放置、平衡维持、姿势调整和全身重新定向。为了进一步诊断层次系统,我们从两个互补的角度评估策略:扰动条件泛化和 GMT 条件转移。实验表明,分层控制使学习策略能够解决各种关键的交互,但性能受到跟踪器的强烈限制,并且跨 GMT 传输仍然脆弱。这些结果将 HumanoidArena 定位为研究可转移的中间动作表示和可扩展的以自我为中心的全身策略学习的基准。