论文

I-BFM:通过无监督强化学习实现奖励条件的鲁棒人形交互

I-BFM: Reward-Conditioned Robust Humanoid Interaction via Unsupervised Reinforcement Learning

摘要

行为基础模型 (BFM) 最近表明,单个人形策略可以支持多种全身控制,但将这种通用性扩展到物理交互仍然具有挑战性。我们引入了 I-BFM,据我们所知,这是第一个用于人形物体交互的 BFM。 I-BFM 不依赖于特定于任务的策略或参考跟踪,而是使用前向-后向表示和无监督强化学习来学习人形、物体及其接触之间耦合动态的共享表示。给定下游任务奖励,相同的策略可以直接以潜在命令为条件来执行闭环交互,而无需特定于任务的策略优化。为了改善不同时间尺度的交互控制,我们进一步训练策略的短视野交互目标和长视野目标。单个 I-BFM 策略可执行搬运、推和踢动作,同时还支持目标达成、运动跟踪、风格控制和长视野任务链。更重要的是,它在与名义执行发生较大偏差后仍然有效:在进行进位时,I-BFM 实现了 94.3% 的名义成功率,并在机器人跌倒后保留了 89.3% 的成功率,而基于计划的基线为 1.3%。 Unitree G1 上的真实世界实验进一步证明了多种局部操作行为、从交互失败和外部干扰中快速恢复以及无需特定任务再训练的任务链。

I-BFM:通过无监督强化学习实现奖励条件的鲁棒人形交互的原论文方法或结果图
图 2:I-BFM 概述。在 pre-训练期间,I-BFM 在交互环境中学习交互感知行为嵌入和共享策略,与前向、后向和判别器批评者联合优化。在推理时,任务奖励从学习的嵌入空间中检索相应的潜在变量,使相同的策略能够执行强大的携带、推、踢和组合局部操纵行为。