论文

CrossBFM:提炼跨人形实施例的共享潜在行为空间

CrossBFM: Distilling a Shared Latent Behavior Space Across Humanoid Embodiments

摘要

行为基础模型 (BFM) 为类人机器人提供了针对潜在行为空间的及时策略,使单个向量能够表示要模仿的动作、要达到的姿势或要最大化的奖励。前向-后向表示成功地产生了这样的空间,但代价是单个机器人需要花费数百个 GPU 小时。此外,当对第二个机器人重复训练过程时,它会产生与第一个空间无关的第二个空间,导致特定于实施例的潜伏不统一或转移。我们通过 CrossBFM 解决这些问题,将潜在空间视为各种实施例的可转移资产。由于重定向提供了帧级跨实施例对应,因此我们提出了一种没有特定于机器人的参数的统一编码器架构,用于提炼行为空间,以便在不到一个 GPU 小时的时间内同时处理所有训练实施例。遵循该编码器,潜条件条件跟踪器只需再花 10 个 GPU 小时,就能以传统的 PPO 训练方式将蒸馏后的潜能力转化为全身控制。在三个精炼的人形机器人上,所有三种提示模式都发生了变化:使用潜在条件策略的运动跟踪仅比联合条件策略损失 0.025$ rad,在姿势之间顺利实现目标而不会跌倒,以及所有 41 美元奖励提示的奖励优化。我们的实验进一步表明,1)在四分之一的运动语料库上对编码器进行回归仅花费 5\%$ 的跟踪性能,2)在机器人子集上训练编码器并对未见过的机器人进行评估,可以恢复高达 $89\%$ 的已见机器人的跟踪性能,这证明了对形态相似的机器人的跨实施例泛化。我们还验证了真实机器人上所有三种提示模式和基于流生成的潜在变量的管道。项目网址:https://dotandung.github.io/crossbfm/