论文
通过 Dreamer 学习任务不变属性:为四足机器人实现高效的策略传输
Learning Task-Invariant Properties via Dreamer: Enabling Efficient Policy Transfer for Quadruped Robots
摘要
在不同的动态地形中实现四足机器人运动面临着巨大的挑战,这主要是由于模拟环境与现实条件之间的差异。传统的模拟到真实的转换方法通常依赖于手动特征设计或昂贵的现实世界 微调。为了解决这些限制,本文提出了 DreamTIP 框架,该框架将任务不变属性学习纳入 Dreamer 世界模型架构中,以增强模拟到真实的迁移能力。在 大语言模型 的指导下,DreamTIP 识别并利用任务不变属性,例如接触稳定性和地形间隙,这些属性表现出对动态变化的鲁棒性和跨任务的强大可转移性。这些属性作为辅助预测目标集成到世界模型中,使策略能够学习对潜在动态变化不敏感的表示。此外,设计了一种有效的适应策略,采用混合重放缓冲区和正则化约束来快速校准现实世界的动态,同时有效地减轻表示崩溃和灾难性遗忘。在复杂地形(包括楼梯、攀爬、倾斜和爬行)上进行的大量实验表明,DreamTIP 在模拟和现实环境中均显着优于最先进的基线。我们的方法在八个不同的模拟传输任务中实现了 28.1% 的平均性能提升。在现实世界的攀爬任务中,基线方法仅取得了 10% 的成功率,而我们的方法取得了 100% 的成功率。这些结果表明,将任务不变特性纳入 Dreamer 学习中,为实现稳健且可转移的机器人运动提供了一种新颖的解决方案。