论文

潜在策略引导:跨实体传输的高效灵活框架

Latent Policy Steering: An Efficient and Flexible Framework for Cross-Embodiment Transfer

智能体系统Agent 规划

摘要

学习机器人视觉运动策略的性能在很大程度上取决于训练数据的大小和质量,但对于现实世界中的机器人来说,收集高质量的演示仍然成本高昂。尽管大规模机器人和人类数据集越来越多,但体现差距和不匹配的动作空间使它们难以直接利用。因此,跨实施例迁移,重用其他实施例的经验来改进目标实施例的学习,对于将机器人学习扩展到每个机器人数据收集之外至关重要。在这项工作中,我们发现通过学习跨实施例共享的内容、世界如何响应运动的视觉动态,以及通过在测试时有效利用稀缺的目标实施例数据,可以实现有效的迁移。所提出的框架称为潜在策略引导(LPS),实现了与实施例无关的预训练阶段,该阶段使用跨不同实施例的光流来训练基于图像的世界模型(WM)。由此产生的 WM 通过机器人动作在目标实施例上进行微调。然后,它通过在 WM 的潜在空间中搜索接近微调数据的计划,引导基本策略采取更好的行动。 LPS 是一个与策略无关的框架:它可以灵活地适应不同的策略,而无需重新训练它们。在机器人模拟和现实世界评估中,LPS 将扩散策略的平均性能相对提高了 16% 和 62%,将 Pi0.5 提高了 8% 和 14%,仅在未见过的目标实施例上进行了 50 次演示。