论文

生成机器人策略中模拟与真实协同训练的机制分析

A Mechanistic Analysis of Sim-and-Real Co-Training in Generative Robot Policies

模型评测模型行为与机制分析

摘要

协同训练将有限的领域内现实世界数据与丰富的替代数据(例如模拟或跨实施例机器人数据)相结合,被广泛用于训练生成机器人策略。尽管在实证上取得了成功,但决定协同训练何时以及为何有效的机制仍然知之甚少。我们通过理论分析和实证研究研究了模拟与真实协同训练的机制,并确定了控制绩效的两种内在效应。第一个,\textbf{“结构化表示对齐”},反映了跨域表示对齐和域可辨别性之间的平衡,并在下游性能中发挥主要作用。第二个,\textbf{“重要性重新加权效应”},来自于动作权重的域相关调制,并在次要级别上运行。我们通过玩具模型的受控实验以及广泛的模拟与模拟以及模拟与真实的机器人操纵实验来验证这些效果。我们的分析提供了对最新协同训练技术的统一解释,并激发了一种持续改进先前方法的简单方法。更广泛地说,我们的目标是检查协同训练的内部运作方式并促进这一方向的研究。