论文
完美的演示造就了糟糕的老师:从关键运动片段中学习稳健的对齐
Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments
摘要
专家演示被广泛认为是机器人模仿学习的黄金标准。然而,对于插入、堆叠和对齐等细粒度操作,我们发现了一种违反直觉的失败模式:流畅的演示可能是糟糕的老师。熟练的远程操作员将对齐和恢复的决定性时刻压缩到一个短暂的时间窗口中,使策略充满冗余的自由空间运动,并且在精度决定成功的地方缺乏监督。我们从两个层面解决这个瓶颈。在数据层面,放慢近乎一致的速度和对关键部分进行重新抽样都有帮助,但收益主要来自扩大政策必须学习的复苏状态的覆盖范围,而不是重新调整已有框架的权重。然而,此类数据侧修复不会影响策略的每帧视图:单个图像仍然直接映射到动作,并且控制校正的局部运动保持隐式。因此,我们转向表示层面并引入 STAIR(\textbf{S}patio-\textbf{T}emporal feature \textbf{A}s an \textbf{I}nterface for \textbf{R}obot Learning),这是一种紧凑的动态特征,连接视觉语言模型和动作专家,将每个轨迹中已记录的短视距运动提炼为密集的运动感知监督。仅通过流畅的数据进行训练,STAIR 就恢复了大部分故意演示收益(总体上从 50.0$ 到 $62.2\%$,接近故意演示的 $64.4\%$)。这些结果需要对机器人数据采取更具教学性的观点,针对机器学习能力进行优化,而不仅仅是针对人类效率。