论文
残差建模缩小了机器人学习中回归和生成策略的差距
Residual Modeling Closes the Regression and Generative Policy Gap in Robot Learning
摘要
从演示中学习已经实现了令人印象深刻的机器人行为。策略学习的常见选择是使用扩散或流匹配(Flow-Policies),它通常优于使用均方误差训练的直接动作回归(MSE-Policies)。这种差距通常归因于多式联运示范。我们从统计建模的角度重新审视这一差距:行动预测残差如何影响策略优化。我们对现实世界机器人演示数据的分析揭示了残差尺度和重于高斯尾部的显着的状态相关变化。虽然 MSE 策略和流策略都表现出重尾动作残差,但它们的训练梯度表现不同:MSE 为具有大动作残差的观测分配更多梯度幅度,这会损害优化。受这些发现的启发,我们引入了异方差 Student-t 动作回归(HT-Policies),它学习依赖于输入的残差尺度并减少重尾的影响。 HT 策略通过一次前馈传递来预测动作块,并且可以重复使用 预训练的基于流匹配的策略网络作为骨干。在四个模拟基准和真实机器人评估中,无论是从头开始训练还是从预训练的视觉语言动作和世界动作模型进行训练,HT-Policies 的成功率都与生成策略基线相当,尽管训练和推理速度更快。总之,这些发现揭示了机器人从演示中学习生成目标的实际优势,并为一系列架构和任务提供了有效的直接回归替代方案。项目页面:https://the-labone.github.io/regression-policy-project/