论文

$R^2$-WAM:世界动作模型的修复和拒绝后训练

$R^2$-WAM: Repair-and-Reject Post-Training for World Action Models

模型训练强化学习

摘要

世界行动模型 (WAM) 通过预测采样行动的后果,成为策略细化的有希望的基础。然而,如果视觉上合理的预测未能反映输入操作,则可能会误导策略细化。为了解决这种不匹配问题,我们引入了 $R^2$-WAM,这是一个两阶段修复和拒绝后训练框架,它首先提高预测的 future 与输入动作的一致性,然后使用这些 future 为负微调选择较差的动作样本。修复阶段通过运动学对准分数将想象力融入到观察到的机器人行为中,该分数测量预测运动和演示运动之间的一致性,使预测视频能够忠实地反映其输入动作。使用修复的视频模型,拒绝阶段比较采样和演示动作的想象结果,有选择地将负微调应用于预测任务进度低于演示参考规定幅度的样本。这两个阶段共同将视频预测从表示学习扩展到基于结果的策略细化,而无需额外的环境交互或对推理过程的更改。 $R^2$-WAM 在 RoboTwin 2.0 上的干净和随机设置中实现了 93.8% 的平均成功率。在长期现实世界的 Fold Shirt 任务中,它取得了 87.5% 的平均成功率,而 Fast-WAM 的平均成功率为 0%。

$R^2$-WAM:世界动作模型的修复和拒绝后训练的原论文方法或结果图
图 2:$R^{2}$-WAM 概述。预测性修复将生成的机器人运动与在相同演示动作下观察到的运动进行比较。然后,修复后的视频专家会被冻结并预测选择劣质动作样本的后果。