论文
Imagine-RL:用于世界模型增强 VLA 强化学习的剩余置信引导交叉注意力
Imagine-RL: Residual-Confidence-Guided Cross-Attention for World-Model-Augmented VLA Reinforcement Learning
摘要
在接触丰富的操作中进行可靠的动作评估需要超越当前的观察,着眼于未来的视觉和接触后果。现有的噪声空间强化学习有效地引导了冻结的视觉-语言-行动(VLA)策略,但其批评者在很大程度上忽视了这些后果。我们提出 Imagine-RL,它通过动作条件视觉扭矩想象力来增强噪声空间 VLA 训练后。对于每个候选动作块,冻结视觉扭矩潜在世界模型(VTLWM)自回归预测紧凑的未来表示,而无需像素重建。当前的图像状态动作查询关注观察到的历史和预测的未来,而先前窗口预测残差提供了标记明智的置信先验,以抑制不可靠的未来标记。通过将当前证据与预测后果相结合,行动批评家可以更好地评估候选行动并监督行动者,而 VLA 和 VTLWM 保持冻结状态。在四个真实机器人任务中,每个任务进行 50 次评估试验,Imagine-RL 仅使用 100 条 RL 轨迹,其平均成功率比 DSRL 提高了 (23.6%),比 VLA 基线提高了 (60%)。