论文

DREAMSTEER:潜在世界模型可以在部署过程中引导 VLA 策略,无需任何微调

DREAMSTEER: Latent World Models Can Steer VLA Policies During Deployment Without Any Finetuning

模型推理推理搜索与路径规划

摘要

预训练的视觉-语言-动作(VLA)策略显示出有希望的零样本泛化,但在部署时间分布变化下经常失败,导致鲁棒性下降和指令遵循不一致。虽然之前的工作通常通过对分布内数据进行微调来解决这个问题,但它假设在目标环境中收集任务的演示。在这项工作中,我们提出了 DREAMSTEER,这是一种用于预训练 VLA 的部署时引导框架,无需任何微调或参数修改。 DREAMSTEER 的关键见解是利用潜在世界模型和价值模型来引导预训练的 VLA 策略。在部署过程中,DREAMSTEER 从 VLA 策略和预定义的运动原语中采样候选动作块,使用动作条件的潜在世界模型想象它们的结果,并使用语言条件的价值模型对想象的轨迹进行排名。在涉及看不见的物体的四个现实世界操纵基准中,与基本 VLA 策略相比,DREAMSTEER 将任务成功率从 23.75% 提高到 66.25%,将指令遵循准确性从 38.75% 提高到 56.25%。