论文

在任务无关世界模型中强化VLA

Reinforcing VLAs in Task-Agnostic World Models

模型训练强化学习

摘要

在学习到的世界模型中通过强化学习(RL)对视觉-语言-动作(VLA)模型进行后训练,已成为无需昂贵真实世界交互即可适配新任务的有效策略。然而,尽管使用想象轨迹降低了策略训练的样本复杂度,现有方法仍严重依赖任务特定数据来微调世界模型与奖励模型,从根本上限制了其向未见任务扩展的可扩展性。为克服这一点,我们主张世界模型与奖励模型应捕获可迁移的物理先验,以支持零样本推断。我们提出RAW-Dream(Reinforcing VLAs in task-Agnostic World Dreams),一种将世界模型学习与下游任务依赖完全解耦的新范式。RAW-Dream利用在多样无任务行为上预训练的世界模型预测未来轨迹,并用现成的视觉语言模型(VLM)生成奖励。由于两个组件均与任务无关,VLA可以完全在这一零样本想象中为任意新任务进行微调。此外,为缓解世界模型幻觉,我们引入双噪声验证机制来过滤不可靠的轨迹。跨仿真与真实世界场景的大量实验展示了一致的性能提升,证明广义物理先验可有效替代昂贵的任务相关数据,为VLA适配提供了高度可扩展的路线图。

在任务无关世界模型中强化VLA:论文配图
图 1:左图:之前用于 VLA 后训练的基于 WM 的 RL 管道将 WM 和奖励模型与已知目标任务紧密耦合,需要数千次域内部署,从而排除了看不见的适应。右图:RAW-Dream 将动态学习与任务语义解耦。针对各种无任务行为进行预训练的通用 WM 捕获可转移的物理先验,而基础 VLM 则提供零样本奖励。它们共同在新任务上实现数据高效的强化学习。