论文
在任务无关世界模型中强化VLA
Reinforcing VLAs in Task-Agnostic World Models
摘要
在学习到的世界模型中通过强化学习(RL)对视觉-语言-动作(VLA)模型进行后训练,已成为无需昂贵真实世界交互即可适配新任务的有效策略。然而,尽管使用想象轨迹降低了策略训练的样本复杂度,现有方法仍严重依赖任务特定数据来微调世界模型与奖励模型,从根本上限制了其向未见任务扩展的可扩展性。为克服这一点,我们主张世界模型与奖励模型应捕获可迁移的物理先验,以支持零样本推断。我们提出RAW-Dream(Reinforcing VLAs in task-Agnostic World Dreams),一种将世界模型学习与下游任务依赖完全解耦的新范式。RAW-Dream利用在多样无任务行为上预训练的世界模型预测未来轨迹,并用现成的视觉语言模型(VLM)生成奖励。由于两个组件均与任务无关,VLA可以完全在这一零样本想象中为任意新任务进行微调。此外,为缓解世界模型幻觉,我们引入双噪声验证机制来过滤不可靠的轨迹。跨仿真与真实世界场景的大量实验展示了一致的性能提升,证明广义物理先验可有效替代昂贵的任务相关数据,为VLA适配提供了高度可扩展的路线图。
