论文
VLGOR:视觉语言知识引导的离线强化学习可泛化智能体
VLGOR: Visual-Language Knowledge Guided Offline Reinforcement Learning for Generalizable Agents
摘要
将 大语言模型 (LLM) 与强化学习 (RL) 相结合,使代理能够更有效地解释语言指令以执行任务。然而,LLM 通常缺乏对物理环境的直接感知,这限制了它们对环境动态的理解以及泛化到看不见的任务的能力。为了解决这一限制,我们提出了视觉语言知识引导离线强化学习(VLGOR),这是一个集成视觉和语言知识以生成想象的展示的框架,从而丰富了交互数据。 VLGOR 的核心前提是微调视觉语言模型,以根据初始视觉观察和高级指令来预测未来状态和动作,确保生成的展示在时间上保持连贯性,在空间上保持合理。此外,我们采用反事实提示来为离线 RL 训练提供更多样化的展示,使代理能够获取有助于遵循语言指令的知识,同时立足于基于视觉提示的环境。机器人操作基准实验表明,VLGOR 显着提高了需要新颖最优策略的未见任务的性能,成功率比基线方法高出 24% 以上。