论文

Odysseus:通过强化学习将 VLM 扩展到 100 多个游戏决策回合

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

模型训练强化学习

摘要

鉴于视觉语言模型(VLM)功能的快速增长,将其扩展到视频游戏等交互式决策任务已成为一个有前途的前沿领域。然而,现有方法要么依赖于人类轨迹上的大规模监督 微调 (SFT),要么仅在相对较短的范围设置(通常在 20--30 圈左右)中应用强化学习 (RL)。在这项工作中,我们研究了基于强化学习的 VLM 训练,以在《超级马里奥乐园》中进行长期决策,这是一个基于视觉的环境,需要 100 多次交互,并协调感知、推理和行动。我们首先对关键算法组件进行系统研究,并提出了一种带有轻量级轮级批评家的 PPO 自适应变体,与 GRPO 和 Reinforce++ 等无批评家方法相比,它大大提高了训练稳定性和样本效率。我们进一步表明,与从头开始训练的经典深度 RL 相比,预训练的 VLM 提供了强大的动作先验,显着提高了 RL 训练期间的样本效率,并减少了对动作工程等手动设计选择的需求。基于这些见解,我们引入了 Odysseus,这是一个针对 VLM 代理的开放训练框架,在游戏的多个级别上取得了显着的收益,平均游戏进度至少是前沿模型的 3 倍。此外,经过训练的模型在游戏内和跨游戏泛化设置下都表现出一致的改进,同时保持通用领域能力。总体而言,我们的结果确定了使强化学习在长期、多模式环境中稳定有效的关键因素,并为开发 VLM 作为具体代理提供了实用指导。