论文
利用大型决策模型实现可扩展的多任务强化学习
Towards Scalable Multi-Task Reinforcement Learning with Large Decision Models
摘要
大规模序列建模的最新进展表明,单个模型可以在高度多样化的数据分布中学习有用的表示。受这些进步的启发,我们研究了是否可以在大量异构强化学习环境中训练统一的 Transformer 策略。我们引入了 LDM-v0,这是一种大型决策模型,根据从跨越多个领域和模式的数千个环境中收集的轨迹进行离线训练。 LDM-v0 是一种多任务、多模式 Transformer 策略,以观察、动作、奖励和终止信号的历史为条件,并通过离线轨迹上有监督的下一步动作预测进行训练。我们描述了用于构建 LDM-v0 的环境基础设施、自动化数据生成管道、模型架构和训练方法,并评估其在不同环境中的性能。我们证明,单个预训练模型与在大约 1,000 个环境(包括机器人、自动驾驶、库存管理、网络安全、交易和视频游戏)上独立训练的特定任务参考策略的性能相匹配。这些结果证明了使用单个 Transformer 策略跨异构强化学习环境进行大规模离线预训练的可行性。