论文

ProDVI:价值网络初始化的程序化动态先验

ProDVI: Programmatic Dynamics Priors for Value Network Initialization

模型训练合成数据

摘要

深度强化学习(RL)的样本效率是出了名的低。一个促成因素是强化学习代理通常从头开始初始化,迫使它们通过在线交互获取与任务相关的知识。现有的方法通过预先收集的数据集、高保真模拟器或相关任务的元学习来获得信息丰富的初始化,但这些先决条件可能很难访问甚至不可用。在本文中,我们提出了用于价值网络初始化的程序化动态先验(ProDVI),该框架利用 大语言模型 中编码的常识和领域知识来初始化 RL 代理,而无需依赖这些资源。具体来说,ProDVI 提示代码生成语言模型生成可执行的 Python 函数,这些函数对有关环境动态的粗略假设进行编码。然后使用这些函数来生成合成转换。基于这些转变,我们构建了一个辅助动态预测目标,以在行动者批评家框架中预训练价值网络的状态动作编码器。在在线强化学习开始之前,学习到的表示提供动态感知的归纳偏差。重要的是,生成的程序仅用于表示预训练,不需要忠实地模拟目标环境。虽然生成的程序可能不准确,但可以通过在线学习真实的转换和奖励来纠正其诱导的初始化。在OpenAI Gym和DeepMind Control Suite任务上的实验表明,ProDVI可以有效提高无模型强化学习算法的样本效率。