论文

Jev 可以成为强化学习中的 Q 或策略吗?

Can Jev be Your Q or Policy in Reinforcement Learning?

模型推理应用与实践判别式推理与决策机器人

摘要

基础模型为强化学习(RL)提供了先验知识,可以缓解其在样本效率和传输方面长期存在的弱点,但它们的逐个token生成使得查询是连续的且成本高昂。 Jev 是最近发布的决策模型,它不生成任何内容,并在一次前向传递中返回经过校准的键入答案。现有的工作研究强化学习中的基础模型,要么作为待训练的模型,要么作为待提示的生成器,而 Jev 不属于这两个类别,迄今为止仅充当单个领域的黑匣子。因此,这样的模型在强化学习环境中自行决策的效果如何,以及它如何作为训练的一部分来改进强化学习,仍然没有得到解决。为此,在本文中,我们首先检查 RL 系统的对象对它们所使用的答案的要求,并确定 Jev 可以满足除价值函数的主要使用之外的所有要求。其余的物体形成各自具有多种角色的位置。然后,我们构建在其中三个位置使用 Jev 的算法,作为参考策略、探索法官、 和重播评分器,以提高样本效率、探索和学习性能。在 9 个 MiniGrid 任务和 3 个 Atari 游戏中,使用 Jev 进行训练的效果优于标准 RL 学习器,包括学习器单独没有取得任何进展,而模型本身仍然未经训练的情况。据我们所知,我们首次在强化学习过程中使用 Jev,并建立了一个冻结决策模型作为强化学习训练的可用组件,从而进一步探索 Jev 和其他高级决策模型如何改进强化学习。