论文
PoEM:根据现有政策预测强化学习结果
PoEM: Predicting RL Outcomes from Existing Policies
摘要
基础模型通过强化学习 (RL) 进行后训练,以最大限度地提高特定奖励,例如人类对齐、正确性或遵循指令。这个训练后过程是计算密集型的,有时不稳定,并且每次奖励模型发生变化或当我们想要组合多个奖励时都必须从头开始运行。因此我们会问:给定一个新的奖励函数,是否可以在不实际运行 RL 的情况下预测 RL 结果?我们通过引入 PoEM 来回答这个问题,PoEM 是一个框架,使用一组已经在其他奖励上进行后训练的模型来预测 RL 在新奖励函数上的输出。首先,我们证明,如果新的奖励函数可以写成现有奖励函数的线性组合,那么对数空间中的新策略可以写成现有对数策略的线性组合。令人惊讶的是,即使在奖励不是线性连接的情况下,我们也观察到强化学习训练中的日志策略通常会跨越奖励的近似低秩子空间。为了我们的利益,可以仅使用样本上的奖励或基础策略输出来估计该组合的加权系数。我们将这些观察结果转化为一种算法,该算法采用训练后模型和新的奖励函数,并近似目标 RL 策略,而无需实际运行任何额外的 RL 训练。我们通过跨文本和图像模式的合成奖励和真实奖励实验验证了我们的方法。