论文
在没有环境采样的情况下指定 RL 的奖励函数
Specifying Reward Functions for RL Without Environment Sampling
摘要
使人类利益相关者能够指定导致其期望结果的奖励函数是部署强化学习代理的关键挑战。基于偏好的方法(例如在线 RLHF)可以减轻手动奖励设计的负担,但它们需要重复训练策略、从现实世界采样轨迹并引出反馈,这使得它们在环境交互计算成本昂贵或不安全的环境中不切实际。我们引入了无经验自主奖励规范(EARS),这是一种无需环境交互即可从偏好中学习奖励函数的方法。我们的方法使用结构化的 LLM 介导过程从任务描述和环境观察空间构建一小组表达性奖励特征,然后策略性地对该特征空间中的想象轨迹进行采样,并根据对想象轨迹对的偏好来学习特征权重。我们评估三个长期领域:大流行封锁监管设计、糖尿病患者的胰岛素管理以及高速公路上的自动驾驶车辆控制。我们将 EARS 与基线进行比较,这些基线也可以在没有环境交互的情况下实现奖励规范,即直接提示大语言模型生成奖励函数的方法。当从真实偏好标签或 LLM 标记的偏好中学习时,EARS 设计的奖励函数比这些基线更符合生成偏好或 LLM 背景的真实奖励函数。这些结果表明,基于偏好的奖励规范在没有环境采样的情况下仍然有效,从而可以在收集真实轨迹成本高昂或不可行的环境中进行实用的奖励设计。