论文
RLVP:惩罚路径,奖励结果
RLVP: Penalize the Path, Reward the Outcome
摘要
在现实世界中代表我们行事的代理(例如拨打电话)必须通过昂贵且通常不可逆的交互在线学习,而不是通过廉价的模拟器步骤进行学习。接下来有两件事。首先,可部署性取决于路径,而不仅仅是结果。代理必须尊重结果中立的约束,例如不重复呼叫不响应的用户、遵守工作时间或完成基于结果的奖励无法表达的所需身份验证约束,因为违反这些约束经常会提高明显的成功率。其次,由于每次交互都很昂贵,代理必须从很少的示例中有效地学习。来自可验证奖励的强化学习(RLVR)对这两个挑战都视而不见:它仅针对结果进行优化,并在所有失败的群体中浪费昂贵的推广,在这些群体中,群体相对优势降至零。通过奖励进步来加强监管的尝试瞄准了难以验证的方向。相比之下,真正的代理环境可以廉价地检测到不良举动。由于群体相对优势相当于群体内方差,因此密集信号仅在提供结果所缺乏的方差时才有帮助。路径上的可验证惩罚可靠地满足此条件,而进步潜力仅在可达到部分进展的情况下才有帮助。由此产生的配方“惩罚路径,奖励结果”以接近零的违规率实现了很高的任务成功率,其中仅结果的训练几乎在每个情节上都违反了约束。我们提供了四个有效惩罚的设计规则,包括避免单独使用惩罚时出现的不作为陷阱。