论文

基于推理增强偏好反馈的因果鲁棒奖励学习

Causally Robust Reward Learning from Reason-Augmented Preference Feedback

模型训练奖励建模与过程监督

摘要

基于偏好的奖励学习被广泛用于塑造Agent行为以匹配用户偏好,但其稀疏的二元反馈使其特别容易受到因果混淆的影响。学到的奖励常常锚定于训练期间与偏好轨迹仅仅共现的虚假特征,当这些相关性在测试时消失或反转时便会失效。我们提出ReCouPLe,一个利用自然语言理由提供缺失因果信号的轻量框架。每条理由被视为嵌入空间中的一条引导投影轴,训练模型基于与该轴对齐的特征为轨迹打分,同时弱化与所述原因无关的上下文。由于相同的理由(如"避免碰撞""更快完成任务")可以出现在多个任务中,ReCouPLe在任务共享语义时自然复用同一因果方向,无需额外数据或语言模型微调即可将偏好知识迁移到新任务。我们学到的奖励模型能够将偏好落在明确陈述的原因上,与用户意图更一致,并泛化到虚假特征之外。ReCouPLe在分布偏移下的奖励准确率最高超出基线1.5倍,在新任务上的下游策略性能最高超出2倍。代码已发布于https://github.com/mj-hwang/ReCouPLe。

基于推理增强偏好反馈的因果鲁棒奖励学习
图2:ReCouPLe通过将轨迹表示正交投影到理由(reason)语言嵌入,并将该表示分解为与理由对齐和与理由正交的分量,从而对任务奖励进行分解。这使得奖励模型能够分离出理由(rationale)中所指定的因果特征,以解释用户的偏好。