论文
基于推理增强偏好反馈的因果鲁棒奖励学习
Causally Robust Reward Learning from Reason-Augmented Preference Feedback
摘要
基于偏好的奖励学习被广泛用于塑造Agent行为以匹配用户偏好,但其稀疏的二元反馈使其特别容易受到因果混淆的影响。学到的奖励常常锚定于训练期间与偏好轨迹仅仅共现的虚假特征,当这些相关性在测试时消失或反转时便会失效。我们提出ReCouPLe,一个利用自然语言理由提供缺失因果信号的轻量框架。每条理由被视为嵌入空间中的一条引导投影轴,训练模型基于与该轴对齐的特征为轨迹打分,同时弱化与所述原因无关的上下文。由于相同的理由(如"避免碰撞""更快完成任务")可以出现在多个任务中,ReCouPLe在任务共享语义时自然复用同一因果方向,无需额外数据或语言模型微调即可将偏好知识迁移到新任务。我们学到的奖励模型能够将偏好落在明确陈述的原因上,与用户意图更一致,并泛化到虚假特征之外。ReCouPLe在分布偏移下的奖励准确率最高超出基线1.5倍,在新任务上的下游策略性能最高超出2倍。代码已发布于https://github.com/mj-hwang/ReCouPLe。
