论文

CoRe:将奖励与视觉语言模型反馈相结合,实现偏好对齐强化学习

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning

模型训练奖励建模与过程监督

摘要

奖励设计仍然是强化学习(RL)的核心挑战。手工设计的奖励通常很难指定,并可能导致策略不理想,而从偏好中学习到的奖励可能会因训练效率低下和不稳定而受到影响。受认知科学中探索的人类学习的双重性质的启发,我们将奖励分解为两个互补的组成部分:基于任务知识明确设计的形式奖励(FR)和从观察中学习以捕捉隐含和细微差别的偏好的剩余奖励(RR)。基于这种分解,我们提出了 CoRe,一种混合​​框架,它将 FR 和 RR 与视觉语言模型 (VLM) 反馈相集成,以在无需人工参与的情况下实现偏好一致的策略。我们的贡献有两个:(1)我们提出了一个正式奖励模块(FRM),利用 VLM 根据任务知识和偏好反馈迭代设计和优化 FR,从而能够在训练期间不断改进策略; (2) 我们引入了剩余奖励模块(RRM),通过使用 VLM 生成偏好标签并捕获补充 FR 的细微奖励,从视频级偏好中学习 RR,确保与人类意图保持一致。通过 FRM 和 RRM 的协同作用,CoRe 能够自动构建高效且符合偏好的可靠奖励。大量实验表明,CoRe 在模拟中的十个机器人操作任务和五个现实世界中的策略学习有效性和效率方面优于现有方法。视频可以在我们的项目网站上找到:https://core-2026.github.io/