论文
超越语义的实时对齐奖励模型
Real-Time Aligned Reward Model beyond Semantics
摘要
基于人类反馈的强化学习(RLHF)是将大语言模型(LLM)与人类偏好对齐的关键技术,但它易受奖励过度优化影响:策略模型过拟合奖励模型,利用虚假奖励模式而非忠实捕捉人类意图。既有缓解手段主要依赖表层语义信息,无法有效解决奖励模型(RM)与策略模型因策略分布持续漂移造成的错位,这不可避免地导致奖励差异扩大,加剧奖励过度优化。为解决这些局限,我们提出R2M(Real-Time Aligned Reward Model),一个新颖的轻量RLHF框架。R2M超越仅依赖预训练LLM语义表示的普通奖励模型,转而利用策略模型演化中的隐状态(即策略反馈)在RL过程中对齐策略的实时分布漂移。这项工作指出一条有前景的新方向:通过实时利用来自策略模型的反馈来改进奖励模型性能。
