论文

为什么摘要变得中性:基于人类反馈的强化学习中情绪漂移的政策归因

Why Summaries Turn Neutral: Policy Attribution for Sentiment Drift in Reinforcement Learning from Human Feedback

模型评测模型行为与机制分析

摘要

具有人类反馈的强化学习 (RLHF) 使 LLM 与人类偏好保持一致,提高了摘要的流畅性和安全性,但会导致情绪漂移:过度中立的摘要剥夺了情感细微差别。我们诊断了为什么 RL 充当情绪中和器,并提出了策略归因,这是一个使用梯度和 logits 分解来跟踪奖励模型 (RM) 信号和 KL (Kullback-Leibler) 惩罚的漂移的框架。情绪漂移反映了对“低风险”词元的战略偏见,在偏好不确定性下最大化预期回报(Stiennon 等人,2020;Gao、Schulman 和 Hilton,2023)。在 Reddit TL;DR 和 CNN/DailyMail 上,RLHF 摘要获得了更高的奖励,但情绪方差降低了 30-40%。对八种语言的跨语言分析显示了与语言无关的漂移,形态更丰富的语言受到更多抑制(Krasitskii 等人,2026)。我们提出并验证了一种情感感知正则化技术,可在不损害摘要质量的情况下将漂移减少 18-22%。代码和工具包将公开。