论文

不要让强盗反馈导致 LLM 推荐器的持续更新偏离目标

Don't Let Bandit Feedback Pull Continual LLM-Recommender Updates Off Target

模型训练强化学习

摘要

基于 LLM 的生成推荐器 (LLM-Rec) 需要持续的部署后更新,但部署日志仅提供策略形状的上下文强盗反馈:仅针对先前服务策略暴露的项目观察结果,从而引起暴露偏差并产生部分不对称信号,其中包括相对可靠的积极响应和模糊的无响应。我们提出了一个用于持续 LLM-Rec 更新的锚定强盗策略优化 (ABPO) 框架,该框架将组相对策略优化 (GRPO) 与暴露偏差和反馈模糊性的显式处理相结合。具体来说,我们将公开的建议作为记录的锚点插入到每个 GRPO 采样轨迹组中,以便根据先前策略实际公开的操作而不是单独针对新采样的采样轨迹来校准组相对规范化。由于只有通过先前的政策暴露才能观察到积极响应和无响应,因此我们将自我归一化逆倾向评分应用于两种反馈类型的固定锚点,以纠正政策不匹配。同时,我们在可靠性方面不对称地对待这两种反馈类型:积极的回应提供了相对直接的认可信号,而无回应则仍然模棱两可,因为它们可能反映了真正的不感兴趣或未观察到的外部因素。为了避免由于模糊的无响应而导致过度激进的更新,我们用自我确定性来缓和它们的惩罚,使用模型的输出词元置信度作为无验证者的可靠性信号。在 Amazon Reviews 和 MovieLens 的五个领域中,我们的方法在推荐准确性方面产生了一致的更新后增益,同时比之前的基线更有效地减轻了先前政策引起的曝光偏差。