论文
具有硬负例的目标塑造:基于 RL 的 LLM 推荐器的窗口部分 AUC 优化
Objective Shaping with Hard Negatives: Windowed Partial AUC Optimization for RL-based LLM Recommenders
摘要
强化学习 (RL) 通过对比正面和负面项目,有效优化基于 大语言模型 (LLM) 的推荐器。根据经验,使用波束搜索负数进行训练始终优于随机负数,但其机制尚不清楚。我们通过分析诱导优化目标来解决这一差距,并表明:(i)在二元奖励反馈下,使用组相对策略优化(GRPO)优化 LLM 推荐器理论上相当于最大化 ROC 曲线下面积(AUC),这通常与 Top-$K$ 推荐不一致; (ii) 用集束搜索负数替换随机负数将目标重塑为部分 AUC,从而改善与 Top-$K$ 指标的一致性。受这个观点的启发,我们引入了窗口部分 AUC (WPAUC),它将误报率 (FPR) 限制在窗口 [$α,α+d$] 内,以更直接地与 Top-$K$ 指标保持一致。我们进一步提出了一种有效的阈值调整窗口重加权 (TAWin) RL 方法来进行优化,从而能够显式控制目标 Top-$K$ 性能。对四个真实世界数据集的实验验证了该理论并提供了一致的最先进性能。