论文

生成推荐中的漏召回目标:区分训练监督与概率竞争

Training with Missed Targets in Generative Recommendation: Separating Supervision from Probability Competition

模型训练模型评测应用与实践监督微调与指令调优评测方法与指标结构化分析、预测与决策

摘要

生成推荐器返回有限的候选集,并且可能在重新排名之前省略观察到的目标。训练策略将这些错过的目标附加到重新排序训练列表中,尽管推理仍然只对原始候选进行排序。此操作同时更改检索目标权重,增加对附加目标的监督,并使两组竞争概率。因此,追加/不追加比较无法解释退回商品排名的变化。我们构建了三个匹配损失,使检索目标权重保持固定,同时分别引入附加目标监督和群体竞争。中间损失在两组内进行训练,但分别对它们进行标准化,以防止仅训练目标与推理候选者竞争。对已发布的 OneRec 模型和本地训练的 Amazon 生成器进行的实验表明,这种竞争可能会损害退回商品的排名。在四项预先指定的 Amazon Video Games 比较中,删除它可将全目标归一化折扣累积收益 (FT-NDCG) 提高 7.8--22.2\%; 95\% 间隔超过 用户和训练运行中四个间隔中的三个排除零。保守的开发集规则为一个保留类别中的三个生成器中的两个选择了附加目标训练,并拒绝了另一个类别中的所有三个生成器,从而避免了 1.7% 的损失。因此,应针对每个生成器评估候选完成情况,而不是自动应用。