论文

通过多阶段逐步调整推荐基础模型 后训练

Progressive Alignment of Recommender Foundation Model through Multi-Phase Post-Training

模型训练强化学习

摘要

用于推荐的基础模型(FM)显示出对长期连续用户行为进行建模的强大能力。在实践中,单个预训练基础模型通常通过监督 微调(SFT) 适应不同的下游服务表面。然而,优化特定于任务的目标(例如点击或点赞)并不一定会使服务策略与确定推荐质量的业务指标保持一致。我们提出了一个三阶段渐进的 后训练 框架,该框架明确地将下游适应与业务指标对齐分开。适应阶段被分解为线性探测(LP)和完整微调(FFT):LP首先在冻结的预训练表示空间内稳定随机初始化的下游头,然后FFT联合专门化目标任务的完整模型。除了这种稳定的策略之外,强化 微调(RFT) 使用学习奖励模型使模型与实际业务目标保持一致。我们不是直接优化稀疏业务目标的服务策略,而是在密集的隐式反馈上训练策略,并仅使用业务度量监督进行奖励建模。离线实验表明,渐进式 LP-FFT-RFT 框架优于单阶段替代方案,并且基于奖励的对齐比直接使用奖励模型本身进行排名产生更强的服务策略。大规模在线 A/B 测试进一步表明,所提出的框架比传统的非基础基线提高了生产推荐质量。参考实现位于 https://github.com/webtoon/rec-fm-progressive-alignment