论文

DMRL:以文档为中介的强化学习,用于广告推荐中的技能优化

DMRL: Document-Mediated Reinforcement Learning for Skill Optimization in Advertising Recommendation

模型训练强化学习

摘要

广告推荐需要不断调整复杂的系统参数,同时平衡商业回报和用户体验。最近的工作引入了 大语言模型 (LLM) 和技能文档来协助这一劳动密集型过程,但技能优化仍然很大程度上是提示驱动的,缺乏将奖励归因于特定文档编辑的原则性机制。为了解决这个限制,我们提出了文档介导的强化学习(DMRL),这是一种技能自我进化框架,它将技能文档优化建模为一系列结构化编辑操作。在 DMRL 中,上层代理执行受控文档编辑,而冻结的下层任务代理通过 A/B 测试评估其效果。为了解决信用分配和长期结果,我们引入了两个关键组成部分:(1)双重相对策略优化(DRPO),一种 后训练 策略优化方法,用于稳健且具有风险意识的优势估计; (2)长期奖励预测器(LRP),它通过利用解耦表示学习和交叉注意力转移对群体异质性进行建模来估计长期结果。 DMRL 部署在大型短视频广告平台上,广泛的实证评估表明 DMRL 在关键广告指标上优于最先进的基线