论文
Owen-Shapley 策略优化 (OSPO):用于生成搜索大语言模型的有原则的 RL 算法
Owen-Shapley Policy Optimization (OSPO): A Principled RL Algorithm for Generative Search LLMs
摘要
大语言模型越来越多地通过强化学习来训练个性化推荐任务,但 GRPO 等标准方法依赖于稀疏的序列级奖励,从而造成贡献归因差距,模糊了哪些token推动了成功。当模型必须在没有真实标签的情况下从未指定的语言推断潜在的用户意图时,这种差距尤其成问题,这是预训练期间很少见的推理模式。我们引入了 Owen-Shapley 策略优化(OSPO),这是一个基于token对结果的边际贡献重新分配序列级优势的框架。与需要额外计算的基于价值模型的方法不同,OSPO 通过 Shapley-Owen 归因采用基于潜力的奖励塑造来分配分段级别的信用,同时保留最优策略,直接从任务反馈中学习,无需参数值模型。通过形成语义连贯单元(描述产品属性的短语或捕获偏好的句子)的联盟,OSPO 确定哪些响应部分驱动性能。在 Amazon ESCI 和 H&M Fashion 数据集上进行的实验显示,与基线相比取得了一致的增益,并且对于训练期间未见的分布外检索器具有显着的测试时间鲁棒性。
