论文

Owen-Shapley 策略优化 (OSPO):用于生成搜索大语言模型的有原则的 RL 算法

Owen-Shapley Policy Optimization (OSPO): A Principled RL Algorithm for Generative Search LLMs

模型训练强化学习

摘要

大语言模型越来越多地通过强化学习来训练个性化推荐任务,但 GRPO 等标准方法依赖于稀疏的序列级奖励,从而造成贡献归因差距,模糊了哪些token推动了成功。当模型必须在没有真实标签的情况下从未指定的语言推断潜在的用户意图时,这种差距尤其成问题,这是预训练期间很少见的推理模式。我们引入了 Owen-Shapley 策略优化(OSPO),这是一个基于token对结果的边际贡献重新分配序列级优势的框架。与需要额外计算的基于价值模型的方法不同,OSPO 通过 Shapley-Owen 归因采用基于潜力的奖励塑造来分配分段级别的信用,同时保留最优策略,直接从任务反馈中学习,无需参数值模型。通过形成语义连贯单元(描述产品属性的短语或捕获偏好的句子)的联盟,OSPO 确定哪些响应部分驱动性能。在 Amazon ESCI 和 H&M Fashion 数据集上进行的实验显示,与基线相比取得了一致的增益,并且对于训练期间未见的分布外检索器具有显着的测试时间鲁棒性。

Owen-Shapley Policy Optimization:面向生成式搜索LLM的有原则RL算法
图1:OSPO 总览:通过 Owen-Shapley 值实现细粒度信用分配。标准的无价值模型 RL(如 GRPO(Shao et al., 2024a))通过单一终端奖励给所有 token 分配相同的优势(advantage)(灰色柱),忽略段级贡献。OSPO 通过用部分序列查询检索器(或奖励模型)来评估连续联盟(coalition),计算每个段对检索质量的边际贡献。例如,表中展示了对段 𝒫 3 \mathcal{P}_{3}(“coats”)的联盟采样:将 𝒫 3 \mathcal{P}_{3} 加入联盟 { 𝒫 1 , 𝒫 2 } \{\mathcal{P}_{1},\mathcal{P}_{2}\} 会使奖励从 0.50 提升到 0.72,产生边际 Δ 3 = + 0.22 \Delta_{3}=+0.22;对所有联盟的此类边际取平均即得到 Owen 值 ϕ 3 Owen = + 0.26 \phi_{3}^{\text{Owen}}=+0.26,表明“coats”通过提供明确的类别信息持续改善检索。这些 Owen 值随后被用于按影响比例(中右,蓝绿色柱)或以“因果”方式重新分配优势,将梯度更新集中在真正高贡献的段上。训练动态(右下)显示 OSPO 以比 GRPO 少 50% 的步骤达到目标性能,证明了样本效率的提升。