论文

Graph-GRPO:生成电子商务搜索相关性的依赖感知贡献分配

Graph-GRPO: Dependency-Aware Credit Assignment for Generative E-commerce Search Relevance

模型训练强化学习

摘要

搜索相关性建模是电子商务搜索系统中的一项核心任务,用于评估用户查询与候选产品的匹配程度。相关性判断通常需要对查询理解、产品理解和方面级别匹配进行结构化推理,而不是依赖于单个整体匹配信号。通过 大语言模型 (LLM),这个过程越来越多地被表述为思想链 (CoT) 推理,并通过强化学习 (RL) 进行优化。然而,现有的强化学习方法主要依赖于结果级奖励,并将整个推理链视为单个优化单元。这使得很难区分错误的推理步骤和正确的中间步骤,从而导致贡献分配错位。尽管过程奖励方法提供了更密集的监督,但它们通常独立对待推理步骤并忽略依赖驱动的错误传播,使得责任归因变得困难并限制了结构化相关推理的优化。我们提出了 Graph-GRPO,这是 GRPO 的图结构扩展,用于多组件相关性推理。 Graph-GRPO 构建了一个相关性推理依赖图,其中 CoT 步骤被建模为节点,其逻辑依赖关系被建模为边。它在图表上传播结果级奖励,以得出步骤级信用信号,从而实现更准确的细粒度贡献分配。我们进一步引入了一个主损失驱动控制器,它自适应地调整边缘信用传播系数。与用于监督策略初始化的 CoT 随机屏蔽和基于图节点的多头 蒸馏 一起,我们为生成相关性建模构建了一个可训练和可部署的框架。在领先的电子商务平台上进行的广泛的离线评估和在线 A/B 测试表明,基于 Graph-GRPO 的框架改进了相关性分类指标和关键参与度指标。