论文
SSR-GRPO:将监督和语义 ID 集成到强化学习中,以实现电子商务中的密集检索
SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce
摘要
基于嵌入的检索 (EBR) 在电子商务搜索中至关重要,但常常难以应对复杂的语义。虽然最近的方法经常微调 大语言模型 (LLM) 以进行表示学习,但它们通常缺乏处理复杂和隐式语义的强大机制。虽然 Retrieval-GRPO (R-GRPO) 最近将强化学习引入了密集检索,但由于批量采样有限以及使用类似训练的 LLM 作为奖励模型而导致相关性评估存在偏差,因此它受到了嘈杂的 top-K 候选者的影响。为了解决这些问题,我们提出了带有语义标识符的监督检索-GRPO(SSR-GRPO)。具体来说,我们的方法首先提出了相关性评估的双重视角框架。它利用量化学习生成的语义标识符 (SID) 和密集表示向量来生成更加公正的相关性分数。此外,利用生成的SID的层次相似性关系,我们挖掘了一组硬负样本,其有两个目的:(1)设计集成到R-GRPO中的掩蔽函数,有效过滤组内噪声样本; (2)构建由正负样本对组成的Retrieval-DPO任务,使模型能够从成对的角度捕获细粒度的语义区别。通过整合这些优化策略,我们提出了SSR-GRPO。大量的线下和线上实验验证了SSR-GRPO的有效性,并已在大型电商平台上部署。