论文

思考个性化:统一推理和检索以实现以用户为中心的个性化密集检索

Think-to-Personalize: Unifying Reasoning and Retrieval for User-Centric Personalized Dense Retrieval

模型训练强化学习

摘要

通过将查询和项目编码到语义嵌入空间中,密集检索已成为现代本地生活方式电子商务搜索的基石。虽然最近的进展已经从基于 BERT 的嵌入模型过渡到 大语言模型 (LLM),但大多数方法仍然将 LLM 视为静态文本编码器,忽略了其固有的推理能力。此外,标准的密集检索模型仍然以查询为中心,这在电子商务场景中是不够的,在电子商务场景中,稀疏和模糊的查询会造成意图差距,只能通过丰富的用户历史上下文来弥补。同时,现有的个性化检索方法通常依赖于隐式嵌入交互,缺乏推理能力来有效区分用户意图与嘈杂的历史行为。为了应对这些挑战,我们提出了 Think-to-Personalize (TTP),这是一种新颖的框架,它将明确的以用户为中心的意图推理与密集检索相结合。通过推理用户的历史购买序列,TTP 显式推断出潜在的个性化需求并生成意图增强的查询,然后将其编码为统一的密集嵌入。具体来说,我们设计了一个两阶段的训练范例:(1)一个建立冷启动能力的监督微调(SFT)阶段; (2) 强化学习 (RL) 阶段,使用组相对策略优化 (GRPO) 将推理过程与检索实用程序结合起来。对专有和公共基准的大量实验表明,TTP 显着优于最先进的基准。此外,在线A/B测试中,订单量提升了+0.46%,验证了其实际有效性,为推理驱动的个性化密集检索建立了新范式。