论文
ZooWork-ShopRanker:偏好对齐的电商重排模型
ZooWork-ShopRanker: An Open, Preference-Aligned E-Commerce Reranker
摘要
针对一般网络检索训练的开放式重排模型并不完美地转移到电子商务,其中排名决策不仅取决于主题相关性,还取决于用户偏好、产品限制和比较产品适合度。这些偏好信号很难大规模监督:真实的搜索流量提供真实的查询和候选,但没有干净的成对标签。我们推出了 ZooWork-ShopRanker,这是一系列电子商务重排模型(0.6B、4B 和 8B),与法官标记的购物偏好保持一致。训练对由来自不同系列的推理大语言模型 (LLM) 面板标记,充当偏好预言机,具有去位置偏差判断和协议层,并且重新排序器根据这些标签进行训练。然后,对齐的 8B 旗舰充当高效 4B 和 0.6B 模型的蒸馏老师,这些模型与其分数相匹配,并在判断对上进行锐化。为了衡量进展,我们引入了 ShopRank-Bench,这是一种污染限制基准,包含两种文本格式的约 10,000 个私人流量偏好对,并根据每个标签有多少个裁判模型家族进行分层。 ZooWork-ShopRanker-8B 和 -4B 显着优于最强的开放式重排序基线,每个模型都显着击败了自己的未对齐基础,ZooWork-ShopRanker-0.6B 击败了其规模同行;两种格式的收益均保持不变,并扩展到常见的 MTEB 基准。我们发布模型和双格式 ShopRank-Bench 以促进进一步研究。