论文

双重新排序:融合因果关系和效用进行工业生成重新排序

Dual-Rerank: Fusing Causality and Utility for Industrial Generative Reranking

应用与实践行业应用

摘要

快手为超过 4 亿日活跃用户提供服务,每天针对数百亿短视频存储库处理数亿条搜索查询。作为最终决策层,重新排名阶段通过优化整页效用来决定用户体验。虽然传统的评分和排序方法无法捕获组合依赖性,但生成重排序通过直接对排列概率进行建模提供了优越的范例。然而,在如此高风险的环境中部署生成重排面临着一个基本的双重困境:1)结构性权衡,自回归(AR)模型提供卓越的顺序建模,但存在令人望而却步的延迟,而非自回归(NAR)模型则提高效率,但缺乏依赖性捕获; 2)优化差距,监督学习面临直接优化整页效用的挑战,而强化学习(RL)则面临高吞吐量数据流的不稳定问题。为了解决这个问题,我们提出了 Dual-Rerank,这是一个专为工业重新排名而设计的统一框架,它通过顺序 知识蒸馏 弥合结构差距,并使用列表方式解耦重新排名优化 (LDRO) 解决优化差距,以实现稳定的在线强化学习。对生产流量进行的广泛 A/B 测试表明,Dual-Rerank 实现了最先进的性能,显着提高了用户满意度和观看时间,同时与 AR 基线相比,大幅减少了推理延迟。