论文

CoRe:持续奖励微调的 LLM 查询重写器,用于网络规模视频搜索中的多阶段上下文感知相关性

CoRe: A Continuously Reward-Finetuned LLM Query Rewriter for Multi-Stage Context-Aware Relevance in Web-Scale Video Search

模型训练偏好优化

摘要

生产中基于 LLM 的查询重写器面临着一个压力:训练奖励必须反映生产排序器如何消耗重写,但训练过程必须足够便宜,以支持数据漂移时的持续重新部署。我们提出了 CoRe(上下文相关性),这样一个系统,在一个主要的短视频搜索引擎中每周重新部署五个多月。我们的奖励使用已部署的多模态相关性模型作为其来源和反映生产融合代数的乘法比率形式,从而缩小了离线奖励代理留下的模拟与生产差距。半在线混合偏好优化循环使得这种奖励在每周数百万个实例的规模上是可以承受的:DPO 式的成对目标将梯度传递限制为采样轨迹的一小部分 top-k/bottom-k 子集,并且阶段结构减少了从每步到每阶段的训练器/推理服务器参数同步。从生产中的真实 奖励作弊 事件中检测并恢复的奖励类和稳定性指标的自动晋升门。重写器输出在召回、原始排序和精细排序时被用作并行相关信号,而不取代原始信号,从而限制了重写器失败的爆炸半径。来自两次连续生产发布的在线 A/B,首先在 FineRank 部署重写器,然后将消耗扩展到召回和 RawRank,在统计上显着降低了受重写影响的查询的更改查询率,所有标题相关性和参与度指标都朝着预期方向发展。