得物在社区推荐部署非自回归生成式重排
概述
重排承担把精排输出的 Top 100–500 候选集转化为最优序列的职责,原 G-E 两阶段框架依赖启发式规则、随机扰动 + Beam Search 生成候选,存在“质量-延迟-多样性”不可能三角与阶段间目标不一致的问题(Beam Search 输出的 Top 排列中有 20% 被评估模型否定;Beam Search 含 argmax 导致无法端到端优化)。团队为对齐双阶段一致性并兼顾线上性能,推进非自回归生成模型上线:模型由 Candidates Encoder(标准 Transformer,获取 item 间交互信息)与 Position Encoder(额外增加 Cross Attention,使位置序列关注候选序列)构成,输入用户信息、item 特征、位置信息、上游精排打分特征,一次性输出 n×L 的位置-物品得分矩阵以支持高效并行推理;引入可学习位置嵌入显式建模同一 item 在不同位置的表现差异,训练目标用 logloss 使正反馈 label 序列生成概率最大、负反馈序列概率最小。线上结果:一期新增非自回归生成通道,pvctr +0.6%、时长 +0.55%;二期在所有通道排序因子中 bagging 非自回归模型,pvctr +1.0%、时长 +1.13%。 由于非自回归模型的条件独立性假设对上下文建模不足,团队进一步推进自回归生成模型:用单向 Transformer 建模 list 整体收益以模拟用户浏览行为的因果性,同时解决自回归生成的暴露偏差问题、保持训练与推理一致,训练目标采用有序回归 loss 以体现不同长度子列表的序列增量价值。针对自回归生成 L 个物品需 L 次前向传播、难以满足毫秒级线上要求的瓶颈,在传统自回归结构基础上增加 MTP(multi token prediction)结构,把单步预测扩展为单步多 token 联合预测以显著减少生成迭代次数。线上情况:自回归生成模型已在社区推荐完成推全,但当前不是完全体,仅部分位置生成调用模型;一期调用两次模型、每次预测 4 个位置,pvctr +0.69%、有效 vv +0.58%;二期调用两次模型、每次预测 5 个位置,pvctr +0.54%、有效 vv +0.40%。 为解决 CPU 推理模型延迟高、制约业务效果的问题,团队对 DScatter 模型服务做工程升级:将依赖的推理框架升级为支持 GPU 的高性能服务框架,引入 NVIDIA L20 等专业推理显卡为 listwise 评估模型与自回归生成模型提供专用算力;同时把 DScatter 的模型打分逻辑从重排服务中完全解耦,构建并部署独立的 DScatter-Model-Server 集群,消除与重排服务在 CPU、内存等资源上的竞争。模型侧优化包括:导出为 ONNX 格式并用 TensorRT 做量化、层融合、动态张量显存以加速推理;预计算 item 静态网络、线上直接查询的 Item Embedding 缓存;自回归生成模型核心优化为 KV Cache 复用(缓存已生成 token 的 KV 与 attention 值,仅计算增量 token);并计划继续落地 GQA 等其他 LLM 推理加速技术。