论文

质量高于点击:早期电子商务查询建议的迭代强化学习

Quality Over Clicks: Iterative Reinforcement Learning for Early-Stage E-Commerce Query Suggestion

模型训练强化学习

摘要

现有的对话系统依靠查询建议来增强用户参与度。最近的方法主要使用点击率(CTR)模型来优化生成模型,以符合用户偏好。然而,这些方法在早期部署场景中效果较差,点击反馈稀疏,不足以训练可靠的 CTR 模型。为了弥补这一差距,我们提出了 QualEQS,这是一种用于电子商务查询建议的质量优先的迭代强化学习框架。我们从直接影响下游可用性的三个维度将可操作的建议质量形式化:可回答性、事实性和信息增益。为了在没有点击监督的情况下不断改进在线流量,我们进一步提出候选建议之间的组级分歧,以识别不明确的查询上下文并挖掘艰苦的训练案例以进行迭代细化。我们还引入了 EQS-Benchmark,这是一个包含 16,949 个真实电子商务查询的数据集,用于离线训练和评估。实验表明,我们基于质量的离线指标与在线性能密切相关,为稀疏反馈部署提供了实用的评估方法。在离线和在线设置中,QualEQS 始终优于强大的基线,在现实世界的企业级对话购物助理系统中,在线 ChatPV 提高了 6.81%。