论文

一种模型,多个目标:电子商务对话系统的自适应多目标学习

One Model, Multiple Goals: Adaptive Multi-Objective Learning for E-commerce Dialogue Systems

模型训练强化学习

摘要

电子商务场景中的对话系统通常需要满足多个目标:对用户档案(例如资格、信用额度)进行准确推理,以确保正确的决策和用户状态解释,同时生成自然且忠实的响应。这些目标是互补的,但并不完全相同。在这项工作中,我们提出了 MORE,一种自适应多目标强化学习框架,可共同优化推理准确性和语言自然性。我们的初步实验表明,直接将奖励与不同的优化动态混合可能会导致振荡和不稳定的学习。因此,我们不是优化单个混合奖励,而是将推理函数视为指导策略优化的约束。在推理时,系统直接生成响应,无需明确的推理步骤,同时仍受益于推理增强支架并避免额外的推理开销。为了在响应生成过程中更好地平衡语言目标,我们引入了一种自适应多重奖励机制,该机制聚合流畅性和自然度等信号,并通过梯度反馈动态重新权衡它们。我们在字节跳动和 MultiWOZ 2.2 基准测试中对两个现实世界的对话系统进行了 MORE 评估,其表现始终优于强大的基准。在为期 14 天的字节跳动生产流量线上实验中,MORE 总体提升了 16.53% 和 30.09% 的转化,同时提高了用户满意度并降低了切换率。值得注意的是,在人机比较中,MORE 恢复了人工代理实现的增量转化提升的约 60%。