论文

用于多方对话生成的话语连贯性和响应引导的上下文重写

Discourse Coherence and Response-Guided Context Rewriting for Multi-Party Dialogue Generation

模型训练偏好优化

摘要

先前关于多方对话生成的研究主要利用对话中固有的结构信息来直接告知生成过程。然而,对话中普遍存在的口语表达和不完整话语往往会阻碍理解并削弱对话结构表征的保真度,这在多方对话中尤其明显。在这项工作中,我们提出了一种新颖的框架 DRCR(话语连贯性和响应引导的上下文重写),以通过对话上下文重写来改进多方对话生成。具体来说,DRCR 采用两个互补的反馈信号,即话语连贯性和响应质量,来构建上下文重写和响应生成的偏好数据。此外,我们提出了一种动态的自我进化学习方法,允许重写者和响应者通过迭代训练循环中的相互交互来不断增强他们的能力。在四个多方对话数据集上进行的综合实验证实了 DRCR 的有效性。