论文
偏好树优化:通过前瞻模拟增强面向目标的对话
Preference Tree Optimization: Enhancing Goal-Oriented Dialogue with Look-Ahead Simulations
摘要
开发能够进行多回合、面向目标的对话的对话系统仍然是一个重大挑战,特别是在数据有限的专业领域。这项研究提出了一种名为“偏好树优化”(PTO) 的新颖框架,旨在通过使用一种名为“前瞻偏好树”的方法生成偏好数据,迭代改进此类对话系统中的代理模型。专注于动机访谈(MI)——一种旨在促进行为改变的咨询技术——我们利用虚拟患者和预言评估器来模拟对话并生成丰富的偏好数据集。通过将此方法与直接偏好优化(DPO)相结合,我们的目标是在迭代训练周期中增强智能体的决策能力。拟议的框架解决了数据稀缺问题,并促进了目标导向领域中更细致、更有效的对话系统的开发。实验评估表明,PTO 框架提高了对话代理在动机访谈 (MI) 领域内以目标为导向的对话中的表现。使用 PTO 训练的模型在会话满意度和工作联盟等关键指标上始终优于基线。此外,结合前瞻模拟可以改进长期规划和更有效的对话策略,更深入的前瞻配置可以产生最稳定和高分的结果。