论文
UP-NRPA:面向目标导向对话系统中大语言模型规划的用户画像嵌套Rollout策略自适应
UP-NRPA: User Portrait based Nested Rollout Policy Adaptation for Planning with Large Language Models in Goal-oriented Dialogue Systems
摘要
为解决当前对话策略规划方法难以动态适应多样化用户特征的挑战,本文提出结合大语言模型的基于用户画像的嵌套Rollout策略自适应(UP-NRPA)在线框架。与传统依赖模型训练、需要为用户群体配备离线强化学习策略模型的方法不同,UP-NRPA通过自适应机制实现对话策略的动态定制。其实现方式是利用实时用户反馈以及从当前用户画像映射出的人格、偏好与目标,从而无需离线强化学习即可适应用户特征。在协作与非协作对话基准上,UP-NRPA展现出可观的收益,在多个对话任务中达到令人瞩目的100%成功率。尤其在谈判任务中,成交价与挂牌价之比(sale-to-list ratio,SL)提升了56.41%。这表明UP-NRPA无需训练机制即可适应多样化用户需求,使对话系统能够适应用户特征。
