论文

PersuaRL:强化学习驱动的多专家选择,在保险领域产生有说服力的对话

PersuaRL: Reinforcement Learning-Driven Multi-Expert Selection for Persuasive Dialogue Generation in Insurance

模型训练强化学习

摘要

大语言模型 (LLM) 通过为跨客户服务、数字销售和保险等领域部署的会话代理提供支持,正在彻底改变数字通信。这些代理基于 LLM 构建,可以理解用户输入、检索相关信息并生成连贯的响应。然而,虽然他们擅长事实沟通,但他们往往缺乏进行真正有说服力的、上下文相关对话的能力,尤其是在保险等领域,信任和清晰度至关重要。基于保险领域的这一需求,我们的工作重点是提高数字代理(又名 LLM)的说服力。为了支持这一点,我们引入了 InsureDial,这是一个说服性保险对话数据集,旨在捕捉特定于汽车保险互动的说服性沟通的细微差别。我们引入了 PersuaRL,这是一种基于强化学习的框架,它使 LLM 驱动的对话代理能够在不断变化的对话环境的指导下,跨多个专家模块自适应地探索、选择和协调策略,以实现更有效的说服。我们对两个基准说服对话数据集(包括我们的 InsureDial)进行了广泛的自动人工和定性评估。我们的评估一致表明,PersuaRL 的性能优于基线,可生成适合上下文且极具说服力的响应。