论文

PRISMA:用于可解释的情商谈判对话的偏好强化自我训练方法

PRISMA: Preference-Reinforced Self-Training Approach for Interpretable Emotionally Intelligent Negotiation Dialogues

模型训练偏好优化

摘要

情感在塑造谈判结果、影响信任、合作和长期关系方面发挥着关键作用。因此,开发能够识别情绪并策略性响应的谈判对话系统对于创建更有效的以人为本的互动至关重要。除了产生情感上适当的反应之外,可解释性——理解系统如何产生特定的情绪感知反应,对于培养可靠性和建立融洽关系至关重要。在这些方面的驱动下,在这项工作中,我们引入了 PRISMA,一个可解释的情感智能谈判对话系统,针对两个应用领域,即。工作面试和资源分配。为了实现可解释性,我们提出了一种基于情绪感知的谈判策略的思维链(ENS-CoT)推理机制,该机制通过感知、理解、使用和管理情绪来模仿人类谈判。利用 ENS-CoT,我们策划了两个新数据集:JobNego(用于工作面试谈判)和 ResNego(用于资源分配谈判)。然后,我们利用这些数据集通过直接偏好优化 (DPO) 增强自我训练来开发 PRISMA,引导代理做出更准确、可解释且情感上适当的谈判响应。对 JobNego 和 ResNego 数据集的自动和人工评估表明,PRISMA 极大地增强了可解释性并生成适当的情绪感知响应,同时提高了整体谈判效率。