论文
DIPLOMAT:对话跨度感知直接偏好优化,用于礼貌有说服力的工作场所谈判对话
DIPLOMAT: Dialogue-Span-Aware Direct Preference Optimization for Polite Persuasive Workplace Negotiation Dialogues
摘要
有效的工作场所谈判需要平衡多个目标,包括实现任务目标、维护专业关系以及建设性地解决冲突。然而,误解、偏好不一致和人际摩擦往往会阻碍成功的结果。礼貌通过促进信任、减少紧张和防止升级来缓解这些挑战,而说服性沟通则有助于克服阻力、调整偏好并引导参与者达成互惠互利的协议。受这些见解的启发,我们推出了 DIPLOMAT,这是一种用于礼貌和有说服力的工作场所谈判的对话系统。为了支持其发展,我们引入了 PROWESS,这是一个通过多代理框架生成的多回合工作场所谈判对话数据集,并丰富了谈判策略、礼貌水平和说服策略。 DIPLOMAT 使用对话跨度感知直接偏好优化 (DSA-DPO) 进行训练,这是一种新颖的偏好学习目标,可识别关键对话跨度以进行偏好调整。这使得 DIPLOMAT 能够生成上下文连贯的响应,采用预期的谈判策略,保持礼貌,并在整个互动过程中纳入有效的说服策略。对 PROWESS 的自动和人工评估证实,DIPLOMAT 在生成连贯、礼貌和有说服力的谈判响应方面始终优于基线。