论文

通过非暴力通信限制减少 大语言模型 对话中的对话升级

Reducing Conversational Escalation in Large Language Model Dialogue with Nonviolent Communication Constraints

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地用于涉及人际冲突、沮丧和痛苦的情绪激动的情况。虽然之前的安全研究主要集中在防止有毒或违反政策的内容等明显伤害,但很少关注可能无意中加剧冲突的对话行为。在本文中,我们研究是否可以通过非暴力沟通(NVC)派生的轻量级提示级别约束来引导 LLM 走向更加降级的对话行为。我们将 NVC 原则重新表述为以流程为导向的指导方针,不鼓励指责,强调对用户情感体验的关注,并鼓励在建议之前进行澄清。使用跨多个指令调整模型和用户阻力级别的双代理模拟框架,我们表明,NVC 约束的提示始终可以减少对话升级并稳定与高阻力用户的交互。这些结果表明,简单的通信约束可以有意义地提高 LLM 对话在易发生冲突的环境中的可信度。