论文

CC-调解:评估 大语言模型 的跨文化冲突调解

CC-Mediation: Evaluating Large Language Models for Cross-Cultural Conflict Mediation

模型评测基准与评测资源

摘要

大语言模型 (LLM) 的跨文化调解需要决定何时干预以及如何应对基于文化的冲突。由于缺乏(1)具有可测量下游效应的中介数据集和(2)评估跨文化立场变化的原则性指标,该问题的进展受到限制。为了解决这些差距,我们引入了 CC-Mediation,这是一个跨文化调解基准,价值 1{,}661 美元,十轮对话,基于跨文化敏感性发展模型 (DMIS),包含基于文化的冲突、调解干预措施和干预后轨迹。我们进一步提出了两个基于 DMIS 的评估指标:轨迹 AUC(衡量跨文化改善随时间推移的持续性)和符号 Wasserstein-1 距离(衡量跨文化立场转变的幅度和方向)。这两个指标都与人类对基于 DMIS 的立场转变的判断高度一致。使用 CC-Mediation,我们发现当前的 LLM 在两个轴上都有局限性:干预时机(何时)失败源于忽略对话内容的位置先验,而调解策略(如何)失败则源于后期层引发崩溃而不是知识缺陷。