论文

SoCRATES:迈向主动LLM调解的可靠自动评估

SoCRATES: Towards Reliable Automated Evaluation of Proactive LLM Mediation across Domains and Socio-cognitive Variations

模型评测基准与评测资源

摘要

评估大语言模型调解员仍然具有挑战性,因为调解是由争议者不断变化的情绪、意图和背景塑造的实时轨迹。现有的测试平台依赖于一些专家撰写的领域,主要改变战略姿态,并对每个主题的每个回合进行评分,从而引入偏离主题的噪音。我们推出了 SoCRATES,这是一个在现实的多领域测试平台中评估主动 LLM 中介者的基准。它通过跨八个领域的代理管道构建真实冲突场景,探索五个社会认知适应轴(战略姿态、政党组成、历史长度、情绪反应和文化认同),并仅在通过主题本地化评估器推进每个主题时对每个主题进行评分。评估器与人类专家的一致性达到 0.82,比每轮基线增加了一倍多。通过对八个前沿大语言模型进行基准测试,我们发现,即使是最强大的调解者,在多样化和现实的测试平台下也只能缩小约三分之一的未经调解的共识差距,其表现因社会认知轴而存在巨大差异,这突显了进步在于社会对不同条件的适应。

SoCRATES:迈向主动LLM调解的可靠自动评估:论文配图
图 1:SoCRATES 概述:主体场景策划以真实冲突中的场景为基础,社会认知探索沿五个轴扩展场景以暴露调解者失败的地方,主题本地化评估通过三个指标对每个轨迹进行评分,以量化调解者的贡献。