论文

ProMediConv:法律纠纷调解中主动对话代理的基准测试

ProMediConv: Benchmarking Proactive Conversational Agents in Legal Dispute Mediation

智能体系统Agent任务评测

摘要

纠纷调解对于维持社会和谐和复原力至关重要,但培养熟练的调解员成本高昂且耗时。现有的基于 LLM 的中介研究仍然受到不切实际的任务公式、低保真度数据集和模糊逐轮动态的粗略评估指标的限制。为了解决这些差距,我们引入了 ProMediConv,这是一种新颖的基准测试框架,它将调解建模为主动、多阶段、当事人意识的对话过程,包含 11 种调解策略和四种当事人行为模式 (BP) 状态。使用 972 个完整的现实案例,我们构建了一个高保真中介数据集,其中包含策略和 BP 状态的话语级注释。此外,为了更好地评估代理的影响,我们提出了 MAD(平均属性差异),这是一种细粒度的指标,可以捕获整个对话过程中的 BP 变化。利用这个框架,我们通过评估不同的模型以及我们定制的基线 ProMediAgent 来建立全面的基准。广泛的实证分析揭示了关键的行为现象,并强调了当前模型在动态多方调解中面临的持续挑战。最终,ProMediConv 为推进人工智能辅助冲突解决提供了严格的基础和重要的定量标准。我们的数据集和代码库可在 https://github.com/ZsWei66/ProMediConv_repo 访问。