论文

DLawBench:通过多轮法律咨询评估LLM

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

模型评测基准与评测资源

摘要

律师与委托人咨询是法律服务的重要起点。有效的法律援助取决于从客户那里获取充分和真实的信息,以便制定最能保护其利益的策略。这项任务要求大语言模型(LLM)不仅能够进行稳健的法律推理,还需要通过多轮交互有策略地引出重要事实,并有效引导不同性格的客户。然而现有的法律基准忽视了这种互动能力。为了填补这一空白,我们推出了 DLawBench,一个用于现实世界法律咨询的诊断基准。根据现实的客户行为,我们将律师与客户的互动分为四种类型:合作型、依赖型、退缩型和对抗型。 DLawBench通过基于真实案例的对话,评估LLM能否在现实条件下有效开展法律咨询。 DLawBench包含461个中国和美国法律案例、5,532个配对事实条目、3,411个查询量规和3,348个问题解决量规,并评估了26个有代表性的LLM。系统实验显示出巨大的空间:表现最好的模型 GPT-5.5 在基于咨询的法律推理上仅达到 0.562。更重要的是,DLawBench 暴露了法律咨询中的阿谀奉承和悖论:当客户最需要指导时,模型表现更差。