论文
LexRubric:开放式法律任务的评分标准引导诊断基准
LexRubric: A Rubric-Guided Diagnostic Benchmark for Open-Ended Legal Tasks
摘要
随着 大语言模型 (LLM) 越来越多地应用于现实世界的法律任务,评估其开放式法律回应的可靠性变得至关重要。这些任务需要上下文相关的答案,并且不允许出现任何错误,从而激发细粒度的诊断评估,从而识别响应质量失败的特定来源。我们引入了 LexRubric,这是一个基于评分标准的基准,用于评估开放式中国法律任务。 LexRubric包含649个来自法律咨询和司法审查的实例,既反映日常法律需求,又反映专业法律推理,涵盖14个法律场景。它还包括在统一的六维框架下组织的 12,337 个专家编写的原子评分标准,从而实现跨任务和评估维度的准确评估和诊断分析。为了验证评估的可靠性,我们测试了多个判断模型,并将基于模型的判断与人类判断进行比较。我们在 LexRubric 上进一步评估了 18 个最近的通用和合法域 LLM。结果表明,不同的模型表现出不同的能力概况,并且开放式法律任务对于当前的 LLM 仍然具有挑战性。数据可在以下网址获取:https://github.com/foggpoy/LexRubric。