论文
LP-Eval:用于衡量法律命题生成质量的量规和数据集
LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation
摘要
法律命题生成是法律推理和理论学术的核心,但在法律 NLP 中仍然没有得到充分研究。本文研究了使用 大语言模型 (LLM) 根据欧盟法院的判决自动生成和评估法律命题。我们引入了 LP-Eval,这是与法律专家共同设计的三步评估标准,将法律命题质量分解为形式有效性和实质性维度。使用此标题,我们发布了两位专家对 100 个 LLM 生成的法律命题的注释的数据集。我们的结果表明,LLM 可以生成主要格式良好且高质量的命题,而专家评估显示,从成熟案例中得出的命题质量高于从最近案例中得出的命题。我们进一步检查 LLM 作为评估者,发现以标题为指导的 LLM 判断与专家评估比直接总体评分更接近,但对人类专家捕获的更细粒度的区别仍然不敏感。