论文
GradeLegal:德国法律案件自动评分
GradeLegal: Automated Grading for German Legal Cases
摘要
德国法律考试评分解决方案面临数量不断增加和合格评分员短缺的问题,导致反馈延迟并造成瓶颈。同时,这是一项高风险的专家任务,因为国家考试成绩强烈影响德国的职业发展。尽管存在这种实际意义,但文献缺乏对法律考试评分有效方法的系统研究。为了弥补这一差距,我们调查了 大语言模型 (LLM) 是否可以支持德国刑法和公法法律案件解决方案的自动评分,从而实现可扩展的反馈和学生自我测试。我们对 27 个专有和开源 LLM 进行了系统评估,对逐步添加任务相关信息(例如示例解决方案和评分标准)的激励策略进行了基准测试。使用二次加权 kappa (QWK),面向推理的 LLM 在给定示例解决方案和评分标准(高达 0.91)时可以近似公法中的专家评分,而刑法中的专家评分为 0.60,这表明刑法中的评分任务更加艰巨。除了单一模型分级之外,集成还可以将一致性比其最佳成员提高高达 0.15,并且可以提供更强大的闭源单一模型的替代方案。此外,我们的研究结果表明,有效的提示设计和模型选择对于可靠的基于 LLM 的法律考试评分是必要的。