论文

BenGER Platform:用于德国法律任务端到端基准测试的协作网络平台

BenGER Platform: A Collaborative Web Platform for End-to-End Benchmarking of German Legal Tasks

模型评测基准与评测资源

摘要

评估 大语言模型 (LLM) 的法律推理需要涵盖任务设计、专家注释、模型执行和基于指标的评估的工作流程。在实践中,这些步骤跨平台和脚本划分,限制了透明度、可重复性和非技术法律专家的参与。我们提出了 BenGER(德国法律基准)框架,这是一个开源 Web 平台,集成了任务创建、协作注释、可配置的 LLM 运行以及词汇、语义、事实和基于判断的指标的评估。 BenGER 支持具有租户隔离和基于角色的访问控制的多组织项目,并且可以选择向注释者提供形成性的、基于参考的反馈。我们将演示实时部署,展示端到端基准测试创建和分析。