论文

MÖVE:德国公共部门的整体 LLM 基准

MÖVE: A Holistic LLM Benchmark for the German Public Sector

模型评测基准与评测资源

摘要

我们推出 MÖVE(Modelle für die Öffentliche Verwaltung Evaluieren),这是在德国公共部门背景下评估 大语言模型 (LLM) 的整体基准。虽然 LLM 在公共管理中越来越多地采用,但模型选择在很大程度上仍然是临时的,现有基准提供的指导有限:它们主要以英语为中心,内容以美国为中心,并且只关注任务绩效。 MÖVE 通过评估两个互补维度的 39 个模型来弥补这些差距。绩效标准包括总结、问答和主题提取。治理标准评估幻觉倾向、能源消耗、供应商透明度以及与德国宪法价值观和对德国政党立场的了解的一致性。总的来说,我们利用了十个德语数据集,包括我们为反映公共管理领域而构建的金标准和银标准数据集。我们采用多指标评估策略,结合经典 NLP 指标、基于嵌入的方法和 LLM-as-a-judge 方法。我们的结果表明,没有一个模型能够在所有标准中占据主导地位:表现最佳的人在任务之间存在差异,并且模型大小本身并不能很好地预测质量。我们进一步评估基准本身,分析其统计精度、LLM 判断可靠性、我们的私人数据集对模型排名的影响、我们的结果对提示制定的敏感性以及我们的能源消耗估计的有效性。 MÖVE 被设计为积极开发中的生活标杆;结果可在 https://moeve.bundesdruckerei.de/ 上公开获取。