论文
从价值观到基准:评估荷兰语政府使用的 大语言模型
From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch
摘要
大语言模型 越来越多地被部署在政府环境中,但现有的评估框架很少能共同反映公共管理的价值观和非英语环境的语言要求。我们提出了“Grip on LLM”框架,这是与荷兰主要市政组织的领域专家合作开发的供荷兰政府使用的系统评估套件。通过顾问委员会流程、用户研究以及对公务员聊天机器人用户的调查,我们确定了六个评估维度(事实性、诚实性、社会偏见、能源消耗、成本和训练数据透明度),并将其实施到涵盖 30 多种多语言和荷兰特定模型的基准套件中。我们的结果表明,没有一个模型在所有方面都表现出色,并且权衡是不可避免的:更高的质量始终会带来更大的环境影响和财务成本,而偏见在很大程度上仍然独立于两者。我们进一步发现事实性(模型是否正确回答)和诚实性(模型是否承认它不知道的东西)受到不同属性的控制,高事实性并不意味着高度诚实。为了使这些发现对非技术受众具有可操作性,我们发布了一个可公开访问、用户友好的模型概述,专为参与政府 LLM 选择的所有利益相关者(从工程师到政策制定者)而设计。