论文

EuroExec:前沿语言模型达不到欧洲行政决策任务的专家判断

EuroExec: Frontier Language Models Fall Short of Expert Judgment on European Executive Decision Tasks

模型评测基准与评测资源

摘要

Frontier LLM 越来越多地用于开放式复杂问题,其性质与通常评估的问题不同。我们投入了 4,000 多个人类专家时间来评估此类问题中精选的 6 个前沿 LLM:EuroExec,我们推出的基于人类专家的基准,由 47 名经过审查的领域专家撰写的 413 个开放式长格式欧洲执行任务组成,每个问题都来自真实案例的经验。每个响应都通过多属性评分标准、特定于项目的要求清单和偏好排名顺序进行手动评估,提取聚合指标“解决率”。最强的模型只能解决 56.9% 的任务,而盲目判断的专家编写的参考答案的解决率接近上限,并且在 74% 的直接排名中比每个模型答案都更受欢迎,这使得前沿生成系统远低于它们已经使用的专业工作标准。我们发现,提取此类结论的最佳方法是雇用人类评估者,通过严格的统计分析仔细检查其一致性,并观察到在使用主观 真值 评估现实世界开放式问题的情况时,自动测量也存在不足。