论文

立场:人工智能评估科学需要项目级基准数据

Position: Science of AI Evaluation Requires Item-level Benchmark Data

模型评测基准与评测资源

摘要

人工智能评估已成为在高风险领域部署生成式人工智能系统的主要证据。然而,当前的评估范式经常表现出系统有效性的失败。如果没有收集有效性证据和进行精细诊断分析的原则框架,这些问题(从不合理的设计选择到不一致的指标)仍然很棘手。在这篇立场文件中,我们认为项目级人工智能基准数据对于建立严格的人工智能评估科学至关重要。项目级分析可以实现细粒度的诊断和原则性的基准验证。我们通过剖析当前有效性失败并重新审视计算机科学和心理测量学的评估范式来证实这一立场。通过对项目属性和潜在结构的说明性分析,我们展示了项目级数据提供的独特见解。为了促进社区范围内的采用,我们引入了 OpenEval,这是一个不断增长的项目级基准数据存储库,旨在支持以证据为中心的人工智能评估。

立场:人工智能评估科学需要项目级基准数据
图 8:HELM 中四个基准数据集的聚类,通过对 GLRM 的项目因子负载进行 K 均值聚类得出。