论文

我们能信任项目反应理论做AI评估吗

Can We Trust Item Response Theory for AI Evaluation?

模型评测评测方法与指标

摘要

AI基准日益利用项目级统计模型——特别是项目反应理论(IRT)——估计模型能力、排名系统、选择有信息量的样例并诊断基准质量。但AI基准数据常偏离人类测试的数据regime——标准IRT估计工具最初为此开发:基准通常涉及更少的受评模型、远多的题目、以及可能偏斜、聚类或多峰的能力分布。我们考察这些regime失配如何挑战IRT建模在AI评估中的可靠性。使用从六个广泛使用的LLM基准导出的项目参数与能力分布,我们在三种常见IRT模型下仿真响应矩阵,并比较近期基准研究使用的四种估计工具:边际最大似然、马尔可夫链蒙特卡洛、变分推断与神经伪孪生估计器。跨18,000个仿真条件:我们系统评估计算可行性、可扩展性、以及IRT对模型排名、预测表现与项目特征推断的可靠性。结果显示:经典估计器在大基准设定下可能不可行,而可扩展估计器在模型集小或非正态分布时可能产生不可靠的项目级与排名推断。本研究识别潜特质模型何时可靠支撑AI基准声明、何时有扭曲之险,以及可信使用所需的样本量与诊断。

我们能信任项目反应理论做AI评估吗:论文配图
图 1:人类测试和人工智能基准测试之间数据机制不匹配的图示。能力分布是在第 2 节中的 OpenLLM 响应矩阵上使用 2PL 进行估计的。 4.1.