论文
量化大语言模型评估中的构念效度
Quantifying construct validity in large language model evaluations
摘要
LLM 社区常把基准结果当作与模型通用能力同义来报告。但基准可能存在扭曲性能的问题,如测试集污染和标注者错误。我们如何知道某个基准是欲测能力的可靠指标?这一问题关乎 LLM 基准的构念效度,要求在建模和预测 LLM 性能时把基准结果与能力分开。社会科学家与计算机科学家都提出了识别基准分数背后能力的形式模型——潜在因子模型与缩放定律。然而两种技术都不能令人满意地处理构念效度。潜在因子模型忽略缩放定律,结果其提取的能力常常只是模型规模的代理。缩放定律忽略测量误差,结果其提取的能力既不可解释又对观测基准过拟合。本论文提出结构化能力模型,这是首个能从大量 LLM 基准结果中提取可解释、可泛化能力的模型。我在 OpenLLM Leaderboard 的大样本结果上拟合该模型及其两个替代方案。结构化能力在简约拟合指标上优于潜在因子模型,在分布外基准预测上优于缩放定律。这些改进之所以可能,是因为既有方法都没有以恰当方式把模型规模与能力分开:模型规模应如缩放定律那样约束能力,而这些能力应如潜在因子模型那样在测量误差范围内决定观测结果。结合这两点洞见,结构化能力在量化 LLM 评估构念效度上展现出更好的解释力与预测力。
