论文

超越分数:基于细粒度能力的LLM诊断式评估

Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities

模型评测评测方法与指标

摘要

当前对大语言模型的评估将跨多样任务的性能聚合为单一分数。这掩盖了细粒度的能力差异,限制了针对性的模型改进以及面向特定任务的能力引导选择。受这一缺口启发,我们提出一个认知诊断框架,在多个细粒度维度上估计模型能力。在数学领域,我们构建了一个以认知理论与领域知识为基础的35维能力分类体系。该框架采用多维项目反应理论(Item Response Theory, IRT)结合题目-能力关联矩阵来估计细粒度能力水平,进而支持对未见题目(基准中的问题)表现的预测。在41个模型上的评估表明,我们的方法具有很强的效标效度、跨基准一致的能力估计,以及对未见题目的准确预测:基准内AUC为0.80至0.89,跨基准AUC为0.77至0.86,大幅超过简单基线。该框架可泛化到多个科学领域,在物理学(27维)、化学(58维)和计算机科学(12维)上取得一致的诊断表现。这项工作建立了一个有原则的细粒度能力评估框架,在针对性训练、能力引导的模型选择和能力感知的基准设计方面具有潜在应用。

超越分数:基于细粒度能力的LLM诊断式评估:论文配图
图2:细粒度能力评估框架架构。该框架包括三个阶段: (a) 响应矩阵构建,在基准上评估模型以生成二元模型-项目响应矩阵; (b) 关联矩阵构建,通过专家注释和先验知识将每一项基准映射到细粒度的能力(例如领域知识或认知过程),形成Q矩阵; (c) 细粒度能力评估,其中认知诊断模型通过联合分析响应和关联矩阵来估计潜在能力概况。