论文
超越分数:基于细粒度能力的LLM诊断式评估
Beyond Scores: Diagnostic LLM Evaluation via Fine-Grained Abilities
摘要
当前对大语言模型的评估将跨多样任务的性能聚合为单一分数。这掩盖了细粒度的能力差异,限制了针对性的模型改进以及面向特定任务的能力引导选择。受这一缺口启发,我们提出一个认知诊断框架,在多个细粒度维度上估计模型能力。在数学领域,我们构建了一个以认知理论与领域知识为基础的35维能力分类体系。该框架采用多维项目反应理论(Item Response Theory, IRT)结合题目-能力关联矩阵来估计细粒度能力水平,进而支持对未见题目(基准中的问题)表现的预测。在41个模型上的评估表明,我们的方法具有很强的效标效度、跨基准一致的能力估计,以及对未见题目的准确预测:基准内AUC为0.80至0.89,跨基准AUC为0.77至0.86,大幅超过简单基线。该框架可泛化到多个科学领域,在物理学(27维)、化学(58维)和计算机科学(12维)上取得一致的诊断表现。这项工作建立了一个有原则的细粒度能力评估框架,在针对性训练、能力引导的模型选择和能力感知的基准设计方面具有潜在应用。
