论文
基准并非单一的:LLM 评估的样本级审核和编排
Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation
摘要
基准数据集是评估 大语言模型 (LLM) 的核心,但它们通常被视为整体任务,掩盖了单个样本需求的实质性变化。我们引入了一个以数据集为中心的元评估框架,该框架在样本级别上沿着五个潜在维度审核基准数据集:1.认知和知识需求,2.语言和内容质量,3.任务属性,4.上下文,以及5.道德、安全和公平。应用这个框架,我们注释了五个有影响力的基准——MMLU、ARC、WinoGrande、HellaSwag 和 TruthfulQA——揭示了聚合准确度分数未捕获的明显的内部异质性。我们展示了这些注释如何实现跨数据集的复合基准子集的标准驱动编排,支持对模型功能(例如推理深度或道德敏感性)的有针对性的评估。这种方法将基准评估重新构建为数据集内省,为分析和重新构建现有基准提供了原则性方法,以更好地反映不同的评估需求。