论文
基准可靠吗?通过样本级能力边界进行结构诊断
Are Benchmarks Reliable? Toward Structural Diagnosis via Sample-Level Capability Boundaries
摘要
评估大语言模型 (LLM) 在很大程度上依赖于基准分数,但聚合指标可能会掩盖基准样本是否可靠地支持模型比较。我们引入了 \textbf{BSDProbe},这是一个用于 \emph{基准结构诊断} 的样本级框架,它根据沿着有序模型轴的重复响应轨迹估计能力边界。 BSDProbe 通过边界位置、边界宽度、边界信号有效性和顺序一致性来总结样本,然后将它们聚合成基准级结构概况。六个基准测试的实验表明,基准可靠性是轴条件的和异构的:GSM8K和MATH表现出最稳定的测量结构,MMLU和TriviaQA相对稳定但异构,而GPQA和PopQA表现出更强的轴条件风险。这些配置文件在 Qwen3、Qwen2.5 和跨模型轴上保持一致。 BSDProbe 进一步选择紧凑的高价值子集,其模型辨别力达到完整基准的 8.58 倍\倍$。这些结果表明,可靠的基准测试使用需要检查排行榜分数之外的样本级别能力边界。