论文

Benchmark Health Index:对LLM基准进行基准评测的系统性框架

Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs

模型评测评测方法与指标

摘要

大语言模型(LLM)正快速进步,然而用于衡量这一进步的基准却日益不可靠。分数通胀与选择性报告侵蚀了标准基准的权威性,使社区对哪些评估结果仍然可信感到不确定。我们提出基准健康指数(Benchmark Health Index,BHI),一个纯数据驱动的框架,沿三个正交且互补的轴对评估集进行审计:(1)能力区分度,衡量基准在噪声之上区分模型性能的锐利程度;(2)抗饱和性,估计在天花板效应侵蚀分辨率之前剩余的提升空间,即基准的预期寿命;(3)影响力,通过采用广度与实践塑造力量化其在学术与产业生态中的影响。通过从2025年91个代表性模型的技术报告中提炼出106个经验证的基准,我们系统性地刻画了评估格局。BHI是首个在宏观层面量化基准健康度的框架,为基准选择提供了有原则的依据,并使下一代评估协议的动态生命周期管理成为可能。

Benchmark Health Index:对LLM基准进行基准评测的系统性框架
图2:BHI 框架概览。上排:当前基准的三个关键挑战:判别力减弱、性能驱动的饱和,以及基准影响力与现实世界性能的脱节。中排:我们提出三个数据驱动的指标:能力判别(Capability Discrimination, S D ​ i ​ s ​ c S_{Disc} )量化基准的敏感性,抗饱和(Anti-Saturation, S A ​ S S_{AS} )评估挑战余量,影响力(Impact, S I ​ m ​ p S_{Imp} )衡量模型被真实识别的程度。下排:最终的 BHI 分数通过客观加权机制合成。