论文
Benchmark Health Index:对LLM基准进行基准评测的系统性框架
Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs
摘要
大语言模型(LLM)正快速进步,然而用于衡量这一进步的基准却日益不可靠。分数通胀与选择性报告侵蚀了标准基准的权威性,使社区对哪些评估结果仍然可信感到不确定。我们提出基准健康指数(Benchmark Health Index,BHI),一个纯数据驱动的框架,沿三个正交且互补的轴对评估集进行审计:(1)能力区分度,衡量基准在噪声之上区分模型性能的锐利程度;(2)抗饱和性,估计在天花板效应侵蚀分辨率之前剩余的提升空间,即基准的预期寿命;(3)影响力,通过采用广度与实践塑造力量化其在学术与产业生态中的影响。通过从2025年91个代表性模型的技术报告中提炼出106个经验证的基准,我们系统性地刻画了评估格局。BHI是首个在宏观层面量化基准健康度的框架,为基准选择提供了有原则的依据,并使下一代评估协议的动态生命周期管理成为可能。
