论文
测量五个九的可靠性:饱和基准中的样本效率 LLM 评估
Measuring Five-Nines Reliability: Sample-Efficient LLM Evaluation in Saturated Benchmarks
摘要
虽然现有的基准测试证明了 大语言模型 (LLM) 在各种任务上近乎完美的性能,但这种明显的饱和往往掩盖了对其可靠性进行严格评估的需要。然而,在实际部署中,实现极高的可靠性(例如,“五个九”(99.999%) 与“三个九”(99.9%))至关重要,因为这种差距会导致故障数量级的增加,这对于可靠性关键的应用程序来说是灾难性的。尽管如此,在严格的置信范围内估计这种罕见的故障概率需要非常大的 LLM 推理大小,这使得标准蒙特卡罗评估在有限的计算预算下不可行。在本文中,我们观察到 LLM 故障表现出强大的系统模式:在广泛的参数化输入空间中,一小部分输入不成比例地占大多数故障。利用这一观察结果,我们建议通过交叉熵方法(CEM)学习集中于易于失败的输入的采样分布。我们在三个 LLM、Qwen2.5-Math-7B-Instruct、gpt-oss-20b-low 和 Gemini 2.5 Flash Lite 上跨参数化 GSM8K 模板评估我们的框架,与朴素均匀采样相比,所需推理量减少了 156.22 倍。我们的估计表明,在标准基准上具有无法区分的准确性的模型在估计故障率方面可能存在很大差异,这强调了可靠性是模型质量的一个独特且可测量的轴。我们简单而实用的框架可以在 LLM 中评估极端可靠性,这是一个超越现有基准的独特且尚未开发的评估维度,因为它们在可靠性敏感的应用中越来越多地使用。