论文
MINCE:经少模型蒙特卡洛校准收缩LLM评估数据集
MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration
摘要
跨许多模型变体(量化、微调或部署专用)评估LLM需要重复运行大型基准——在NPU等边缘硬件上每模型可能耗时数十小时。既有子集选择方法降低该成本——但依赖大型校准池或学习到的预测层。我们介绍MINCE(蒙特卡洛知情N值确定法用于紧凑评估):在一小组校准模型的逐题日志上做蒙特卡洛仿真——找到约束准确率漂移的最小子集规模——然后固定该规模的随机抽样子集——无需预测层。MINCE将IFEVAL缩减54%、MMLU缩减89%、GSM8K缩减70%——BF16模型上最大漂移≤2.62pp、留出NPU模型上平均漂移0.77-3.59pp——同时带来GPU评估2.7-8.1倍与NPU评估1.7-2.0倍的中位加速。该方法对校准池规模稳健——并以少57倍的校准模型取得低于tinyBenchmarks的漂移(MMLU低12倍、GSM8K低3.3倍)。
