论文

MINCE:经少模型蒙特卡洛校准收缩LLM评估数据集

MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration

模型评测评测方法与指标

摘要

跨许多模型变体(量化、微调或部署专用)评估LLM需要重复运行大型基准——在NPU等边缘硬件上每模型可能耗时数十小时。既有子集选择方法降低该成本——但依赖大型校准池或学习到的预测层。我们介绍MINCE(蒙特卡洛知情N值确定法用于紧凑评估):在一小组校准模型的逐题日志上做蒙特卡洛仿真——找到约束准确率漂移的最小子集规模——然后固定该规模的随机抽样子集——无需预测层。MINCE将IFEVAL缩减54%、MMLU缩减89%、GSM8K缩减70%——BF16模型上最大漂移≤2.62pp、留出NPU模型上平均漂移0.77-3.59pp——同时带来GPU评估2.7-8.1倍与NPU评估1.7-2.0倍的中位加速。该方法对校准池规模稳健——并以少57倍的校准模型取得低于tinyBenchmarks的漂移(MMLU低12倍、GSM8K低3.3倍)。

MINCE:经少模型蒙特卡洛校准收缩LLM评估数据集:论文配图
图 1:MINCE 管道概述。 KK 模型中的每项日志用于通过蒙特卡罗模拟识别 n*n^{*}。在 n*n^{*} 处,三种经过测试的采样策略(均匀、分层、k 均值)产生可比的漂移,允许 MINCE 默认使用随机采样。最终输出是比原始值小的冻结评估子集。