论文

基于近似Neyman分配的大语言模型主动测试

Active Testing of Large Language Models via Approximate Neyman Allocation

模型评测评测方法与指标

摘要

大语言模型(LLM)从预训练到测试时扩展都需要可靠评估,这使评估成为一项经常性而非一次性的成本。随着模型规模增长以及目标任务日益依赖专家标注者,每次评估所需的算力与标注成本都迅速上升。主动测试旨在通过从评估池中选取一个小而信息量大的子集来近似评估结果,从而缓解这一瓶颈。然而,现有方法主要针对分类任务,在生成式任务上会失效。我们提出一种专为生成式任务设计的新型主动测试算法。我们的方法利用代理模型的语义熵对评估池进行分层,然后基于从这些代理模型提取的信号执行近似Neyman分配。在多个语言与多模态基准以及多组代理—目标模型对上,我们的方法显著优于基线并紧贴Oracle-Neyman,相比均匀采样最多可将MSE降低28%,平均节省22.9%的预算。

基于近似Neyman分配的大语言模型主动测试
图 1:四个基准的性能比较,标签预算 M M = 70(MSE;越低越好)。我们的方法优于均匀采样基线,并且非常接近 Oracle-Neyman(理论最优),在不同模式、多个基准以及代表性 Qwen 和最先进的 GPT 模型中产生一致的增益。