论文

大语言模型的高效序贯评估

Efficient Sequential Evaluation of Large Language Models

模型评测评测方法与指标

摘要

我们研究使用先前 LLM 的历史表现数据在固定问题集上序贯评估新 大语言模型 (LLM) 的问题。我们的目标是为模型在该问题集上的能力构建置信序列(CS),并设计主动查询规则来尽快缩小 CS 宽度。对于 CS 构建,我们反转一系列测试上鞅并重点关注两种代表性方法:基于反向信息投影 (RIPr) 的方法和基于投注测试的方法。我们首先在预言机环境下研究这些方法,并证明基于 RIPr 的构建的预言机最优性。然后,我们提出一种面向增长的查询规则,旨在最大化当前 CS 端点的最坏情况一步预期对数增量。在实践中,我们根据从历史数据中学习到的问题级正确性的预测来构建这些测试上鞅和查询规则。然后,我们分析了生成的 CS 的收缩行为,并确定了减缓 CS 收缩率的两个关键因素:累积的预测不匹配和查询分布的尖峰。最后,受此分析的启发,我们提出了几种混合查询规则,结合了面向增长的查询、预测细化和统一探索,试图减轻减缓收缩率的影响。我们提供了实验,比较了多个综合测试数据集中基于 RIPr 和基于投注测试的 CS 的不同查询规则。有趣的是,我们观察到最简单的查询规则(均匀采样)有时可以优于这两种方法的更具适应性的查询规则。