论文

使用 SySR 降低 LLM 评估成本:一种可证明利用模型相似性的 Bandit 算法

Cutting LLM Evaluation Costs with SySRs: A Bandit Algorithm that Provably Exploits Model Similarity

模型评测评测方法与指标

摘要

大语言模型 通常通过评估每个测试查询的每个模型来进行基准测试。对于寻求最佳部署模型的从业者来说,这通常是浪费的:如果一个模型的性能明显比其他模型差,则无需精确估计其性能。可以自然地应用最佳臂识别算法,通过自适应分配评估预算来大幅降低成本。此外,语言模型通常对相同的提示做出类似的反应——之前的工作试图利用这一特性,但取得了不同程度的成功。我们提出同步连续拒绝(SySRs),通过配对比较增强经典的连续拒绝算法。与之前在最佳模型识别中利用模型相似性的尝试不同,我们的方法是无超参数的,并且具有随着评估模型之间的相似程度而提高的性能保证。根据经验,我们的方法在 15 个标准基准的平均错误率方面以及在可靠识别最佳模型的最坏情况预算方面优于所有基线。