论文

通过低秩分解进行 LLM 评估的有效最佳模型识别

Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

模型评测评测方法与指标

摘要

为固定基准选择最佳的 大语言模型 (LLM) 通常成本高昂,因为详尽的评估需要在每个示例上运行每个模型。多臂老虎机 (MAB) 算法可以通过顺序选择下一个模型示例对进行评估来减少 LLM 调用的数量,从而避免对明显表现不佳的模型进行浪费评估。通过使用低秩分解从部分观察的模型示例得分矩阵预测模型得分,可以进一步节省成本。然而,此类预测并非 真值:它们可能存在偏差,因此可能导致最佳模型的错误识别。在这项工作中,我们提出了一个原则框架,将 MAB 与廉价的预测分数相结合,而不影响统计有效性。具体来说,我们得出每个模型性能的双稳健估计器,使用低秩预测来减少方差。这使得能够在我们的设置中构造有效的有限样本置信区间,其中自适应地选择模型并且对示例进行采样而无需替换。现实世界基准的实证结果表明,我们的方法减少了所需评估的数量,在计算和成本方面产生了有意义的节省,同时准确地识别了性能最佳的模型。