论文

通过贝叶斯 Bandit Gittins 指数进行高效的成本意识 LLM 评估

Efficient Cost-Aware LLM Evaluation via Bayesian Bandit Gittins Indices

模型评测评测方法与指标

摘要

在每个基准项目上详尽地评估每个候选大语言模型配置以确定一个高性能的配置是昂贵的。我们将配置选择制定为成本感知的贝叶斯强盗问题,并提出 GittinsEval,它利用贝叶斯最优 Gittins 策略来确定下一步要评估哪个配置以及何时停止。我们在完全评估和部分评估的配置上使用随时推荐规则来扩展策略,并使用 LCB 式评分来解释后验不确定性。 GittinsEval 计算效率高,离线预计算后只需要轻量级在线更新。在 GSM8K、PIQA、AlpacaEval 和 MMLU 响应矩阵中,GittinsEval 始终具有竞争力,在大型示例基准测试上比配置级贝叶斯优化以及在大型候选任务上的成本不敏感的老虎机基线上取得了特别显着的进步。至关重要的是,GittinsEval 通常仅使用 1% 到 2% 的详尽评估成本即可实现接近于零的简单遗憾;它还提供自适应停止规则,通常在 1% 到 10% 时触发。