论文

知道何时停止:用于LLM评估的贝叶斯最优停止

Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

模型评测评测方法与指标

摘要

LLM评估通常使用固定采样预算,即使估计已经足够精确,也对每个项目重复测试相同次数。我们提出optstop,一个基于精度的自适应停止框架,它将评估视为序贯测量问题:在不确定性仍然高的地方继续采样,在估计足够精确或稳定的地方停止。该框架建立在分层贝叶斯推断之上,支持二值、有序和连续结果,并保持每个基准项目都有被采样的资格,无需校准过的题库。它可实时或回顾式运行,并包含一个安全机制:当测得性能接近零(此时罕见成功最为关键)时更加谨慎地采样。在一个示例性的200项、10轮评估中,该框架在九个验证设置中去除57%–97%的计划试验,而总体结论与完整运行等价。这些结果表明,LLM评估算力可以按不确定性而非固定重复次数来分配,节省幅度取决于评估设计。

知道何时停止:用于LLM评估的贝叶斯最优停止:论文配图
图1:评估数据的层级嵌套结构示例。取自 [24]。